100% gratuit · Windows 10/11 · 64 bitsFais tourner tes modèles GGUF en local, sur tes propres GPU.
Version — · Taille —
Charge n'importe quel .gguf depuis ton disque et règle l'offload GPU, le contexte et la RAM.
Répartis un seul modèle entre plusieurs GPU, en LAN ou via un réseau Tailscale chiffré.
Conversations, fichiers et projets restent sur tes PC. Rien ne part sur Internet.
Branche Kilo Code ou n'importe quel outil sur http://127.0.0.1:8000/v1.
Une app Electron qui pilote un moteur Python local (llama.cpp) sur 127.0.0.1. Rien ne sort de ton réseau.
Choisis un fichier .gguf. AION lit ses métadonnées et calcule un vrai plan VRAM/RAM à partir de la VRAM libre détectée (nvidia-smi), pas d'une estimation.
Appaire jusqu'à 4 PC via le mesh P2P (LAN ou Tailscale) et répartis un seul modèle sur tous leurs GPU.
L'API OpenAI-compatible tourne sur http://127.0.0.1:8000/v1 et se synchronise automatiquement dans la config de Kilo Code.
Modèles, chat, réseau local et API — tout au même endroit.
Génère une clé sk-aion-… par personne avec un quota horaire/journalier, pour prêter ton GPU sans partager ton accès.
Expose le chat en HTTPS ; chaque utilisateur se connecte avec sa propre clé, donc sa propre consommation.
WebSocket entre nœuds AION sur le même LAN ou Tailnet : découverte des pairs et coordination inter-PC.
Le tensor-split part de la VRAM puis se calibre sur la vitesse réelle mesurée de chaque GPU, et se met en cache (26 s une fois, 0,08 s ensuite).
DeepSeek-R1-Distill-Qwen-14B Q4_K_M (~9 Go), RTX 4070 Laptop + RTX 2070 SUPER (8 Go chacune), LAN, -c 4096.
1 PC seul
7.4–9.1 tok/s
Génération · Prefill (1021 tok) : 688 tok/s
Cluster 2 PC
21.9–22.1 tok/s
Génération · Prefill (1021 tok) : 547 tok/s
+140 à +196 % de génération avec un second GPU : le modèle ne tient pas dans une seule carte de 8 Go, donc en solo des couches partent sur le CPU.
Règle simple : uniquement si le modèle dépasse la VRAM d'un seul GPU mais tient dans la somme des GPU du cluster.
| Modèle | Taille | Solo | Cluster | Écart |
|---|---|---|---|---|
| Qwen3.5-9B | 5.6 GB | 30.9 | 29.3 | -5% |
| Gemma-4-12B | 7.0 GB | 8.9 | 22.6 | +153% |
| DeepSeek-R1-14B | 9.0 GB | 7.4–9.1 | 21.9–22.1 | +140–196% |
| Qwen3.6-27B | 16.5 GB | 2.1 | 0.11–0.19 | -82 à -95% |
Compatible OpenAI : n'importe quel SDK, curl ou Kilo Code fonctionne tel quel.
curl http://127.0.0.1:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer sk-aion-..." \
-d '{"messages":[{"role":"user","content":"hi"}]}'Un bug, une idée, une remarque ? Écris-nous depuis le site ou directement depuis AION Node.
AION Node peut envoyer les retours automatiquement avec une simple requête HTTP.
POST https://aion-node.lovable.app/api/public/feedback
Content-Type: application/json
{
"name": "Nico",
"email": "nico@mail.com",
"message": "Super appli !",
"rating": 5,
"app_version": "1.0.0",
"os": "Windows 11"
}