100% gratuit · Windows 10/11 · 64 bitsFais tourner tes modèles GGUF en local, sur tes propres GPU.
Version — · Taille —
Charge n'importe quel .gguf depuis ton disque et règle l'offload GPU, le contexte et la RAM.
Répartis un seul modèle entre plusieurs GPU, en LAN ou via un réseau Tailscale chiffré.
Conversations, fichiers et projets restent sur tes PC. Rien ne part sur Internet.
Branche Kilo Code ou n'importe quel outil sur http://127.0.0.1:8000/v1.
Une app Electron qui pilote un moteur Python local (llama.cpp) sur 127.0.0.1. Rien ne sort de ton réseau.
Choisis un fichier .gguf. AION lit ses métadonnées GGUF (y compris les architectures à attention glissante type Gemma 3/4) et calcule un vrai plan VRAM/RAM à partir de la VRAM libre détectée (nvidia-smi), pas d'une estimation.
Appaire jusqu'à 4 PC via le mesh P2P (LAN ou overlay Tailscale chiffré WireGuard) et répartis un seul modèle sur tous leurs GPU.
L'API OpenAI-compatible tourne sur http://127.0.0.1:8000/v1 et se synchronise automatiquement dans la config de Kilo Code.
Modèles, chat, réseau local et API — tout au même endroit.
Génère une clé sk-aion-… par personne avec un quota horaire/journalier (en % de ta capacité), pour prêter ton GPU sans partager ton accès.
Expose le chat en HTTPS ; chaque utilisateur se connecte avec sa propre clé, donc sa propre consommation.
WebSocket entre nœuds AION sur le même LAN ou Tailnet : découverte des pairs et coordination inter-PC.
Le tensor-split part de la VRAM puis se calibre sur la vitesse réelle mesurée de chaque GPU (plafonné à 1,5× pour éviter tout OOM), et se met en cache : 26,5 s une fois, 0,08 s ensuite.
Notre fork de llama.cpp survit à la perte d'un nœud au lieu d'abandonner tout le moteur, garde un worker en vie sur une erreur CUDA passagère, et re-vérifie son cache RPC à la lecture : ~24× moins de données au rechargement (2386 Mo à froid, 98 Mo à chaud).
Un petit modèle brouillon anticipe et le modèle cible vérifie en un aller-retour : +71,6 % quand l'acceptation dépasse ~45 %, −11 % en dessous. AION surveille l'acceptation réelle et coupe le brouillon tout seul quand il ne paie plus.
Perdre un PC ou un lien RPC ne coupe plus l'inférence : le pool se re-tarife et recharge le meilleur modèle qui tient encore, avec une fenêtre de grâce de 45 s et une reconnexion toutes les 10 s.
Dans un pool partagé, le budget quotidien de chacun découle de sa contribution réelle sur 7 jours (Go·heures de VRAM effectivement sous charge), vérifiée avant d'être créditée.
DeepSeek-R1-Distill-Qwen-14B Q4_K_M (~9 Go), RTX 4070 Laptop + RTX 2070 SUPER (8 Go chacune), LAN, -c 4096 --split-mode layer.
1 PC seul
7.4–9.1 tok/s
Génération · Prefill (1021 tok) : 688 tok/s
Cluster 2 PC
21.9–22.1 tok/s
Génération · Prefill (1021 tok) : 547 tok/s
+140 à +196 % de génération avec un second GPU : le modèle ne tient pas dans une seule carte de 8 Go, donc en solo des couches partent sur le CPU. Le prefill est légèrement plus lent en cluster (saut RPC entre couches), largement compensé.
Règle simple : uniquement si le modèle dépasse la VRAM d'un seul GPU mais tient dans la somme des GPU du cluster. En dessous, le RPC coûte pour rien ; au-dessus, tous les PC déchargent sur CPU en même temps et cumulent les deux pénalités.
| Modèle | Taille | Tient sur 1 GPU ? | Solo | Cluster | Écart |
|---|---|---|---|---|---|
| Qwen3.5-9B | 5.6 GB | oui | 30.9 | 29.3 | -5% |
| Gemma-4-12B | 7.0 GB | de justesse | 8.9 | 22.6 | +153% |
| DeepSeek-R1-14B | 9.0 GB | non | 7.4–9.1 | 21.9–22.1 | +140–196% |
| gpt-oss-20b-MXFP4 | 12.1 GB | non | 26.7–26.8 | 44–50 | +65–87% |
| Qwen3.6-27B | 16.5 GB | non (ni les deux) | 2.1 | 0.11–0.19 | -82 à -95% |
Même modèle, même split, seul l'endpoint --rpc change. Le ping est identique : c'est le chiffrement WireGuard sur le trafic tensoriel soutenu qui coûte.
| Transport | Génération | Ping |
|---|---|---|
| LAN (192.168.x.x:50052) | 46–47 tok/s | 2–3 ms |
| Tailscale (100.x.x.x:50052) | 40–42 tok/s | 2–4 ms |
AION interroge https://aionnode.org/latest.yml au lancement puis toutes les 15 minutes. L'origine est une constante codée en dur dans l'updater : ni l'app ni l'interface ne peuvent la changer.
| Format | Ce qui se passe |
|---|---|
| Installateur (.exe NSIS) | Téléchargé, vérifié SHA256, lancé — AION se ferme pour laisser l'installation se remplacer. |
| Portable .exe | Téléchargé, vérifié SHA256, affiché dans l'Explorateur : Windows verrouille le binaire en cours, remplacement manuel. |
| Archive ZIP | Téléchargé, vérifié, affiché : à extraire par-dessus l'installation existante. |
Un fichier sans SHA256 dans le manifeste est refusé net plutôt qu'installé sans vérification.
https://aionnode.org/latest.yml
Compatible OpenAI : n'importe quel SDK, curl ou Kilo Code fonctionne tel quel.
curl http://127.0.0.1:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer sk-aion-..." \
-d '{"messages":[{"role":"user","content":"hi"}]}'Un bug, une idée, une remarque ? Écris-nous depuis le site ou directement depuis AION Node.
AION Node peut envoyer les retours automatiquement avec une simple requête HTTP.
POST https://aion-node.lovable.app/api/public/feedback
Content-Type: application/json
{
"name": "Nico",
"email": "nico@mail.com",
"message": "Super appli !",
"rating": 5,
"app_version": "1.0.0",
"os": "Windows 11"
}