Logo AION Node100% gratuit · Windows 10/11 · 64 bits

AION Node

Fais tourner tes modèles GGUF en local, sur tes propres GPU.

Bientôt disponible

Version · Taille

Pourquoi AION Node

Modèles GGUF locaux

Charge n'importe quel .gguf depuis ton disque et règle l'offload GPU, le contexte et la RAM.

Cluster VRAM

Répartis un seul modèle entre plusieurs GPU, en LAN ou via un réseau Tailscale chiffré.

Chat privé

Conversations, fichiers et projets restent sur tes PC. Rien ne part sur Internet.

API compatible OpenAI

Branche Kilo Code ou n'importe quel outil sur http://127.0.0.1:8000/v1.

Comment ça marche

Une app Electron qui pilote un moteur Python local (llama.cpp) sur 127.0.0.1. Rien ne sort de ton réseau.

1 · Charge un modèle

Choisis un fichier .gguf. AION lit ses métadonnées GGUF (y compris les architectures à attention glissante type Gemma 3/4) et calcule un vrai plan VRAM/RAM à partir de la VRAM libre détectée (nvidia-smi), pas d'une estimation.

2 · Ajoute des GPU

Appaire jusqu'à 4 PC via le mesh P2P (LAN ou overlay Tailscale chiffré WireGuard) et répartis un seul modèle sur tous leurs GPU.

3 · Branche tes outils

L'API OpenAI-compatible tourne sur http://127.0.0.1:8000/v1 et se synchronise automatiquement dans la config de Kilo Code.

Un aperçu de l'interface

Modèles, chat, réseau local et API — tout au même endroit.

Démonstration

La vidéo de démonstration arrive bientôt.

Ce qu'il y a dedans

Clés API & quotas

Génère une clé sk-aion-… par personne avec un quota horaire/journalier (en % de ta capacité), pour prêter ton GPU sans partager ton accès.

Accès distant ngrok

Expose le chat en HTTPS ; chaque utilisateur se connecte avec sa propre clé, donc sa propre consommation.

Mesh P2P

WebSocket entre nœuds AION sur le même LAN ou Tailnet : découverte des pairs et coordination inter-PC.

Split auto-calibré

Le tensor-split part de la VRAM puis se calibre sur la vitesse réelle mesurée de chaque GPU (plafonné à 1,5× pour éviter tout OOM), et se met en cache : 26,5 s une fois, 0,08 s ensuite.

Moteur WAN (fork)

Notre fork de llama.cpp survit à la perte d'un nœud au lieu d'abandonner tout le moteur, garde un worker en vie sur une erreur CUDA passagère, et re-vérifie son cache RPC à la lecture : ~24× moins de données au rechargement (2386 Mo à froid, 98 Mo à chaud).

Décodage spéculatif mesuré

Un petit modèle brouillon anticipe et le modèle cible vérifie en un aller-retour : +71,6 % quand l'acceptation dépasse ~45 %, −11 % en dessous. AION surveille l'acceptation réelle et coupe le brouillon tout seul quand il ne paie plus.

Repli & reprise auto

Perdre un PC ou un lien RPC ne coupe plus l'inférence : le pool se re-tarife et recharge le meilleur modèle qui tient encore, avec une fenêtre de grâce de 45 s et une reconnexion toutes les 10 s.

Quotas au mérite

Dans un pool partagé, le budget quotidien de chacun découle de sa contribution réelle sur 7 jours (Go·heures de VRAM effectivement sous charge), vérifiée avant d'être créditée.

Mesures réelles

DeepSeek-R1-Distill-Qwen-14B Q4_K_M (~9 Go), RTX 4070 Laptop + RTX 2070 SUPER (8 Go chacune), LAN, -c 4096 --split-mode layer.

1 PC seul

7.4–9.1 tok/s

Génération · Prefill (1021 tok) : 688 tok/s

Cluster 2 PC

21.9–22.1 tok/s

Génération · Prefill (1021 tok) : 547 tok/s

+140 à +196 % de génération avec un second GPU : le modèle ne tient pas dans une seule carte de 8 Go, donc en solo des couches partent sur le CPU. Le prefill est légèrement plus lent en cluster (saut RPC entre couches), largement compensé.

Quand activer le Cluster VRAM

Règle simple : uniquement si le modèle dépasse la VRAM d'un seul GPU mais tient dans la somme des GPU du cluster. En dessous, le RPC coûte pour rien ; au-dessus, tous les PC déchargent sur CPU en même temps et cumulent les deux pénalités.

ModèleTailleTient sur 1 GPU ?SoloClusterÉcart
Qwen3.5-9B5.6 GBoui30.929.3-5%
Gemma-4-12B7.0 GBde justesse8.922.6+153%
DeepSeek-R1-14B9.0 GBnon7.4–9.121.9–22.1+140–196%
gpt-oss-20b-MXFP412.1 GBnon26.7–26.844–50+65–87%
Qwen3.6-27B16.5 GBnon (ni les deux)2.10.11–0.19-82 à -95%

LAN ou Tailscale pour le lien RPC

Même modèle, même split, seul l'endpoint --rpc change. Le ping est identique : c'est le chiffrement WireGuard sur le trafic tensoriel soutenu qui coûte.

TransportGénérationPing
LAN (192.168.x.x:50052)46–47 tok/s2–3 ms
Tailscale (100.x.x.x:50052)40–42 tok/s2–4 ms

Mises à jour vérifiées

AION interroge https://aionnode.org/latest.yml au lancement puis toutes les 15 minutes. L'origine est une constante codée en dur dans l'updater : ni l'app ni l'interface ne peuvent la changer.

FormatCe qui se passe
Installateur (.exe NSIS)Téléchargé, vérifié SHA256, lancé — AION se ferme pour laisser l'installation se remplacer.
Portable .exeTéléchargé, vérifié SHA256, affiché dans l'Explorateur : Windows verrouille le binaire en cours, remplacement manuel.
Archive ZIPTéléchargé, vérifié, affiché : à extraire par-dessus l'installation existante.

Un fichier sans SHA256 dans le manifeste est refusé net plutôt qu'installé sans vérification.

https://aionnode.org/latest.yml

Configuration requise

  • Windows 10/11 · 64 bits
  • GPU NVIDIA + pilote CUDA pour l'offload GPU et le Cluster VRAM (CPU seul possible, plus lent)
  • Ports locaux 8000 (API) et 9000 (mesh P2P) — RPC cluster sur 50052
  • Assez de RAM/VRAM pour ton modèle .gguf — AION affiche le plan avant de charger
  • Optionnel : Tailscale pour appairer des PC hors du même LAN

Exemple d'appel API

Compatible OpenAI : n'importe quel SDK, curl ou Kilo Code fonctionne tel quel.

curl http://127.0.0.1:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer sk-aion-..." \
  -d '{"messages":[{"role":"user","content":"hi"}]}'

Ton avis

Un bug, une idée, une remarque ? Écris-nous depuis le site ou directement depuis AION Node.

Note (optionnel)
Envoyer un avis depuis le logiciel (API)

AION Node peut envoyer les retours automatiquement avec une simple requête HTTP.

POST https://aion-node.lovable.app/api/public/feedback
Content-Type: application/json

{
  "name": "Nico",
  "email": "nico@mail.com",
  "message": "Super appli !",
  "rating": 5,
  "app_version": "1.0.0",
  "os": "Windows 11"
}