100% gratuit · Windows 10/11 · 64 bits

AION Node

Fais tourner tes modèles GGUF en local, sur tes propres GPU.

Bientôt disponible

Version · Taille

Pourquoi AION Node

Modèles GGUF locaux

Charge n'importe quel .gguf depuis ton disque et règle l'offload GPU, le contexte et la RAM.

Cluster VRAM

Répartis un seul modèle entre plusieurs GPU, en LAN ou via un réseau Tailscale chiffré.

Chat privé

Conversations, fichiers et projets restent sur tes PC. Rien ne part sur Internet.

API compatible OpenAI

Branche Kilo Code ou n'importe quel outil sur http://127.0.0.1:8000/v1.

Comment ça marche

Une app Electron qui pilote un moteur Python local (llama.cpp) sur 127.0.0.1. Rien ne sort de ton réseau.

1 · Charge un modèle

Choisis un fichier .gguf. AION lit ses métadonnées et calcule un vrai plan VRAM/RAM à partir de la VRAM libre détectée (nvidia-smi), pas d'une estimation.

2 · Ajoute des GPU

Appaire jusqu'à 4 PC via le mesh P2P (LAN ou Tailscale) et répartis un seul modèle sur tous leurs GPU.

3 · Branche tes outils

L'API OpenAI-compatible tourne sur http://127.0.0.1:8000/v1 et se synchronise automatiquement dans la config de Kilo Code.

Un aperçu de l'interface

Modèles, chat, réseau local et API — tout au même endroit.

Démonstration

La vidéo de démonstration arrive bientôt.

Ce qu'il y a dedans

Clés API & quotas

Génère une clé sk-aion-… par personne avec un quota horaire/journalier, pour prêter ton GPU sans partager ton accès.

Accès distant ngrok

Expose le chat en HTTPS ; chaque utilisateur se connecte avec sa propre clé, donc sa propre consommation.

Mesh P2P

WebSocket entre nœuds AION sur le même LAN ou Tailnet : découverte des pairs et coordination inter-PC.

Split auto-calibré

Le tensor-split part de la VRAM puis se calibre sur la vitesse réelle mesurée de chaque GPU, et se met en cache (26 s une fois, 0,08 s ensuite).

Mesures réelles

DeepSeek-R1-Distill-Qwen-14B Q4_K_M (~9 Go), RTX 4070 Laptop + RTX 2070 SUPER (8 Go chacune), LAN, -c 4096.

1 PC seul

7.4–9.1 tok/s

Génération · Prefill (1021 tok) : 688 tok/s

Cluster 2 PC

21.9–22.1 tok/s

Génération · Prefill (1021 tok) : 547 tok/s

+140 à +196 % de génération avec un second GPU : le modèle ne tient pas dans une seule carte de 8 Go, donc en solo des couches partent sur le CPU.

Quand activer le Cluster VRAM

Règle simple : uniquement si le modèle dépasse la VRAM d'un seul GPU mais tient dans la somme des GPU du cluster.

ModèleTailleSoloClusterÉcart
Qwen3.5-9B5.6 GB30.929.3-5%
Gemma-4-12B7.0 GB8.922.6+153%
DeepSeek-R1-14B9.0 GB7.4–9.121.9–22.1+140–196%
Qwen3.6-27B16.5 GB2.10.11–0.19-82 à -95%

Configuration requise

  • Windows 10/11 · 64 bits
  • GPU NVIDIA + pilote CUDA pour l'offload GPU et le Cluster VRAM (CPU seul possible, plus lent)
  • Ports locaux 8000 (API) et 9000 (mesh P2P)
  • Assez de RAM/VRAM pour ton modèle .gguf — AION affiche le plan avant de charger

Exemple d'appel API

Compatible OpenAI : n'importe quel SDK, curl ou Kilo Code fonctionne tel quel.

curl http://127.0.0.1:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer sk-aion-..." \
  -d '{"messages":[{"role":"user","content":"hi"}]}'

Ton avis

Un bug, une idée, une remarque ? Écris-nous depuis le site ou directement depuis AION Node.

Note (optionnel)
Envoyer un avis depuis le logiciel (API)

AION Node peut envoyer les retours automatiquement avec une simple requête HTTP.

POST https://aion-node.lovable.app/api/public/feedback
Content-Type: application/json

{
  "name": "Nico",
  "email": "nico@mail.com",
  "message": "Super appli !",
  "rating": 5,
  "app_version": "1.0.0",
  "os": "Windows 11"
}