AirLLM

août 2026 · 8 min de lecture

🚀 Le Guide Complet AirLLM

Fais tourner les plus grosses IA du monde sur ton propre PC — gratuitement


Merci d'avoir commenté AIRLLM 🙏

Ce guide t'explique tout, du concept à l'installation, avec le modèle exact à choisir selon ta carte graphique. Lis-le en entier une fois avant de te lancer, ça t'évitera 90% des galères.

⚠️ À lire d'abord — sois honnête avec toi-même : AirLLM, c'est puissant mais c'est lent. On ne charge qu'un morceau du modèle à la fois, donc ce n'est pas fait pour discuter en temps réel comme ChatGPT. C'est fait pour faire tourner des modèles énormes localement, gratuitement et en privé, quand la vitesse n'est pas ta priorité. Si tu veux du rapide et fluide, va voir Ollama ou LM Studio (mentionnés à la fin). Si tu veux le plus gros modèle possible sur une petite carte, tu es au bon endroit.


📖 1. C'est quoi AirLLM exactement ?

Normalement, pour faire tourner une grosse IA, il te faut autant de mémoire vidéo (VRAM) que la taille du modèle entier. Un modèle de 70 milliards de paramètres = une machine à plusieurs milliers d'euros.

L'astuce d'AirLLM : un modèle IA, c'est un empilement de couches. Au lieu de tout charger d'un coup, AirLLM charge une seule couche à la fois sur ta carte graphique, la calcule, puis passe à la suivante.

Résultat : la VRAM dont tu as besoin dépend de la taille d'une seule couche, pas du modèle entier. C'est comme ça qu'un modèle de 671 milliards de paramètres tient sur 12 Go.

Ce que ça n'est PAS :

  • ❌ Pas de la compression qui dégrade le modèle (pas de quantization forcée, pas de distillation, pas de pruning)
  • ❌ Pas un modèle "bridé" ou allégé
  • ✅ C'est le vrai modèle, en entier, juste chargé intelligemment

💻 2. Ce qu'il te faut avant de commencer

Élément Minimum Recommandé
Carte graphique (GPU) 4 Go de VRAM (NVIDIA) 8–12 Go de VRAM
Espace disque libre 20 Go 200 Go à 1 To+ selon le modèle
RAM 16 Go 32 Go+
OS Windows / Linux / Mac Apple Silicon Linux (le plus stable)
Python 3.9 ou plus 3.10 / 3.11

🔴 Le point le plus important, celui que tout le monde rate : le vrai goulot d'étranglement d'AirLLM, ce n'est pas ta carte graphique, c'est ton disque dur. AirLLM télécharge le modèle puis le découpe couche par couche sur ton disque. Pour un modèle de 70B, prévois ~150 Go. Pour DeepSeek-V3 (671B), on parle de plusieurs téraoctets. Vérifie ton espace libre AVANT, sinon tu auras l'erreur MetadataIncompleteBuffer en plein milieu.


⚙️ 3. Installation (5 minutes)

Étape 1 — Installe Python et vérifie ta carte

Ouvre un terminal et tape :

python --version

Si Python n'est pas installé, télécharge-le sur python.org.

Si tu as une carte NVIDIA, vérifie que les pilotes sont OK :

nvidia-smi

Tu dois voir ta carte et sa VRAM s'afficher.

Étape 2 — Installe AirLLM

pip install airllm

C'est tout. Une seule commande. 🎉

Étape 3 — (Optionnel mais recommandé) Active l'accélération x3

Pour aller jusqu'à 3 fois plus vite avec une perte de qualité quasi nulle :

pip install -U bitsandbytes
pip install -U airllm

On verra comment l'activer dans le code juste en dessous.


🎯 4. Ton premier test (copie-colle)

Crée un fichier test.py et colle ça dedans :

from airllm import AutoModel

MAX_LENGTH = 128

# On commence par un petit modèle pour vérifier que tout marche
model = AutoModel.from_pretrained("Qwen/Qwen3-32B")

input_text = ['Quelle est la capitale de la France ?']

input_tokens = model.tokenizer(input_text,
    return_tensors="pt",
    return_attention_mask=False,
    truncation=True,
    max_length=MAX_LENGTH,
    padding=False)

generation_output = model.generate(
    input_tokens['input_ids'].cuda(),
    max_new_tokens=20,
    use_cache=True,
    return_dict_in_generate=True)

output = model.tokenizer.decode(generation_output.sequences[0])
print(output)

Lance-le :

python test.py

La première fois, AirLLM va télécharger et découper le modèle → c'est long, c'est normal. Les fois suivantes, c'est plus rapide car le découpage est déjà fait.

Pour activer l'accélération x3 :

Remplace la ligne du modèle par :

model = AutoModel.from_pretrained("Qwen/Qwen3-32B", compression='4bit')
# ou compression='8bit' pour un peu plus de qualité, un peu moins de vitesse

🧠 5. Quel modèle choisir selon ta carte graphique ?

Voici le tableau à garder sous les yeux. La colonne qui compte, c'est la VRAM.

Ta carte (VRAM) Modèle recommandé Taille Ligne de code
4 Go (RTX 3050, 1650…) Qwen3-8B / Mistral 7B 8B AutoModel.from_pretrained("Qwen/Qwen3-8B")
6 Go (RTX 2060, 3060…) Qwen3-30B (MoE) 30B AutoModel.from_pretrained("Qwen/Qwen3-30B-A3B")
8 Go (RTX 3060 Ti, 4060…) Llama 3.3 70B 70B AutoModel.from_pretrained("meta-llama/Llama-3.3-70B-Instruct")
8 Go Qwen3-235B (MoE, très léger !) 235B AutoModel.from_pretrained("Qwen/Qwen3-235B-A22B")
12 Go (RTX 3060 12G, 4070…) DeepSeek-V3 🔥 671B AutoModel.from_pretrained("deepseek-ai/DeepSeek-V3")

💡 Le meilleur rapport qualité/accessibilité pour la plupart des gens : DeepSeek-V3 sur une carte de 12 Go. C'est un modèle de tout premier plan mondial, et une RTX 3060 12 Go se trouve à ~300 €. C'est LE combo à viser.

🎓 Note sur Kimi K3 (2,8 trillions de paramètres) : c'est le record dont on parle dans la vidéo — le plus gros modèle open source au monde, qui tient sur moins de 4 Go de VRAM. Mais ça a été mesuré sur une carte pro (RTX 6000 Ada), ça demande des téraoctets de disque, une config technique particulière (voir section 7), et c'est réservé aux plus avancés. Ne commence pas par lui. Fais d'abord tourner DeepSeek ou Llama 70B.


🍎 6. Sur Mac (Apple Silicon M1/M2/M3/M4)

Bonne nouvelle : ça marche aussi. Il te faut juste mlx en plus :

pip install mlx torch airllm

Puis tu utilises exactement le même code que ci-dessus. ⚠️ Seuls les Mac Apple Silicon sont supportés (pas les vieux Mac Intel).


🛠️ 7. Cas avancé — faire tourner Kimi K3

Si tu veux vraiment tenter le record (et que tu as le disque pour), K3 a des exigences spécifiques :

pip install compressed-tensors flash-attn
# Il te faut aussi :
# - une version CUDA 12 de torch (pas CUDA 13, pas encore de wheel dispo)
# - transformers version 4.56.x (le code de K3 ne charge pas sur 5.x)
pip install "transformers==4.56.2"

C'est technique, ça peut casser, et c'est réservé à ceux qui aiment bricoler. Pour 99% des usages, DeepSeek-V3 te donnera un excellent résultat sans cette galère.


🔧 8. Les erreurs les plus fréquentes (et comment les régler)

MetadataIncompleteBuffer → Tu n'as plus d'espace disque. Libère de la place, vide le cache Hugging Face (~/.cache/huggingface) et relance.

401 Client Error... Repo is gated → Le modèle demande un compte Hugging Face (cas des modèles Meta/Llama). Crée un compte gratuit sur huggingface.co, génère un token, et passe-le :

model = AutoModel.from_pretrained("meta-llama/Llama-3.3-70B-Instruct", hf_token='TON_TOKEN')

ValueError: max() arg is an empty sequence → Tu utilises une vieille classe. Utilise bien from airllm import AutoModel (et pas AirLLMLlama2).

Asking to pad but the tokenizer does not have a padding token → Ajoute padding=False dans l'appel model.tokenizer(...).

Le disque se remplit trop vite → Ajoute delete_original=True à l'initialisation. AirLLM supprimera le modèle original après découpage et gardera seulement la version transformée (économie de ~50% d'espace) :

model = AutoModel.from_pretrained("Qwen/Qwen3-32B", delete_original=True)

✅ 9. Récap — ta checklist de démarrage

  • J'ai vérifié ma VRAM avec nvidia-smi
  • J'ai au moins 20 Go de disque libre (bien plus pour les gros modèles)
  • J'ai fait pip install airllm
  • J'ai testé avec un petit modèle (Qwen3-8B) d'abord
  • J'ai choisi mon modèle dans le tableau de la section 5
  • J'ai activé compression='4bit' pour la vitesse
  • J'accepte que ce soit lent — c'est le prix du gratuit + privé + énorme

🎁 Bonus — les alternatives à connaître

AirLLM est parfait pour faire tourner des modèles énormes sur une petite carte. Mais selon ton besoin :

  • Tu veux du rapide et simple pour discuter au quotidien ?Ollama (le plus simple) ou LM Studio (interface graphique). Modèles plus petits mais instantanés.
  • Tu veux le plus gros modèle possible coûte que coûte ?AirLLM, tu es au bon endroit.

Le combo malin : Ollama pour l'usage quotidien rapide, AirLLM quand tu as besoin de sortir l'artillerie lourde.


🔗 Lien officiel du projet

👉 github.com/lyogavin/airllm

Pense à mettre une ⭐ au repo si le projet te sert, ça aide le créateur.


Guide offert par @nath.build. Une question sur l'install ? Réponds à mon message, je t'aide. 💬

Ce guide vient de Build With Nath

La communauté est gratuite. J’y publie ces guides au fil de l’eau et on y répond aux questions.

Autres guides · Guides

Vous dirigez une entreprise et vous voulez savoir lequel de vos process mérite ce genre de traitement ? Le diagnostic vous le dit en trois minutes, ou on en parle trente minutes.