Construire un modèle de coding local : stack, poids, VRAM

Changer de stack est bon marché ; la taille du modèle verrouille le matériel. Les poids qui tiennent ≠ le contexte qui tient.

Ordre : stack → modèle → matériel

Le matériel est cher, donc le texte va du bon marché au cher. Si vous avez déjà un Mac / 24 Go, l’assistant inverse. Hub : [coding local](/fr/local-coding/).

Platform Stack
Desktop NVIDIA Ollama → llama.cpp → vLLM/SGLang (dedicated box)
Apple Silicon MLX first; llama.cpp / Ollama for GGUF portability
Laptop Never start with vLLM
IDE Point Continue / Aider / Cline at localhost

Pas de vLLM sur un portable. Détail : [stack](/fr/local-coding/stack/).

Uniquement des poids coding téléchargeables qui tiennent en grand public

N’importez pas Claude/GPT en local par le nom. Allowlist : licence ouverte, téléchargeable, Q4 de bureau. MoE 480B/284B = API ou rack. Le composé n’est pas du SWE. [Modèles](/fr/local-coding/models/). [Qwen3.8-27B](/fr/insights/qwen3-8-27b-review/).

Bandes VRAM : le verrou est la mémoire, pas les TFLOPS

Paramètres Q4 par bande Agrandir l’image
Bandes de classe, pas des prix de rue.
Band Typical class Max params (Q4 class) Workloads
16GB RTX 4060 / 5060 Ti 16GB class 8B Q4 class complete
24GB RTX 4090 24GB 32B Q4 class complete, agent
32GB RTX 5090 32GB class 40B Q4 class complete, agent, long
48GB 48GB workstation / dual-24 class 70B Q4 class complete, agent, long
80GB 80GB-class pro card 120B Q4 class complete, agent, long
128GB Mac Studio 128–192GB 180B Q4 class complete, agent, long
512GB Mac Studio 512GB 480B Q4 class complete, agent, long

Les poids qui tiennent ≠ le contexte qui tient. Détail : [matériel](/fr/local-coding/hardware/).

TCO : sticker token zéro, électricité et amortissement non

Même job API vs local Agrandir l’image
100K+20K. Local = électricité et amortissement.

Pas de 70B sur 16 Go, pas de 480B sur 4090, pas de H100 pour l’autocomplétion. Le guide infra concerne les hôtes API. Assistant : [hub](/fr/local-coding/).

Insights