Construire un modèle de coding local : stack, poids, VRAM
Changer de stack est bon marché ; la taille du modèle verrouille le matériel. Les poids qui tiennent ≠ le contexte qui tient.
Ordre : stack → modèle → matériel
Le matériel est cher, donc le texte va du bon marché au cher. Si vous avez déjà un Mac / 24 Go, l’assistant inverse. Hub : [coding local](/fr/local-coding/).
| Platform | Stack |
|---|---|
| Desktop NVIDIA | Ollama → llama.cpp → vLLM/SGLang (dedicated box) |
| Apple Silicon | MLX first; llama.cpp / Ollama for GGUF portability |
| Laptop | Never start with vLLM |
| IDE | Point Continue / Aider / Cline at localhost |
Pas de vLLM sur un portable. Détail : [stack](/fr/local-coding/stack/).
Uniquement des poids coding téléchargeables qui tiennent en grand public
N’importez pas Claude/GPT en local par le nom. Allowlist : licence ouverte, téléchargeable, Q4 de bureau. MoE 480B/284B = API ou rack. Le composé n’est pas du SWE. [Modèles](/fr/local-coding/models/). [Qwen3.8-27B](/fr/insights/qwen3-8-27b-review/).
Bandes VRAM : le verrou est la mémoire, pas les TFLOPS
Agrandir l’image | Band | Typical class | Max params (Q4 class) | Workloads |
|---|---|---|---|
| 16GB | RTX 4060 / 5060 Ti 16GB class | 8B Q4 class | complete |
| 24GB | RTX 4090 24GB | 32B Q4 class | complete, agent |
| 32GB | RTX 5090 32GB class | 40B Q4 class | complete, agent, long |
| 48GB | 48GB workstation / dual-24 class | 70B Q4 class | complete, agent, long |
| 80GB | 80GB-class pro card | 120B Q4 class | complete, agent, long |
| 128GB | Mac Studio 128–192GB | 180B Q4 class | complete, agent, long |
| 512GB | Mac Studio 512GB | 480B Q4 class | complete, agent, long |
Les poids qui tiennent ≠ le contexte qui tient. Détail : [matériel](/fr/local-coding/hardware/).
TCO : sticker token zéro, électricité et amortissement non
Agrandir l’image Pas de 70B sur 16 Go, pas de 480B sur 4090, pas de H100 pour l’autocomplétion. Le guide infra concerne les hôtes API. Assistant : [hub](/fr/local-coding/).