Собрать локальную coding-модель: стек, веса, VRAM
Стек менять дёшево; размер модели запирает железо. Влезшие веса ≠ влезший контекст.
Порядок: стек → модель → железо
Железо самое дорогое, поэтому текст идёт от дешёвого. Если Mac / 24ГБ уже есть — мастер работает в обратную сторону. Хаб: [локальный coding](/ru/local-coding/).
| Platform | Stack |
|---|---|
| Desktop NVIDIA | Ollama → llama.cpp → vLLM/SGLang (dedicated box) |
| Apple Silicon | MLX first; llama.cpp / Ollama for GGUF portability |
| Laptop | Never start with vLLM |
| IDE | Point Continue / Aider / Cline at localhost |
Не начинайте с vLLM на ноутбуке. Подробности: [стек](/ru/local-coding/stack/).
Только скачиваемые coding-веса, которые лезут в consumer-полосу
Не тащите Claude/GPT в локаль по имени. Allowlist: открытая лицензия, скачивание, Q4 на стол. 480B/284B MoE — API или стойка. Композит — не SWE. [Модели](/ru/local-coding/models/). [Qwen3.8-27B](/ru/insights/qwen3-8-27b-review/).
Полосы VRAM: замок — память, не TFLOPS
Увеличить изображение | Band | Typical class | Max params (Q4 class) | Workloads |
|---|---|---|---|
| 16GB | RTX 4060 / 5060 Ti 16GB class | 8B Q4 class | complete |
| 24GB | RTX 4090 24GB | 32B Q4 class | complete, agent |
| 32GB | RTX 5090 32GB class | 40B Q4 class | complete, agent, long |
| 48GB | 48GB workstation / dual-24 class | 70B Q4 class | complete, agent, long |
| 80GB | 80GB-class pro card | 120B Q4 class | complete, agent, long |
| 128GB | Mac Studio 128–192GB | 180B Q4 class | complete, agent, long |
| 512GB | Mac Studio 512GB | 480B Q4 class | complete, agent, long |
Влезшие веса ≠ влезший контекст. Подробности: [железо](/ru/local-coding/hardware/).
TCO: стикер токена ноль, электричество и амортизация нет
Увеличить изображение Не покупайте 70B на 16ГБ, 480B на 4090, H100 для автодополнения. Гайд по инфраструктуре — про API-хосты. Мастер: [хаб](/ru/local-coding/).