Собрать локальную coding-модель: стек, веса, VRAM

Стек менять дёшево; размер модели запирает железо. Влезшие веса ≠ влезший контекст.

Порядок: стек → модель → железо

Железо самое дорогое, поэтому текст идёт от дешёвого. Если Mac / 24ГБ уже есть — мастер работает в обратную сторону. Хаб: [локальный coding](/ru/local-coding/).

Platform Stack
Desktop NVIDIA Ollama → llama.cpp → vLLM/SGLang (dedicated box)
Apple Silicon MLX first; llama.cpp / Ollama for GGUF portability
Laptop Never start with vLLM
IDE Point Continue / Aider / Cline at localhost

Не начинайте с vLLM на ноутбуке. Подробности: [стек](/ru/local-coding/stack/).

Только скачиваемые coding-веса, которые лезут в consumer-полосу

Не тащите Claude/GPT в локаль по имени. Allowlist: открытая лицензия, скачивание, Q4 на стол. 480B/284B MoE — API или стойка. Композит — не SWE. [Модели](/ru/local-coding/models/). [Qwen3.8-27B](/ru/insights/qwen3-8-27b-review/).

Полосы VRAM: замок — память, не TFLOPS

Параметры Q4 по полосам Увеличить изображение
Классы, не уличные цены.
Band Typical class Max params (Q4 class) Workloads
16GB RTX 4060 / 5060 Ti 16GB class 8B Q4 class complete
24GB RTX 4090 24GB 32B Q4 class complete, agent
32GB RTX 5090 32GB class 40B Q4 class complete, agent, long
48GB 48GB workstation / dual-24 class 70B Q4 class complete, agent, long
80GB 80GB-class pro card 120B Q4 class complete, agent, long
128GB Mac Studio 128–192GB 180B Q4 class complete, agent, long
512GB Mac Studio 512GB 480B Q4 class complete, agent, long

Влезшие веса ≠ влезший контекст. Подробности: [железо](/ru/local-coding/hardware/).

TCO: стикер токена ноль, электричество и амортизация нет

Та же задача API vs локально Увеличить изображение
100K+20K. Локально — электричество и амортизация.

Не покупайте 70B на 16ГБ, 480B на 4090, H100 для автодополнения. Гайд по инфраструктуре — про API-хосты. Мастер: [хаб](/ru/local-coding/).

Инсайты