Montar um modelo de coding local: stack, pesos, VRAM

Trocar a stack é barato; o tamanho do modelo trava o hardware. Caber os pesos não implica caber o contexto.

Ordem: stack → modelo → hardware

O hardware é o caro, por isso o texto vai do barato ao caro. Se já tens Mac / 24GB, o assistente inverte. Hub: [coding local](/pt/local-coding/).

Platform Stack
Desktop NVIDIA Ollama → llama.cpp → vLLM/SGLang (dedicated box)
Apple Silicon MLX first; llama.cpp / Ollama for GGUF portability
Laptop Never start with vLLM
IDE Point Continue / Aider / Cline at localhost

Não comeces com vLLM num portátil. Detalhe: [stack](/pt/local-coding/stack/).

Só pesos de coding transferíveis que cabem no consumo

Não metas Claude/GPT no local pelo nome. Allowlist: licença aberta, transferível, Q4 de secretária. MoE 480B/284B = API ou rack. O composto não é SWE. [Modelos](/pt/local-coding/models/). [Qwen3.8-27B](/pt/insights/qwen3-8-27b-review/).

Faixas de VRAM: o trinco é memória, não TFLOPS

Parâmetros Q4 por faixa Ampliar imagem
Faixas de classe, não preços de rua.
Band Typical class Max params (Q4 class) Workloads
16GB RTX 4060 / 5060 Ti 16GB class 8B Q4 class complete
24GB RTX 4090 24GB 32B Q4 class complete, agent
32GB RTX 5090 32GB class 40B Q4 class complete, agent, long
48GB 48GB workstation / dual-24 class 70B Q4 class complete, agent, long
80GB 80GB-class pro card 120B Q4 class complete, agent, long
128GB Mac Studio 128–192GB 180B Q4 class complete, agent, long
512GB Mac Studio 512GB 480B Q4 class complete, agent, long

Caber os pesos não implica caber o contexto. Detalhe: [hardware](/pt/local-coding/hardware/).

TCO: sticker de token zero, luz e amortização não

A mesma tarefa em API vs local Ampliar imagem
100K+20K. Local = luz e amortização.

Não compre 70B em 16GB, 480B numa 4090, nem H100 para completar. A guia de infra é de hosts API. Assistente: [hub](/pt/local-coding/).

Insights