Montar um modelo de coding local: stack, pesos, VRAM
Trocar a stack é barato; o tamanho do modelo trava o hardware. Caber os pesos não implica caber o contexto.
Ordem: stack → modelo → hardware
O hardware é o caro, por isso o texto vai do barato ao caro. Se já tens Mac / 24GB, o assistente inverte. Hub: [coding local](/pt/local-coding/).
| Platform | Stack |
|---|---|
| Desktop NVIDIA | Ollama → llama.cpp → vLLM/SGLang (dedicated box) |
| Apple Silicon | MLX first; llama.cpp / Ollama for GGUF portability |
| Laptop | Never start with vLLM |
| IDE | Point Continue / Aider / Cline at localhost |
Não comeces com vLLM num portátil. Detalhe: [stack](/pt/local-coding/stack/).
Só pesos de coding transferíveis que cabem no consumo
Não metas Claude/GPT no local pelo nome. Allowlist: licença aberta, transferível, Q4 de secretária. MoE 480B/284B = API ou rack. O composto não é SWE. [Modelos](/pt/local-coding/models/). [Qwen3.8-27B](/pt/insights/qwen3-8-27b-review/).
Faixas de VRAM: o trinco é memória, não TFLOPS
Ampliar imagem | Band | Typical class | Max params (Q4 class) | Workloads |
|---|---|---|---|
| 16GB | RTX 4060 / 5060 Ti 16GB class | 8B Q4 class | complete |
| 24GB | RTX 4090 24GB | 32B Q4 class | complete, agent |
| 32GB | RTX 5090 32GB class | 40B Q4 class | complete, agent, long |
| 48GB | 48GB workstation / dual-24 class | 70B Q4 class | complete, agent, long |
| 80GB | 80GB-class pro card | 120B Q4 class | complete, agent, long |
| 128GB | Mac Studio 128–192GB | 180B Q4 class | complete, agent, long |
| 512GB | Mac Studio 512GB | 480B Q4 class | complete, agent, long |
Caber os pesos não implica caber o contexto. Detalhe: [hardware](/pt/local-coding/hardware/).
TCO: sticker de token zero, luz e amortização não
Ampliar imagem Não compre 70B em 16GB, 480B numa 4090, nem H100 para completar. A guia de infra é de hosts API. Assistente: [hub](/pt/local-coding/).