Construir un modelo de coding local: stack, pesos, VRAM
Cambiar el stack es barato; el tamaño del modelo fija el hardware. Que quepan los pesos no implica que quepa el contexto.
Orden: stack → modelo → hardware
El hardware es lo caro, así que el texto va de barato a caro. Si ya tienes Mac / 24GB, el asistente funciona al revés. Hub: [coding local](/es/local-coding/).
| Platform | Stack |
|---|---|
| Desktop NVIDIA | Ollama → llama.cpp → vLLM/SGLang (dedicated box) |
| Apple Silicon | MLX first; llama.cpp / Ollama for GGUF portability |
| Laptop | Never start with vLLM |
| IDE | Point Continue / Aider / Cline at localhost |
No empieces con vLLM en un portátil. Detalle: [stack](/es/local-coding/stack/).
Solo pesos de coding descargables que caben en consumo
No metas Claude/GPT en local por el nombre. Allowlist: licencia abierta, descargable, Q4 de escritorio. MoE 480B/284B = API o rack. El ranking compuesto no es SWE. [Modelos](/es/local-coding/models/). [Qwen3.8-27B](/es/insights/qwen3-8-27b-review/).
Bandas de VRAM: la traba es memoria, no TFLOPS
Ampliar imagen | Band | Typical class | Max params (Q4 class) | Workloads |
|---|---|---|---|
| 16GB | RTX 4060 / 5060 Ti 16GB class | 8B Q4 class | complete |
| 24GB | RTX 4090 24GB | 32B Q4 class | complete, agent |
| 32GB | RTX 5090 32GB class | 40B Q4 class | complete, agent, long |
| 48GB | 48GB workstation / dual-24 class | 70B Q4 class | complete, agent, long |
| 80GB | 80GB-class pro card | 120B Q4 class | complete, agent, long |
| 128GB | Mac Studio 128–192GB | 180B Q4 class | complete, agent, long |
| 512GB | Mac Studio 512GB | 480B Q4 class | complete, agent, long |
Que quepan los pesos no implica que quepa el contexto. Detalle: [hardware](/es/local-coding/hardware/).
TCO: sticker de token cero, luz y amortización no
Ampliar imagen No compre 70B en 16GB, 480B en 4090, ni H100 para autocompletar. La guía de infraestructura es de hosts API. Asistente: [hub](/es/local-coding/).