Construir un modelo de coding local: stack, pesos, VRAM

Cambiar el stack es barato; el tamaño del modelo fija el hardware. Que quepan los pesos no implica que quepa el contexto.

Orden: stack → modelo → hardware

El hardware es lo caro, así que el texto va de barato a caro. Si ya tienes Mac / 24GB, el asistente funciona al revés. Hub: [coding local](/es/local-coding/).

Platform Stack
Desktop NVIDIA Ollama → llama.cpp → vLLM/SGLang (dedicated box)
Apple Silicon MLX first; llama.cpp / Ollama for GGUF portability
Laptop Never start with vLLM
IDE Point Continue / Aider / Cline at localhost

No empieces con vLLM en un portátil. Detalle: [stack](/es/local-coding/stack/).

Solo pesos de coding descargables que caben en consumo

No metas Claude/GPT en local por el nombre. Allowlist: licencia abierta, descargable, Q4 de escritorio. MoE 480B/284B = API o rack. El ranking compuesto no es SWE. [Modelos](/es/local-coding/models/). [Qwen3.8-27B](/es/insights/qwen3-8-27b-review/).

Bandas de VRAM: la traba es memoria, no TFLOPS

Parámetros Q4 por banda Ampliar imagen
Bandas de clase, no precios de calle.
Band Typical class Max params (Q4 class) Workloads
16GB RTX 4060 / 5060 Ti 16GB class 8B Q4 class complete
24GB RTX 4090 24GB 32B Q4 class complete, agent
32GB RTX 5090 32GB class 40B Q4 class complete, agent, long
48GB 48GB workstation / dual-24 class 70B Q4 class complete, agent, long
80GB 80GB-class pro card 120B Q4 class complete, agent, long
128GB Mac Studio 128–192GB 180B Q4 class complete, agent, long
512GB Mac Studio 512GB 480B Q4 class complete, agent, long

Que quepan los pesos no implica que quepa el contexto. Detalle: [hardware](/es/local-coding/hardware/).

TCO: sticker de token cero, luz y amortización no

Misma tarea en API vs local Ampliar imagen
100K+20K. Local = luz y amortización.

No compre 70B en 16GB, 480B en 4090, ni H100 para autocompletar. La guía de infraestructura es de hosts API. Asistente: [hub](/es/local-coding/).

Insights