搭建本地编码模型:软件栈、权重、显存档

换栈便宜,模型体积锁死硬件,硬件贵且难退。权重能进卡 ≠ 目标上下文能进。对照 API 的 100K+20K 账单再买卡。

顺序:栈 → 模型 → 硬件

决策金额最高的是硬件,所以正文按便宜到贵写。很多人已经有 Mac / 24GB 卡——向导支持反向:从内存反推能跑的模型。入口:[本地编码模块](/zh/local-coding/)。

Platform Stack
Desktop NVIDIA Ollama → llama.cpp → vLLM/SGLang (dedicated box)
Apple Silicon MLX first; llama.cpp / Ollama for GGUF portability
Laptop Never start with vLLM
IDE Point Continue / Aider / Cline at localhost

笔记本不要从 vLLM 起步。Apple 优先 MLX;要跨平台 GGUF 再用 llama.cpp / Ollama。IDE 指向 localhost,开源仓库看 [Agent](/zh/agent/) 与 [Toolchain](/zh/toolchain/) 榜,不另造一张。详细决策树:[软件栈](/zh/local-coding/stack/)。

只选能下载、能进消费档的编码权重

不要用名字启发式把 Claude / GPT 拉进「本地编码」。Allowlist 要求:开源许可 + 可下载 + Q4 体积对得上书桌档。480B / 284B MoE 标成 API 或机柜,不是 24GB 下载。站内综合榜奖励长上下文与低单价,不是 SWE。厂商 SWE-Pro 不是独立 harness。

表与 OpenRouter 同任务价见 [模型页](/zh/local-coding/models/)。单卡对照可看 [Qwen3.8-27B 评测](/zh/insights/qwen3-8-27b-review/)。

显存档:锁的是内存,不是 TFLOPS

各档 Q4 级可跑参数量 点击放大图片
档位是类,不是街价。Q4 参数上限是保守书桌协议,不是架构精确 GiB。
Band Typical class Max params (Q4 class) Workloads
16GB RTX 4060 / 5060 Ti 16GB class 8B Q4 class complete
24GB RTX 4090 24GB 32B Q4 class complete, agent
32GB RTX 5090 32GB class 40B Q4 class complete, agent, long
48GB 48GB workstation / dual-24 class 70B Q4 class complete, agent, long
80GB 80GB-class pro card 120B Q4 class complete, agent, long
128GB Mac Studio 128–192GB 180B Q4 class complete, agent, long
512GB Mac Studio 512GB 480B Q4 class complete, agent, long

权重能进卡 ≠ 目标上下文能进。KV cache 随窗口增长;24GB 上的 27B Q4 适合 8K–32K 编码智能体,不是原生 262K。Apple 统一内存优先 MLX;NVIDIA 走 CUDA 栈。Mac Studio 贵但运维简单,不是免费午餐。完整协议与别买清单:[硬件](/zh/local-coding/hardware/)。

TCO:token 标价为零,电和折旧不是

同任务 API 账单对照本地「零标价」 点击放大图片
100K 输入 + 20K 输出。本地为电与折旧,不是 token 发票。API 取 OpenRouter 主 listing 示意。

示意回本:三年摊销 capex + 约 40 小时/月、250W、$0.15/kWh。每月 N 次 100K+20K 编码任务才打平一张消费卡。补全场景往往永远回不了本——继续付 API。别买:16GB 硬上 70B;4090 指望 Coder 480B;个人 SWE 买 H100。

[choose-ai-infrastructure-guide](/zh/insights/choose-ai-infrastructure-guide/) 讲的是 API host 选型,不是桌面 GPU。定量取舍回 [本地编码向导](/zh/local-coding/)。

洞察