搭建本地编码模型:软件栈、权重、显存档
换栈便宜,模型体积锁死硬件,硬件贵且难退。权重能进卡 ≠ 目标上下文能进。对照 API 的 100K+20K 账单再买卡。
顺序:栈 → 模型 → 硬件
决策金额最高的是硬件,所以正文按便宜到贵写。很多人已经有 Mac / 24GB 卡——向导支持反向:从内存反推能跑的模型。入口:[本地编码模块](/zh/local-coding/)。
| Platform | Stack |
|---|---|
| Desktop NVIDIA | Ollama → llama.cpp → vLLM/SGLang (dedicated box) |
| Apple Silicon | MLX first; llama.cpp / Ollama for GGUF portability |
| Laptop | Never start with vLLM |
| IDE | Point Continue / Aider / Cline at localhost |
笔记本不要从 vLLM 起步。Apple 优先 MLX;要跨平台 GGUF 再用 llama.cpp / Ollama。IDE 指向 localhost,开源仓库看 [Agent](/zh/agent/) 与 [Toolchain](/zh/toolchain/) 榜,不另造一张。详细决策树:[软件栈](/zh/local-coding/stack/)。
只选能下载、能进消费档的编码权重
不要用名字启发式把 Claude / GPT 拉进「本地编码」。Allowlist 要求:开源许可 + 可下载 + Q4 体积对得上书桌档。480B / 284B MoE 标成 API 或机柜,不是 24GB 下载。站内综合榜奖励长上下文与低单价,不是 SWE。厂商 SWE-Pro 不是独立 harness。
表与 OpenRouter 同任务价见 [模型页](/zh/local-coding/models/)。单卡对照可看 [Qwen3.8-27B 评测](/zh/insights/qwen3-8-27b-review/)。
显存档:锁的是内存,不是 TFLOPS
点击放大图片 | Band | Typical class | Max params (Q4 class) | Workloads |
|---|---|---|---|
| 16GB | RTX 4060 / 5060 Ti 16GB class | 8B Q4 class | complete |
| 24GB | RTX 4090 24GB | 32B Q4 class | complete, agent |
| 32GB | RTX 5090 32GB class | 40B Q4 class | complete, agent, long |
| 48GB | 48GB workstation / dual-24 class | 70B Q4 class | complete, agent, long |
| 80GB | 80GB-class pro card | 120B Q4 class | complete, agent, long |
| 128GB | Mac Studio 128–192GB | 180B Q4 class | complete, agent, long |
| 512GB | Mac Studio 512GB | 480B Q4 class | complete, agent, long |
权重能进卡 ≠ 目标上下文能进。KV cache 随窗口增长;24GB 上的 27B Q4 适合 8K–32K 编码智能体,不是原生 262K。Apple 统一内存优先 MLX;NVIDIA 走 CUDA 栈。Mac Studio 贵但运维简单,不是免费午餐。完整协议与别买清单:[硬件](/zh/local-coding/hardware/)。
TCO:token 标价为零,电和折旧不是
点击放大图片 示意回本:三年摊销 capex + 约 40 小时/月、250W、$0.15/kWh。每月 N 次 100K+20K 编码任务才打平一张消费卡。补全场景往往永远回不了本——继续付 API。别买:16GB 硬上 70B;4090 指望 Coder 480B;个人 SWE 买 H100。
[choose-ai-infrastructure-guide](/zh/insights/choose-ai-infrastructure-guide/) 讲的是 API host 选型,不是桌面 GPU。定量取舍回 [本地编码向导](/zh/local-coding/)。