本地编码

推荐顺序

  1. 1. 软件栈

    Ollama 起步,llama.cpp 控量化与上下文,Apple 优先 MLX;vLLM/SGLang 留给专机。笔记本不要从 vLLM 开始。

    软件栈 →
  2. 2. 编码模型

    只要消费档能下的开源权重。站内综合榜不是 SWE 分。480B 级 MoE 不要当书桌下载。

    模型 →
  3. 3. 硬件

    锁的是显存/统一内存,不是 TFLOPS。权重能进卡 ≠ 目标上下文能进。你付的是电和折旧,不是 token 标价。

    硬件 →

找到你的本地编码方案

告诉我你已有的机器,或准备买哪一档。我们匹配能塞进去的栈与模型。URL 会更新,推荐可直接分享。

起点
平台
工作负载
目标上下文

选项变化时查询串会更新。

常见问题

本地一定比 API 便宜吗?

不一定。本地 token 标价约 $0,但你要付电费、折旧与运维。请用本页的每月回本任务数估算。

为什么 Q4 能进 24GB,长上下文却跑不动?

KV cache 随上下文增长。权重能进卡 ≠ 原生 128K–262K 能进。要单独留 KV 预算。

应该从 vLLM 起步吗?

笔记本不要。先用 Ollama 或 llama.cpp(Apple 用 MLX)。需要专机吞吐时再用 vLLM/SGLang。

AI Hippo 综合榜能代表编码能力吗?

不能。统一榜更像上下文/价格代理。厂商 SWE 表除非标明,否则不是独立 harness 复现。

假设与来源

硬件档是「类」+ 美元参考区间(非街价报价)。显存估算用 curated GGUF 体积 + 按规模的 KV 系数。编码分为手写 SWE/Aider/LiveCode/HumanEval 参考——非 harness 复现。API 任务成本取 OpenRouter 主 listing(若有)。