本地编码

组件图(缺啥补啥)

本地编码是五层。缺任一必选层就会「啥也跑不起来」。只有需要超出上下文的仓库检索时才上可选 RAG。

  1. 1

    1. IDE / Agent 客户端

    VS Code / Cursor 插件(Continue、Cline)、JetBrains 插件(Continue 等),以及 Aider 这类 CLI。一律指向本机 OpenAI 兼容端点。

    宿主是 IDE 或终端,插件不是模型。开源仓库见 Agent / Toolchain 榜。

  2. 2 可选

    2. RAG / 仓库索引

    多数客户端自带仓库索引(Continue / Cline 的 codebase、Aider 的 repo map)。需要独立一层时:AnythingLLM、RAGFlow、LlamaIndex;向量库常用 Chroma、Qdrant、FAISS;嵌入模型在本机跑。

    短上下文补全可跳过;小模型 + 大 monorepo 时几乎必需。这不是第 3 层运行时。

  3. 3

    3. 本地运行时(OpenAI 兼容服务)

    Ollama、llama.cpp server、MLX、vLLM 或 SGLang——在 localhost 暴露 chat/completions。

    本页「软件栈」决策指这一层。下方社区星标衡量的是这一层的热度。

  4. 4

    4. 磁盘上的模型权重

    Models allowlist 的 GGUF / MLX / safetensors——体积会锁死硬件档。

    API-only 的 MoE coder 永远落不到这一层。

  5. 5

    5. 硬件(显存 / 统一内存)

    NVIDIA CUDA、Apple 统一内存 + Metal/MLX,或有限的 AMD/Intel 路径——见硬件页。

    权重能进 ≠ 上下文能进(KV 税)。

快速自检:我缺哪一层?

  • 有 IDE 但没有 localhost 运行时 → 先装 Ollama / llama.cpp / MLX。
  • 运行时起来了但没有模型 → 去 Models 页下 allowlist coder GGUF。
  • 模型能加载但大仓库里智能体「瞎」→ 加 RAG / 仓库索引(可选层)。
  • OOM 或上下文极短 → 硬件档不对,或 KV 预算太高。

决策树

桌面 NVIDIA

Ollama 起步 → 需要精确量化与上下文时用 llama.cpp → vLLM / SGLang 仅用于专机。

Apple Silicon

统一内存优先 MLX。需要跨平台 GGUF 时再用 llama.cpp 或 Ollama。

IDE 接线

把 VS Code / Cursor 插件(Continue、Cline)、JetBrains 插件(Continue 等)或 Aider 指向 localhost。开源仓库请看 Agent / Toolchain 榜——本页不另造一张榜。

Agent · 工具链

社区信号 — 运行时热度(GitHub OSS)

来自 Trends 的 inference / serving / llm_lib 分段星标。衡量的是第 3 层(本地运行时)热度——不是 SWE 能力,不是 IDE,也不是模型质量。

用来确认「这个运行时还活着吗」,不要用来选编码模型。

仓库 Trends 分段 Stars
ggml-org/llama.cpp inference 124,446
earendil-works/pi inference 92,672
BerriAI/litellm inference 56,603
sgl-project/sglang inference 31,995
microsoft/onnxruntime inference 21,399
huggingface/transformers llm_lib 164,211
fighting41love/funNLP llm_lib 82,521
unslothai/unsloth llm_lib 73,350
ComposioHQ/awesome-claude-skills llm_lib 72,700
labmlai/annotated_deep_learning_paper_implementations llm_lib 67,312
open-webui/open-webui serving 149,090
Mintplex-Labs/anything-llm serving 64,859
janhq/jan serving 44,038
lm-sys/FastChat serving 39,513
chatchat-space/Langchain-Chatchat serving 38,546

← 本地编码首页

假设与来源

硬件档是「类」+ 美元参考区间(非街价报价)。显存估算用 curated GGUF 体积 + 按规模的 KV 系数。编码分为手写 SWE/Aider/LiveCode/HumanEval 参考——非 harness 复现。API 任务成本取 OpenRouter 主 listing(若有)。