桌面 NVIDIA
Ollama 起步 → 需要精确量化与上下文时用 llama.cpp → vLLM / SGLang 仅用于专机。
本地编码
换运行时便宜。先用组件图分清 IDE / RAG / 运行时 / 权重 / 硬件,再匹配平台。
本地编码是五层。缺任一必选层就会「啥也跑不起来」。只有需要超出上下文的仓库检索时才上可选 RAG。
VS Code / Cursor 插件(Continue、Cline)、JetBrains 插件(Continue 等),以及 Aider 这类 CLI。一律指向本机 OpenAI 兼容端点。
宿主是 IDE 或终端,插件不是模型。开源仓库见 Agent / Toolchain 榜。
多数客户端自带仓库索引(Continue / Cline 的 codebase、Aider 的 repo map)。需要独立一层时:AnythingLLM、RAGFlow、LlamaIndex;向量库常用 Chroma、Qdrant、FAISS;嵌入模型在本机跑。
短上下文补全可跳过;小模型 + 大 monorepo 时几乎必需。这不是第 3 层运行时。
Ollama、llama.cpp server、MLX、vLLM 或 SGLang——在 localhost 暴露 chat/completions。
本页「软件栈」决策指这一层。下方社区星标衡量的是这一层的热度。
Models allowlist 的 GGUF / MLX / safetensors——体积会锁死硬件档。
API-only 的 MoE coder 永远落不到这一层。
NVIDIA CUDA、Apple 统一内存 + Metal/MLX,或有限的 AMD/Intel 路径——见硬件页。
权重能进 ≠ 上下文能进(KV 税)。
快速自检:我缺哪一层?
来自 Trends 的 inference / serving / llm_lib 分段星标。衡量的是第 3 层(本地运行时)热度——不是 SWE 能力,不是 IDE,也不是模型质量。
用来确认「这个运行时还活着吗」,不要用来选编码模型。
| 仓库 | Trends 分段 | Stars |
|---|---|---|
| ggml-org/llama.cpp | inference | 124,446 |
| earendil-works/pi | inference | 92,672 |
| BerriAI/litellm | inference | 56,603 |
| sgl-project/sglang | inference | 31,995 |
| microsoft/onnxruntime | inference | 21,399 |
| huggingface/transformers | llm_lib | 164,211 |
| fighting41love/funNLP | llm_lib | 82,521 |
| unslothai/unsloth | llm_lib | 73,350 |
| ComposioHQ/awesome-claude-skills | llm_lib | 72,700 |
| labmlai/annotated_deep_learning_paper_implementations | llm_lib | 67,312 |
| open-webui/open-webui | serving | 149,090 |
| Mintplex-Labs/anything-llm | serving | 64,859 |
| janhq/jan | serving | 44,038 |
| lm-sys/FastChat | serving | 39,513 |
| chatchat-space/Langchain-Chatchat | serving | 38,546 |
硬件档是「类」+ 美元参考区间(非街价报价)。显存估算用 curated GGUF 体积 + 按规模的 KV 系数。编码分为手写 SWE/Aider/LiveCode/HumanEval 参考——非 harness 复现。API 任务成本取 OpenRouter 主 listing(若有)。