ローカルコーディングモデルを組む:スタック、重み、VRAM帯
スタックは安い。モデルサイズがハードウェアをロックする。重みが載っても目標コンテキストが載るとは限らない。
順序:スタック → モデル → ハードウェア
最も高い判断はハードウェアなので、本文は安い順。すでにMac/24GBがある人はウィザードを逆向きに使う。入口:[ローカルコーディング](/ja/local-coding/)。
| Platform | Stack |
|---|---|
| Desktop NVIDIA | Ollama → llama.cpp → vLLM/SGLang (dedicated box) |
| Apple Silicon | MLX first; llama.cpp / Ollama for GGUF portability |
| Laptop | Never start with vLLM |
| IDE | Point Continue / Aider / Cline at localhost |
ノートでvLLMから始めない。AppleはMLX優先。詳細:[スタック](/ja/local-coding/stack/)。
ダウンロードでき、民生帯に載るコーディング重みだけ
名前ヒューリスティックでClaude/GPTをローカルに入れない。Allowlist:オープンライセンス、ダウンロード可、Q4が机の帯に載る。480B/284B MoEはAPIかラック。総合榜はSWEではない。[モデル頁](/ja/local-coding/models/)。[Qwen3.8-27B](/ja/insights/qwen3-8-27b-review/)。
VRAM帯:ロックはメモリでありTFLOPSではない
画像を拡大 | Band | Typical class | Max params (Q4 class) | Workloads |
|---|---|---|---|
| 16GB | RTX 4060 / 5060 Ti 16GB class | 8B Q4 class | complete |
| 24GB | RTX 4090 24GB | 32B Q4 class | complete, agent |
| 32GB | RTX 5090 32GB class | 40B Q4 class | complete, agent, long |
| 48GB | 48GB workstation / dual-24 class | 70B Q4 class | complete, agent, long |
| 80GB | 80GB-class pro card | 120B Q4 class | complete, agent, long |
| 128GB | Mac Studio 128–192GB | 180B Q4 class | complete, agent, long |
| 512GB | Mac Studio 512GB | 480B Q4 class | complete, agent, long |
重みが載っても目標コンテキストが載るとは限らない。詳細:[ハードウェア](/ja/local-coding/hardware/)。
TCO:トークン単価はゼロ、電気と償却はゼロではない
画像を拡大 16GBで70B、4090でCoder 480B、個人SWEのH100は買うな。インフラ記事はAPIホストでありデスクトップGPUではない。ウィザード:[ハブ](/ja/local-coding/)。