ローカルコーディングモデルを組む:スタック、重み、VRAM帯

スタックは安い。モデルサイズがハードウェアをロックする。重みが載っても目標コンテキストが載るとは限らない。

順序:スタック → モデル → ハードウェア

最も高い判断はハードウェアなので、本文は安い順。すでにMac/24GBがある人はウィザードを逆向きに使う。入口:[ローカルコーディング](/ja/local-coding/)。

Platform Stack
Desktop NVIDIA Ollama → llama.cpp → vLLM/SGLang (dedicated box)
Apple Silicon MLX first; llama.cpp / Ollama for GGUF portability
Laptop Never start with vLLM
IDE Point Continue / Aider / Cline at localhost

ノートでvLLMから始めない。AppleはMLX優先。詳細:[スタック](/ja/local-coding/stack/)。

ダウンロードでき、民生帯に載るコーディング重みだけ

名前ヒューリスティックでClaude/GPTをローカルに入れない。Allowlist:オープンライセンス、ダウンロード可、Q4が机の帯に載る。480B/284B MoEはAPIかラック。総合榜はSWEではない。[モデル頁](/ja/local-coding/models/)。[Qwen3.8-27B](/ja/insights/qwen3-8-27b-review/)。

VRAM帯:ロックはメモリでありTFLOPSではない

帯ごとのQ4級パラメータ 画像を拡大
帯はクラスであり街価ではない。
Band Typical class Max params (Q4 class) Workloads
16GB RTX 4060 / 5060 Ti 16GB class 8B Q4 class complete
24GB RTX 4090 24GB 32B Q4 class complete, agent
32GB RTX 5090 32GB class 40B Q4 class complete, agent, long
48GB 48GB workstation / dual-24 class 70B Q4 class complete, agent, long
80GB 80GB-class pro card 120B Q4 class complete, agent, long
128GB Mac Studio 128–192GB 180B Q4 class complete, agent, long
512GB Mac Studio 512GB 480B Q4 class complete, agent, long

重みが載っても目標コンテキストが載るとは限らない。詳細:[ハードウェア](/ja/local-coding/hardware/)。

TCO:トークン単価はゼロ、電気と償却はゼロではない

同一ジョブのAPI請求 vs ローカル 画像を拡大
100K+20K。ローカルは電気と償却。

16GBで70B、4090でCoder 480B、個人SWEのH100は買うな。インフラ記事はAPIホストでありデスクトップGPUではない。ウィザード:[ハブ](/ja/local-coding/)。

インサイト