Kimi K3 詳細レビュー:2.8T オープン旗艦は Claude / GPT からどれだけ離れているか

2.8T MoE、1Mコンテキスト、$3/$15(cache $0.30)。AA Index 57でFable/Solに迫り、長期エージェントコーディングで際立つ——K2.6からのアップグレード判断。2026-07-22時点。

概要

Kimi K3 は Moonshot AI が 2026-07-16 に公開した旗艦モデルです:2.8兆パラメータの Stable LatentMoE(トークンあたり16/896エキスパート)、KDA と AttnRes、ネイティブな視覚・動画入力、100万トークンのコンテキスト。公式ブログでは、K3 は Claude Fable 5 と GPT 5.6 Sol には及ばないが、自社評価ではフロンティア級の結果を示すと明記しています。

2026-07-22時点で Kimi.com、Kimi Work、Kimi Code、Kimi API から利用可能。完全な重みは 2026-07-27 公開予定で、執筆時点では未配布——Artificial Analysis は proprietary API モデルとして分類しています。

スペックとアーキテクチャ

主要指標:100万トークンのコンテキスト。入力はテキスト・画像・動画(APIドキュメント)、出力はテキスト。K3 は K2 比で約2.5×の scaling efficiency(公式)。SFT から MXFP4 重み + MXFP8 活性化の QAT。

推論は常時 thinking、デフォルト reasoning_effort=max。マルチターンと tool call では assistant メッセージ全体(reasoning 含む)を返す必要があり、さもなくば品質が不安定——公式 Limitations の第一項。API ID は kimi-k3、OpenRouter は moonshotai/kimi-k3。K3 はチャージ解除の旗艦 SKU(最低 $1)。

価格と利用先

Moonshot 公式 API 価格(1M 窓で一律):cache-hit 入力 $0.30/MTok、miss 入力 $3/MTok、出力 $15/MTok。本スナップショットでは OpenRouter 主 listing で $3/$15 を確認;moonshot-direct と SiliconFlow も cache $0.30、Groq も $3/$15。

公式はコーディング負荷で cache hit 90%超と称する——長い prefix の agent ループは実効入力単価を下げる。出力は miss 入力の5倍で、長い出力と reasoning token が請求を膨らませる。

ファミリー内比較:K2.6 → K3

K3 は「大きい K2.6」ではなくアーキテクチャ世代の飛躍です。パラメータ ~1T→2.8T、コンテキスト 262K→1M、vision→ネイティブ video、attention は KDA+AttnRes へ。

OpenRouter 主 listing では K2.6 $0.684/$3.42、K3 $3/$15——入出力とも約4.4×、混合約4–5×。能力は AA Intelligence Index v4.1 で K2.6 ~44 から K3 ~57(独立、2026-07-22)。

選定:長期自律コーディングでコスト重視・256K で足りるなら K2.6 がデフォルト。1M リポジトリ、ネイティブ動画、閉源フロンティアに近い上限が必要なら K3 の4–5×プレミアムを払う価値あり。

業界トップとの実ギャップ

総合:AA Intelligence Index v4.1(同一手法・独立)で Fable 5 ≈60、GPT 5.6 Sol ≈59、K3 ≈57、Opus 4.8 ≈56——3点差で「同格フロンティア」。Moonshot も Fable/Sol には及ばないと公言。

コーディング(Moonshot 公式表+第三者、harness 差あり):Sol が DeepSWE・Terminal-Bench 2.1 首位;K3 が SWE Marathon・Program Bench・Frontend Code Arena #1;Fable が FrontierSWE・GDPval-AA v2 Elo 首位。

Agent/ナレッジ:Fable が JobBench・Briefcase 優位;K3 が BrowseComp・Automation・Spreadsheet 優位。UX は thinking history 敏感・過剰能動・Fable/Sol より劣る(公式 Limitations)。AA は ~36 t/s と Index で verbose。外部ベンチであり AI Hippo 代理指標ではない。

コスト実測:2つのシナリオ

以下は本スナップショット OpenRouter 主 listing(miss 入力)での試算。reasoning 冗長 token は含まない。

A — agent コーディング1ターン(10万 in + 2万 out):K3 ~$0.60、K2.6 ~$0.14、Sol ~$1.10、Fable ~$2.00。K3 は K2.6 の約4.3×だが Fable よりはるかに安い。

B — 長文書(50万 in + 5千 out):K3 miss ~$1.58;50万が全 cache-hit なら ~$0.30。Sol ~$2.65、Fable ~$5.25、K2.6 ~$0.36。

K3 の価格優位は長 prefix + 高 cache hit の agent ループで最大。reasoning が出力を伸ばすと AA のタスク単価に近づく。スペック/コスト比較であり能力ベンチマークではない。

選ぶとき・避けるとき

K3 を選ぶ:長期 agent コーディング(端末/ブラウザ)、1M リポジトリ、ネイティブ動画、重み公開前に API でフロンティアに近い open 路線を試す場合。強制 thinking と harness 制約を受け入れられること。

避ける/他を見る:一回性の高品質プロ交付は Fable 5;Claude Code 成熟 UX → Fable/Sol;スループット重視・256K で足りる → K2.6;DL 可能な重みで自前 → 2026-07-27 以降にライセンスとクラスタコスト確認。

AI Hippo のモデル/Token/比較ページで定量判断。総合榜はコンテキスト/ドル代理指標。

導入チェックリスト

統合前:harness が thinking history を完全返却するか(Kimi Code 等);セッション途中で他モデルから K3 に切り替えていないか;system prompt/AGENTS.md で過剰能動を制約したか。

運用:長 prefix で cache を設計;タスクあたり token(reasoning 含む)を監視。2026-07-27 以降の重み公開時、2.8T MoE 自前は 1T K2.6 より遥かに高コスト——クラスタ試算を先に。

出典

Evidence and actions

  • 期間: catalog snapshot + vendor benchmarks (2026-07-22)
  • 観測数: 4
  • ソース種別: catalog_and_pricing
  • /ja/model/moonshotai-kimi-k3/ でK3の仕様と価格を確認
  • /ja/model/moonshotai-kimi-k2.6/ でK2.6と比較
  • /ja/token/ でOpenRouter/moonshot-directの価格を確認
  • /ja/compare/ でFable 5・GPT-5.6 Solと並べて比較

インサイト