Kimi K3 深度测评:2.8T 开源旗舰离 Claude / GPT 还有多远

2.8T MoE、1M 上下文、$3/$15(cache $0.30);AA Index 57,紧贴 Fable/Sol,却在长程 agent 编码上抢戏——以及相对 K2.6 该不该升级。数据截止 2026-07-22。

它是什么

Kimi K3 是 Moonshot AI 于 2026-07-16 上线的旗舰模型:2.8 万亿参数 Stable LatentMoE(每 token 激活 16/896 专家),基于 Kimi Delta Attention(KDA)与 Attention Residuals(AttnRes),原生支持视觉与视频输入,上下文 100 万 token。Moonshot 在官方技术博客中明确写道:K3 整体能力仍落后于 Claude Fable 5 与 GPT 5.6 Sol,但在其自评套件中已展现前沿级表现。

截至 2026-07-22,K3 可通过 Kimi.com、Kimi Work、Kimi Code 与 Kimi API 调用;完整权重承诺于 2026-07-27 发布,发稿时尚未可下载——Artificial Analysis 仍将其归类为 proprietary API 模型。

规格与架构速览(参数党)

硬指标:100 万 token 上下文;输入模态为文本、图像与视频(API 文档),输出为文本。架构上,K3 相对 Kimi K2 约有 2.5× 的整体 scaling efficiency(官方表述);SFT 阶段起采用 MXFP4 权重 + MXFP8 激活的量化感知训练。

推理侧,K3 始终开启 thinking 模式,默认 reasoning_effort=max(low/high 后续开放);多轮与 tool call 必须回传完整 assistant 消息(含 reasoning),否则质量可能崩溃——这是官方 Limitations 中强调的第一条。API 模型 ID 为 kimi-k3;OpenRouter 为 moonshotai/kimi-k3。K3 为充值解锁的旗舰 SKU(最低 $1 充值)。

定价与在哪调用

Moonshot 官方 API 定价(全 1M 窗口一口价,无长度分档):cache-hit 输入 $0.30/MTok、cache-miss 输入 $3/MTok、输出 $15/MTok。本快照在 OpenRouter 主 listing(is_primary_listing=1)验证为 $3/$15;moonshot-direct 与 SiliconFlow 同样标注 cache $0.30;Groq 亦列出 $3/$15。

官方称 coding 工作负载下 cache hit 率可超 90%——长前缀 agent 环会显著拉低有效输入价。输出价是 miss 输入的 5 倍,长输出与 reasoning token 会放大账单。

家族内部对比:K2.6 → K3(测评)

K3 不是「更大的 K2.6」,而是一次架构代际跃迁。参数从约 1T 升至 2.8T;上下文从 262K 扩至 1M;模态从 vision 扩展到原生 video;注意力从 prior stack 换到 KDA + AttnRes。

价格层面,OpenRouter 主 listing 上 K2.6 为 $0.684/$3.42,K3 为 $3/$15——输入约 4.4×、输出约 4.4×,混合价约 4–5×。能力上,Artificial Analysis Intelligence Index v4.1 约从 K2.6 的 44 跃升至 K3 的 57(独立第三方,2026-07-22)。

选型结论:若你的 Kimi 工作流以长程自主编码、成本敏感、256K 够用为主,K2.6 仍是合理默认。若需要 1M 整仓、原生视频理解、或更接近闭源前沿的能力上限,才值得为 K3 付 4–5× 溢价。

与行业头部的真实差距(测评)

综合智力:Artificial Analysis Intelligence Index v4.1(同一方法论、独立运行)给出 Claude Fable 5 ≈60、GPT 5.6 Sol ≈59、Kimi K3 ≈57、Claude Opus 4.8 ≈56——三点级差,属于「同档前沿」而非碾压。Moonshot 官方亦承认整体仍落后 Fable 5 与 Sol。

编码分裂(来源:Moonshot 官方 benchmark 表 + 第三方解读,harness 不同不可直接横比):Sol 在 DeepSWE(73.0)与 Terminal-Bench 2.1(88.8)领先;K3 在 SWE Marathon(42.0 vs Fable 35.0)、Program Bench(77.8)与 Frontend Code Arena(#1)更强;Fable 在 FrontierSWE(86.6)与 GDPval-AA v2 Elo(1760 vs K3 1668)领先。

Agent / 知识工作:Fable 在 JobBench、AA-Briefcase 更高;K3 在 BrowseComp(91.2)、AutomationBench、SpreadsheetBench 2 等 agent 向基准突出。体验侧,官方 Limitations 指出 thinking history 敏感、过度主动、UX 仍逊 Fable/Sol;AA 测得 K3 输出偏慢(~36 t/s)且 Index 评测 token 用量偏高——标价便宜不等于每任务便宜。以上均为外部 benchmark,非 AI Hippo 站内代理指标。

成本实测:两个场景(测评)

以下用本快照 OpenRouter 主 listing 单价推算(cache-miss 输入),不含 reasoning 冗余 token。

场景 A — agent 编码一轮(10 万输入 + 2 万输出):K3 约 $0.60($0.30+$0.30),K2.6 约 $0.14,GPT-5.6 Sol 约 $1.10,Fable 5 约 $2.00。K3 约为 K2.6 的 4.3×,但仍远低于 Fable。

场景 B — 长文档一轮(50 万输入 + 5 千输出):K3 miss 约 $1.58;若 50 万输入全部 cache-hit($0.30),同一轮约 $0.23 输入 + $0.075 输出 ≈ $0.30。Sol 约 $2.65,Fable 约 $5.25,K2.6 约 $0.36。

结论:K3 的定价优势在「长前缀 + 高 cache hit」的 agent 环里最明显;一旦 reasoning 拉长输出,真实账单会向 AA 的「每任务成本」靠拢。以上为规格与成本对比,非能力基准测试。

何时选它、何时别选

选 K3:长程 agent 编码(终端/浏览器环)、1M 整仓或长文档、需要原生视频理解、想在权重落地前以 API 试用接近前沿的开源路线、且能接受强制 thinking 与 harness 约束。

别选 K3 / 看别的:单次高质量专业交付(法律、财务建模)优先 Fable 5;要成熟 Claude Code 生态与最低 UX 摩擦 → Fable/Sol;纯吞吐、成本极敏感、256K 够用 → 留 K2.6;需要已可下载权重自建 → 等到 2026-07-27 后确认许可证与集群成本再决定。

用 AI Hippo 模型页、Token 页与对比页做定量取舍,而不是只看综合榜名次(该分数是上下文/美元代理指标,非能力 benchmark)。

落地检查清单

集成前请核对:harness 是否回传完整 thinking history(官方推荐 Kimi Code 等已验证兼容栈);是否在会话中途从其它模型切换到 K3(会触发质量不稳定);是否在 system prompt 或 AGENTS.md 中约束 K3 的过度主动行为。

运维侧:coding agent 应设计长前缀以利于 prefix cache;监控每任务 token(含 reasoning)而不只看标价。权重若于 2026-07-27 后发布,2.8T MoE 自建成本远高于 1T 级 K2.6——先算集群再谈「完全开源」。

来源

证据与行动建议

  • 时间窗口: catalog snapshot + vendor benchmarks (2026-07-22)
  • 观测数量: 4
  • 来源类型: catalog_and_pricing
  • 在 /zh/model/moonshotai-kimi-k3/ 查看 K3 完整规格与定价
  • 在 /zh/model/moonshotai-kimi-k2.6/ 对比家族上一代 K2.6
  • 用 /zh/token/ 核对 OpenRouter / moonshot-direct 报价
  • 在 /zh/compare/ 与 Fable 5、GPT-5.6 Sol 并排比较

洞察