Análise do Kimi K3: quão longe o carro-chefe open de 2.8T está de Claude e GPT
2.8T MoE, contexto 1M, $3/$15 (cache $0.30); AA Index 57, próximo de Fable/Sol, forte em coding agente de longo horizonte — e se vale subir do K2.6. Dados em 2026-07-22.
O que é
Kimi K3 é o carro-chefe da Moonshot AI, lançado em 2026-07-16: 2,8 trilhões de parâmetros em Stable LatentMoE (16/896 especialistas ativos por token), KDA e AttnRes, entrada nativa de imagem e vídeo, e contexto de 1M tokens. No blog oficial, a Moonshot diz que o K3 ainda fica atrás do Claude Fable 5 e do GPT 5.6 Sol, embora mostre desempenho de fronteira na sua própria bateria.
Em 2026-07-22 está disponível via Kimi.com, Kimi Work, Kimi Code e API Kimi; os pesos completos estão prometidos para 2026-07-27 e ainda não podem ser baixados — a Artificial Analysis classifica-o como modelo API proprietário.
Ficha técnica e arquitetura
Em números: contexto de 1M tokens; entradas texto, imagem e vídeo (docs API), saída texto. K3 traz ~2,5× de eficiência de escala vs K2 (Moonshot); QAT desde SFT com pesos MXFP4 e ativações MXFP8.
Raciocínio sempre ligado, reasoning_effort=max por padrão. Em multivolta e tool calls é preciso devolver a mensagem assistant completa (com reasoning) ou a qualidade colapsa — primeira limitação oficial. API: kimi-k3; OpenRouter: moonshotai/kimi-k3. K3 desbloqueia após recarga (mín. $1).
Preço e onde usar
Preço oficial da API Moonshot (tarifa fixa em 1M, sem faixas por comprimento): cache-hit $0.30/MTok, miss $3/MTok, saída $15/MTok. Este snapshot confirma $3/$15 no listing principal OpenRouter; moonshot-direct e SiliconFlow também mostram cache $0.30; Groq lista $3/$15.
Moonshot alega >90% de cache hit em cargas de coding — loops agent com prefixo longo reduzem o preço efetivo de entrada. Saída custa 5× o miss de entrada; saídas longas e tokens de reasoning inflam a conta.
Comparativo interno: K2.6 → K3
K3 não é um «K2.6 maior», e sim um salto geracional. Parâmetros ~1T→2.8T; contexto 262K→1M; visão→vídeo nativo; atenção migra para KDA+AttnRes.
No OpenRouter principal: K2.6 $0.684/$3.42 vs K3 $3/$15 — ~4,4× entrada/saída, ~4–5× misto. Capacidade: AA Intelligence Index v4.1 ~44 (K2.6) → ~57 (K3), terceiro independente, 2026-07-22.
Veredito: se o fluxo Kimi é coding autônomo, sensível a custo e 256K basta, K2.6 continua default. Pague o prémio 4–5× do K3 só se precisar de repo 1M, vídeo nativo ou teto mais próximo dos fechados de fronteira.
Lacuna real vs. a elite
Inteligência agregada: AA Intelligence Index v4.1 (metodologia única, independente) coloca Fable 5 ≈60, GPT 5.6 Sol ≈59, K3 ≈57, Opus 4.8 ≈56 — três pontos, mesma liga frontier. Moonshot também admite atraso global vs Fable/Sol.
Coding (tabela oficial Moonshot + terceiros, harness distintos): Sol lidera DeepSWE e Terminal-Bench 2.1; K3 forte em SWE Marathon, Program Bench e Frontend Code Arena #1; Fable em FrontierSWE e GDPval-AA v2 Elo.
Agente/conhecimento: Fable ganha JobBench e Briefcase; K3 BrowseComp, Automation e Spreadsheet. UX: thinking history sensível, excesso de iniciativa, atrás de Fable/Sol (Limitations); AA ~36 t/s e verbose no Index. Benchmarks externos, não proxy AI Hippo.
Custo na prática: dois cenários
Cálculo com listing principal OpenRouter deste snapshot (entrada miss), sem tokens extra de reasoning.
A — turno agent (100K in + 20K out): K3 ~$0.60, K2.6 ~$0.14, Sol ~$1.10, Fable ~$2.00. K3 ~4,3× K2.6, bem abaixo de Fable.
B — documento longo (500K in + 5K out): K3 miss ~$1.58; com 500K cache-hit, ~$0.30 total. Sol ~$2.65, Fable ~$5.25, K2.6 ~$0.36.
A vantagem do K3 aparece com prefixo longo e alto cache hit; reasoning longo aproxima a conta do custo por tarefa da AA. Comparação specs/custo, não benchmark de capacidade.
Quando escolher e quando não
Escolha K3: coding agente longo (terminal/browser), repo 1M, vídeo nativo, testar rota open perto da fronteira via API antes dos pesos, aceitando thinking obrigatório e restrições de harness.
Evite K3 / veja outro: entregáveis profissionais one-shot → Fable 5; ecossistema Claude Code maduro → Fable/Sol; throughput puro, custo mínimo, 256K basta → K2.6; pesos já descarregáveis → aguarde 2026-07-27 e valide licença/cluster.
Decida com páginas modelo/Token/compare da AI Hippo; ranking composto é proxy contexto/$, não benchmark de capacidade.
Checklist de implantação
Antes de integrar: o harness devolve todo o thinking history (ex. Kimi Code)? Evitou trocar para K3 no meio da sessão? Limitou proatividade no system prompt ou AGENTS.md?
Ops: prefixos longos para cache; monitorize tokens por tarefa (com reasoning). Após pesos 2026-07-27, self-host 2.8T MoE custa muito mais que K2.6 1T — calcule cluster antes de «open total».
Fontes
Evidence and actions
- Janela de tempo: catalog snapshot + vendor benchmarks (2026-07-22)
- Tamanho da amostra: 4
- Tipo de fonte: catalog_and_pricing
- Veja specs e preço do K3 em /pt/model/moonshotai-kimi-k3/
- Compare com K2.6 em /pt/model/moonshotai-kimi-k2.6/
- Confira preços em /pt/token/
- Compare com Fable 5 e GPT-5.6 Sol em /pt/compare/