Test de Kimi K3 : à quelle distance le fleuron open de 2,8T se tient-il de Claude et GPT

2,8T MoE, contexte 1M, $3/$15 (cache $0.30) ; AA Index 57, proche de Fable/Sol, fort en coding agent long — et faut-il quitter K2.6. Données au 2026-07-22.

Ce que c’est

Kimi K3 est le fleuron de Moonshot AI, lancé le 2026-07-16 : 2,8 billions de paramètres en Stable LatentMoE (16/896 experts actifs par token), KDA et AttnRes, entrée native image et vidéo, contexte 1M tokens. Sur son blog officiel, Moonshot indique que K3 reste derrière Claude Fable 5 et GPT 5.6 Sol, tout en montrant des résultats de frontière dans sa propre batterie.

Au 2026-07-22, disponible via Kimi.com, Kimi Work, Kimi Code et l’API Kimi ; les poids complets sont promis pour le 2026-07-27 et ne sont pas encore téléchargeables — Artificial Analysis le classe comme modèle API propriétaire.

Fiche technique et architecture

En chiffres : contexte 1M tokens ; entrées texte, image et vidéo (docs API), sortie texte. K3 apporte ~2,5× d’efficacité de scaling vs K2 (Moonshot) ; QAT dès le SFT avec poids MXFP4 et activations MXFP8.

Le raisonnement est toujours actif, reasoning_effort=max par défaut. En multi-tours et tool calls, renvoyer le message assistant complet (reasoning inclus) sous peine d’instabilité — première limitation officielle. API : kimi-k3 ; OpenRouter : moonshotai/kimi-k3. K3 débloqué après recharge (min. $1).

Prix et où l’exécuter

Tarifs officiels API Moonshot (forfait sur 1M, sans paliers de longueur) : cache-hit $0.30/MTok, miss $3/MTok, sortie $15/MTok. Ce snapshot vérifie $3/$15 sur le listing principal OpenRouter ; moonshot-direct et SiliconFlow affichent aussi cache $0.30 ; Groq liste $3/$15.

Moonshot annonce >90% de cache hit en coding — les boucles agent à long préfixe abaissent le prix effectif d’entrée. La sortie coûte 5× le miss d’entrée ; longues sorties et tokens de reasoning gonflent la facture.

Comparaison interne : K2.6 → K3

K3 n’est pas un « K2.6 plus grand », mais un saut générationnel. Paramètres ~1T→2,8T ; contexte 262K→1M ; vision→vidéo native ; attention passe à KDA+AttnRes.

Sur OpenRouter principal : K2.6 $0.684/$3.42 vs K3 $3/$15 — ~4,4× entrée/sortie, ~4–5× mixte. Capacité : AA Intelligence Index v4.1 ~44 (K2.6) → ~57 (K3), tiers indépendant, 2026-07-22.

Verdict : flux Kimi centré coding autonome, coût sensible, 256K suffisant → K2.6 reste le défaut. Le premium 4–5× de K3 ne se justifie que pour repo 1M, vidéo native ou plafond proche des fermés de frontière.

Écart réel vs. l’élite

Intelligence agrégée : AA Intelligence Index v4.1 (méthode unique, indépendant) place Fable 5 ≈60, GPT 5.6 Sol ≈59, K3 ≈57, Opus 4.8 ≈56 — trois points, même ligue frontier. Moonshot admet aussi un retard global vs Fable/Sol.

Coding (table officielle Moonshot + tiers, harness différents) : Sol mène DeepSWE et Terminal-Bench 2.1 ; K3 fort sur SWE Marathon, Program Bench et Frontend Code Arena #1 ; Fable sur FrontierSWE et GDPval-AA v2 Elo.

Agent/connaissance : Fable gagne JobBench et Briefcase ; K3 BrowseComp, Automation et Spreadsheet. UX : thinking history sensible, trop proactif, derrière Fable/Sol (Limitations) ; AA ~36 t/s et verbose sur l’Index. Benchmarks externes, pas proxy AI Hippo.

Coût en pratique : deux scénarios

Calcul avec le listing principal OpenRouter de ce snapshot (entrée miss), hors tokens reasoning supplémentaires.

A — tour agent (100K in + 20K out) : K3 ~$0.60, K2.6 ~$0.14, Sol ~$1.10, Fable ~$2.00. K3 ~4,3× K2.6, bien sous Fable.

B — long document (500K in + 5K out) : K3 miss ~$1.58 ; 500K cache-hit → ~$0.30 total. Sol ~$2.65, Fable ~$5.25, K2.6 ~$0.36.

L’avantage K3 est maximal avec long préfixe et fort cache hit ; reasoning long rapproche la facture du coût par tâche AA. Comparaison specs/coût, pas benchmark de capacité.

Quand le choisir ou non

Choisir K3 : coding agent long (terminal/navigateur), repo 1M, vidéo native, tester la voie open proche frontier via API avant les poids, en acceptant thinking obligatoire et contraintes harness.

Éviter K3 / regarder ailleurs : livrables pro one-shot → Fable 5 ; écosystème Claude Code mature → Fable/Sol ; throughput pur, coût minimal, 256K suffit → K2.6 ; poids téléchargeables déjà → attendre 2026-07-27 et valider licence/cluster.

Tranchez avec les pages modèle/Token/compare d’AI Hippo ; le classement composite est un proxy contexte/$, pas un benchmark de capacité.

Checklist de déploiement

Avant intégration : le harness renvoie-t-il tout le thinking history (ex. Kimi Code) ? Pas de bascule vers K3 en milieu de session ? Contraintes de proactivité dans system prompt ou AGENTS.md ?

Ops : longs préfixes pour le cache ; surveillez les tokens par tâche (reasoning inclus). Après poids 2026-07-27, self-host 2.8T MoE coûte bien plus que K2.6 1T — chiffrez le cluster avant « open total ».

Sources

Evidence and actions

  • Fenêtre temporelle: catalog snapshot + vendor benchmarks (2026-07-22)
  • Taille de l’échantillon: 4
  • Type de source: catalog_and_pricing
  • Voir specs et prix K3 sur /fr/model/moonshotai-kimi-k3/
  • Comparer à K2.6 sur /fr/model/moonshotai-kimi-k2.6/
  • Vérifier les prix sur /fr/token/
  • Comparer à Fable 5 et GPT-5.6 Sol sur /fr/compare/

Insights