Kimi K3 im Test: Wie weit ist das 2,8T-Open-Flaggschiff von Claude und GPT entfernt

2,8T MoE, 1M Kontext, $3/$15 (Cache $0.30); AA Index 57, dicht an Fable/Sol, stark bei Langzeit-Agent-Coding — und ob ein Upgrade von K2.6 lohnt. Stand 2026-07-22.

Was es ist

Kimi K3 ist Moonshot AIs Flaggschiff, veröffentlicht am 2026-07-16: 2,8 Billionen Parameter in Stable LatentMoE (16/896 aktive Experten pro Token), KDA und AttnRes, native Bild- und Video-Eingabe, 1M Token Kontext. Im offiziellen Blog schreibt Moonshot, K3 liege hinter Claude Fable 5 und GPT 5.6 Sol, zeige aber in der eigenen Evaluierung Frontier-Niveau.

Stand 2026-07-22 über Kimi.com, Kimi Work, Kimi Code und Kimi API verfügbar; volle Gewichte sind für 2026-07-27 versprochen und noch nicht herunterladbar — Artificial Analysis führt K3 als proprietäres API-Modell.

Datenblatt und Architektur

In Zahlen: 1M Token Kontext; Eingabe Text, Bild und Video (API-Docs), Ausgabe Text. K3 liefert ~2,5× Scaling-Effizienz vs. K2 (Moonshot); QAT ab SFT mit MXFP4-Gewichten und MXFP8-Aktivierungen.

Reasoning ist immer an, Standard reasoning_effort=max. Bei Multi-Turn und Tool Calls muss die vollständige Assistant-Nachricht (inkl. Reasoning) zurückgegeben werden — erste offizielle Limitation. API: kimi-k3; OpenRouter: moonshotai/kimi-k3. K3 nach Aufladung freigeschaltet (min. $1).

Preis und Bezugsquellen

Offizielle Moonshot-API-Preise (Pauschale über 1M, keine Längenstufen): Cache-Hit $0.30/MTok, Miss $3/MTok, Ausgabe $15/MTok. Dieser Snapshot verifiziert $3/$15 beim OpenRouter-Haupt-Listing; moonshot-direct und SiliconFlow zeigen ebenfalls Cache $0.30; Groq listet $3/$15.

Moonshot nennt >90% Cache-Hit bei Coding-Workloads — Agent-Schleifen mit langem Prefix senken den effektiven Eingabepreis. Ausgabe kostet 5× Miss-Eingabe; lange Ausgaben und Reasoning-Token treiben die Rechnung.

Interner Vergleich: K2.6 → K3

K3 ist kein „größeres K2.6“, sondern ein Generationssprung. Parameter ~1T→2,8T; Kontext 262K→1M; Vision→ natives Video; Attention wechselt zu KDA+AttnRes.

OpenRouter-Hauptlisting: K2.6 $0.684/$3.42 vs K3 $3/$15 — ~4,4× Ein-/Ausgabe, ~4–5× gemischt. Fähigkeit: AA Intelligence Index v4.1 ~44 (K2.6) → ~57 (K3), unabhängiger Dritter, 2026-07-22.

Fazit: autonomes Coding, kostensensibel, 256K reicht → K2.6 bleibt Default. K3-Premium 4–5× lohnt erst bei 1M-Repo, nativem Video oder näher am Closed-Frontier-Deckel.

Echter Abstand zur Spitze

Gesamtintelligenz: AA Intelligence Index v4.1 (eine Methodik, unabhängig) — Fable 5 ≈60, GPT 5.6 Sol ≈59, K3 ≈57, Opus 4.8 ≈56; drei Punkte, gleiche Frontier-Liga. Moonshot räumt ebenfalls Rückstand zu Fable/Sol ein.

Coding (offizielle Moonshot-Tabelle + Dritte, unterschiedliche Harness): Sol führt DeepSWE und Terminal-Bench 2.1; K3 stark bei SWE Marathon, Program Bench und Frontend Code Arena #1; Fable bei FrontierSWE und GDPval-AA v2 Elo.

Agent/Wissensarbeit: Fable gewinnt JobBench und Briefcase; K3 BrowseComp, Automation und Spreadsheet. UX: thinking-history-sensitiv, überaktiv, hinter Fable/Sol (Limitations); AA ~36 t/s und verbose im Index. Externe Benchmarks, kein AI-Hippo-Proxy.

Kosten in der Praxis: zwei Szenarien

Rechnung mit OpenRouter-Hauptlisting dieses Snapshots (Miss-Eingabe), ohne extra Reasoning-Tokens.

A — Agent-Coding-Runde (100K in + 20K out): K3 ~$0.60, K2.6 ~$0.14, Sol ~$1.10, Fable ~$2.00. K3 ~4,3× K2.6, deutlich unter Fable.

B — Langdokument (500K in + 5K out): K3 miss ~$1.58; bei 500K Cache-Hit ~$0.30 gesamt. Sol ~$2.65, Fable ~$5.25, K2.6 ~$0.36.

K3-Vorteil maximal bei langem Prefix und hohem Cache-Hit; langes Reasoning nähert die Rechnung AA-Kosten pro Task. Spec-/Kostenvergleich, kein Fähigkeits-Benchmark.

Wann wählen, wann nicht

K3 wählen: Langzeit-Agent-Coding (Terminal/Browser), 1M-Repo, natives Video, open-Route nahe Frontier per API vor Gewichten testen, obligatorisches Thinking und Harness-Constraints akzeptieren.

K3 meiden / anders schauen: One-shot-Profi-Lieferungen → Fable 5; reifes Claude-Code-Ökosystem → Fable/Sol; reiner Durchsatz, minimaler Preis, 256K reicht → K2.6; sofort downloadbare Gewichte → erst nach 2026-07-27 Lizenz/Cluster prüfen.

Entscheiden mit AI-Hippo-Modell/Token/Compare-Seiten; Composite-Rang ist Kontext-pro-Dollar-Proxy, kein Fähigkeits-Benchmark.

Deployment-Checkliste

Vor Integration: Gibt der Harness die komplette Thinking-History zurück (z. B. Kimi Code)? Kein Modellwechsel zu K3 mitten in der Session? Proaktivität in System-Prompt oder AGENTS.md begrenzt?

Betrieb: lange Prefixe für Cache; Tokens pro Task (inkl. Reasoning) überwachen. Nach Gewichten 2026-07-27 kostet Self-Host 2.8T MoE deutlich mehr als 1T K2.6 — Cluster zuerst rechnen.

Quellen

Evidence and actions

  • Zeitfenster: catalog snapshot + vendor benchmarks (2026-07-22)
  • Stichprobengröße: 4
  • Quellentyp: catalog_and_pricing
  • K3-Specs und Preis auf /de/model/moonshotai-kimi-k3/
  • Mit K2.6 auf /de/model/moonshotai-kimi-k2.6/ vergleichen
  • Preise auf /de/token/ prüfen
  • Mit Fable 5 und GPT-5.6 Sol auf /de/compare/ vergleichen

Insights