Kimi K3 im Test: Wie weit ist das 2,8T-Open-Flaggschiff von Claude und GPT entfernt
2,8T MoE, 1M Kontext, $3/$15 (Cache $0.30); AA Index 57, dicht an Fable/Sol, stark bei Langzeit-Agent-Coding — und ob ein Upgrade von K2.6 lohnt. Stand 2026-07-22.
Was es ist
Kimi K3 ist Moonshot AIs Flaggschiff, veröffentlicht am 2026-07-16: 2,8 Billionen Parameter in Stable LatentMoE (16/896 aktive Experten pro Token), KDA und AttnRes, native Bild- und Video-Eingabe, 1M Token Kontext. Im offiziellen Blog schreibt Moonshot, K3 liege hinter Claude Fable 5 und GPT 5.6 Sol, zeige aber in der eigenen Evaluierung Frontier-Niveau.
Stand 2026-07-22 über Kimi.com, Kimi Work, Kimi Code und Kimi API verfügbar; volle Gewichte sind für 2026-07-27 versprochen und noch nicht herunterladbar — Artificial Analysis führt K3 als proprietäres API-Modell.
Datenblatt und Architektur
In Zahlen: 1M Token Kontext; Eingabe Text, Bild und Video (API-Docs), Ausgabe Text. K3 liefert ~2,5× Scaling-Effizienz vs. K2 (Moonshot); QAT ab SFT mit MXFP4-Gewichten und MXFP8-Aktivierungen.
Reasoning ist immer an, Standard reasoning_effort=max. Bei Multi-Turn und Tool Calls muss die vollständige Assistant-Nachricht (inkl. Reasoning) zurückgegeben werden — erste offizielle Limitation. API: kimi-k3; OpenRouter: moonshotai/kimi-k3. K3 nach Aufladung freigeschaltet (min. $1).
Preis und Bezugsquellen
Offizielle Moonshot-API-Preise (Pauschale über 1M, keine Längenstufen): Cache-Hit $0.30/MTok, Miss $3/MTok, Ausgabe $15/MTok. Dieser Snapshot verifiziert $3/$15 beim OpenRouter-Haupt-Listing; moonshot-direct und SiliconFlow zeigen ebenfalls Cache $0.30; Groq listet $3/$15.
Moonshot nennt >90% Cache-Hit bei Coding-Workloads — Agent-Schleifen mit langem Prefix senken den effektiven Eingabepreis. Ausgabe kostet 5× Miss-Eingabe; lange Ausgaben und Reasoning-Token treiben die Rechnung.
Interner Vergleich: K2.6 → K3
K3 ist kein „größeres K2.6“, sondern ein Generationssprung. Parameter ~1T→2,8T; Kontext 262K→1M; Vision→ natives Video; Attention wechselt zu KDA+AttnRes.
OpenRouter-Hauptlisting: K2.6 $0.684/$3.42 vs K3 $3/$15 — ~4,4× Ein-/Ausgabe, ~4–5× gemischt. Fähigkeit: AA Intelligence Index v4.1 ~44 (K2.6) → ~57 (K3), unabhängiger Dritter, 2026-07-22.
Fazit: autonomes Coding, kostensensibel, 256K reicht → K2.6 bleibt Default. K3-Premium 4–5× lohnt erst bei 1M-Repo, nativem Video oder näher am Closed-Frontier-Deckel.
Echter Abstand zur Spitze
Gesamtintelligenz: AA Intelligence Index v4.1 (eine Methodik, unabhängig) — Fable 5 ≈60, GPT 5.6 Sol ≈59, K3 ≈57, Opus 4.8 ≈56; drei Punkte, gleiche Frontier-Liga. Moonshot räumt ebenfalls Rückstand zu Fable/Sol ein.
Coding (offizielle Moonshot-Tabelle + Dritte, unterschiedliche Harness): Sol führt DeepSWE und Terminal-Bench 2.1; K3 stark bei SWE Marathon, Program Bench und Frontend Code Arena #1; Fable bei FrontierSWE und GDPval-AA v2 Elo.
Agent/Wissensarbeit: Fable gewinnt JobBench und Briefcase; K3 BrowseComp, Automation und Spreadsheet. UX: thinking-history-sensitiv, überaktiv, hinter Fable/Sol (Limitations); AA ~36 t/s und verbose im Index. Externe Benchmarks, kein AI-Hippo-Proxy.
Kosten in der Praxis: zwei Szenarien
Rechnung mit OpenRouter-Hauptlisting dieses Snapshots (Miss-Eingabe), ohne extra Reasoning-Tokens.
A — Agent-Coding-Runde (100K in + 20K out): K3 ~$0.60, K2.6 ~$0.14, Sol ~$1.10, Fable ~$2.00. K3 ~4,3× K2.6, deutlich unter Fable.
B — Langdokument (500K in + 5K out): K3 miss ~$1.58; bei 500K Cache-Hit ~$0.30 gesamt. Sol ~$2.65, Fable ~$5.25, K2.6 ~$0.36.
K3-Vorteil maximal bei langem Prefix und hohem Cache-Hit; langes Reasoning nähert die Rechnung AA-Kosten pro Task. Spec-/Kostenvergleich, kein Fähigkeits-Benchmark.
Wann wählen, wann nicht
K3 wählen: Langzeit-Agent-Coding (Terminal/Browser), 1M-Repo, natives Video, open-Route nahe Frontier per API vor Gewichten testen, obligatorisches Thinking und Harness-Constraints akzeptieren.
K3 meiden / anders schauen: One-shot-Profi-Lieferungen → Fable 5; reifes Claude-Code-Ökosystem → Fable/Sol; reiner Durchsatz, minimaler Preis, 256K reicht → K2.6; sofort downloadbare Gewichte → erst nach 2026-07-27 Lizenz/Cluster prüfen.
Entscheiden mit AI-Hippo-Modell/Token/Compare-Seiten; Composite-Rang ist Kontext-pro-Dollar-Proxy, kein Fähigkeits-Benchmark.
Deployment-Checkliste
Vor Integration: Gibt der Harness die komplette Thinking-History zurück (z. B. Kimi Code)? Kein Modellwechsel zu K3 mitten in der Session? Proaktivität in System-Prompt oder AGENTS.md begrenzt?
Betrieb: lange Prefixe für Cache; Tokens pro Task (inkl. Reasoning) überwachen. Nach Gewichten 2026-07-27 kostet Self-Host 2.8T MoE deutlich mehr als 1T K2.6 — Cluster zuerst rechnen.
Quellen
Evidence and actions
- Zeitfenster: catalog snapshot + vendor benchmarks (2026-07-22)
- Stichprobengröße: 4
- Quellentyp: catalog_and_pricing
- K3-Specs und Preis auf /de/model/moonshotai-kimi-k3/
- Mit K2.6 auf /de/model/moonshotai-kimi-k2.6/ vergleichen
- Preise auf /de/token/ prüfen
- Mit Fable 5 und GPT-5.6 Sol auf /de/compare/ vergleichen