Обзор Kimi K3: насколько открытый флагман 2.8T отстаёт от Claude и GPT

2.8T MoE, контекст 1M, $3/$15 (cache $0.30); AA Index 57, близко к Fable/Sol, силён в длинном agent-кодинге — и стоит ли апгрейд с K2.6. Данные на 2026-07-22.

Что это

Kimi K3 — флагман Moonshot AI, выпущенный 2026-07-16: 2,8 трлн параметров в Stable LatentMoE (16/896 активных экспертов на токен), KDA и AttnRes, нативный ввод изображений и видео, контекст 1M токенов. В официальном блоге Moonshot прямо пишет, что K3 всё ещё уступает Claude Fable 5 и GPT 5.6 Sol, но в собственной батарее показывает frontier-уровень.

На 2026-07-22 доступен через Kimi.com, Kimi Work, Kimi Code и Kimi API; полные веса обещаны к 2026-07-27 и пока не скачиваются — Artificial Analysis классифицирует модель как proprietary API.

Характеристики и архитектура

В цифрах: контекст 1M токенов; ввод — текст, изображение и видео (доки API), вывод — текст. K3 даёт ~2,5× scaling efficiency относительно K2 (Moonshot); QAT с SFT с весами MXFP4 и активациями MXFP8.

Reasoning всегда включён, по умолчанию reasoning_effort=max. В мультитуровых диалогах и tool calls нужно возвращать полное assistant-сообщение (с reasoning), иначе качество рушится — первое официальное ограничение. API: kimi-k3; OpenRouter: moonshotai/kimi-k3. K3 разблокируется после пополнения (мин. $1).

Цена и где запускать

Официальные цены API Moonshot (единая ставка на 1M, без ступеней по длине): cache-hit $0.30/MTok, miss $3/MTok, вывод $15/MTok. В этом снапшоте OpenRouter primary listing подтверждает $3/$15; moonshot-direct и SiliconFlow также указывают cache $0.30; Groq — $3/$15.

Moonshot заявляет >90% cache hit в coding-нагрузках — agent-циклы с длинным префиксом снижают эффективную цену ввода. Вывод стоит в 5× дороже miss-ввода; длинные ответы и reasoning-токены раздувают счёт.

Внутреннее сравнение: K2.6 → K3

K3 — не «больший K2.6», а смена поколения архитектуры. Параметры ~1T→2.8T; контекст 262K→1M; vision→нативное video; attention переходит на KDA+AttnRes.

OpenRouter primary: K2.6 $0.684/$3.42 vs K3 $3/$15 — ~4.4× на ввод/вывод, ~4–5× смешанно. Способности: AA Intelligence Index v4.1 ~44 (K2.6) → ~57 (K3), независимый источник, 2026-07-22.

Вывод: если Kimi-пайплайн — автономный кодинг, чувствителен к цене и хватает 256K, K2.6 остаётся дефолтом. Премия K3 4–5× оправдана только при нужде в 1M-репо, нативном video или потолке ближе к closed frontier.

Реальный разрыв с лидерами

Сводная способность: AA Intelligence Index v4.1 (единая методика, независимо) — Fable 5 ≈60, GPT 5.6 Sol ≈59, K3 ≈57, Opus 4.8 ≈56; три балла, одна frontier-лига. Moonshot тоже признаёт общее отставание от Fable/Sol.

Кодинг (официальная таблица Moonshot + третьи стороны, разные harness): Sol лидирует DeepSWE и Terminal-Bench 2.1; K3 силён в SWE Marathon, Program Bench и Frontend Code Arena #1; Fable — FrontierSWE и GDPval-AA v2 Elo.

Agent/знаниевая работа: Fable выигрывает JobBench и Briefcase; K3 — BrowseComp, Automation и Spreadsheet. UX: чувствительность к thinking history, избыточная инициатива, позади Fable/Sol (Limitations); AA ~36 t/s и verbose в Index. Внешние бенчмарки, не прокси AI Hippo.

Стоимость на практике: два сценария

Расчёт по primary listing OpenRouter этого снапшота (miss-ввод), без лишних reasoning-токенов.

A — agent-ход (100K in + 20K out): K3 ~$0.60, K2.6 ~$0.14, Sol ~$1.10, Fable ~$2.00. K3 ~4.3× K2.6, но намного дешевле Fable.

B — длинный документ (500K in + 5K out): K3 miss ~$1.58; при 500K cache-hit ~$0.30 всего. Sol ~$2.65, Fable ~$5.25, K2.6 ~$0.36.

Преимущество K3 максимально при длинном префиксе и высоком cache hit; длинный reasoning приближает счёт к стоимости задачи AA. Сравнение спеков/стоимости, не бенчмарк возможностей.

Когда выбирать, когда нет

Выбирать K3: длинный agent-кодинг (терминал/браузер), repo 1M, нативное video, пробовать open-маршрут близко к frontier через API до весов, принимая обязательный thinking и ограничения harness.

Не K3 / смотреть иначе: one-shot профессиональные deliverables → Fable 5; зрелая экосистема Claude Code → Fable/Sol; чистый throughput, минимальная цена, хватает 256K → K2.6; уже скачиваемые веса → ждать 2026-07-27 и проверить лицензию/кластер.

Решайте по страницам model/Token/compare AI Hippo; сводный рейтинг — прокси контекст/$, не бенчмарк возможностей.

Чеклист внедрения

Перед интеграцией: harness возвращает полную thinking history (напр. Kimi Code)? Не переключались ли на K3 посреди сессии? Ограничена ли избыточная инициатива в system prompt или AGENTS.md?

Эксплуатация: длинные префиксы под cache; мониторинг токенов на задачу (с reasoning). После весов 2026-07-27 self-host 2.8T MoE намного дороже 1T K2.6 — сначала посчитайте кластер.

Инсайты