Análisis de Kimi K3: qué tan lejos está el buque insignia open de 2.8T de Claude y GPT
2.8T MoE, contexto 1M, $3/$15 (cache $0.30); AA Index 57, cerca de Fable/Sol, fuerte en coding agente de largo horizonte — y si conviene subir desde K2.6. Datos al 2026-07-22.
Qué es
Kimi K3 es el buque insignia de Moonshot AI, lanzado el 2026-07-16: 2,8 billones de parámetros en Stable LatentMoE (16/896 expertos activos por token), KDA y AttnRes, entrada nativa de imagen y vídeo, y 1M de tokens de contexto. En su blog oficial, Moonshot afirma que K3 aún va por detrás de Claude Fable 5 y GPT 5.6 Sol, aunque muestra resultados de frontera en su propia batería.
Al 2026-07-22 está disponible vía Kimi.com, Kimi Work, Kimi Code y la API de Kimi; los pesos completos están prometidos para el 2026-07-27 y aún no se pueden descargar — Artificial Analysis lo clasifica como modelo API propietario.
Ficha técnica y arquitectura
En cifras: contexto de 1M tokens; entradas texto, imagen y vídeo (docs API), salida texto. K3 ofrece ~2,5× de eficiencia de escalado frente a K2 (Moonshot); QAT desde SFT con pesos MXFP4 y activaciones MXFP8.
El razonamiento está siempre activo, reasoning_effort=max por defecto. En multivuelta y tool calls hay que devolver el mensaje assistant completo (con reasoning) o la calidad se degrada — primera limitación oficial. API: kimi-k3; OpenRouter: moonshotai/kimi-k3. K3 se desbloquea tras recarga (mín. $1).
Precio y dónde usarlo
Precio oficial Moonshot API (tarifa plana en 1M, sin tramos por longitud): cache-hit $0.30/MTok, miss $3/MTok, salida $15/MTok. Este snapshot verifica $3/$15 en el listing principal de OpenRouter; moonshot-direct y SiliconFlow también muestran cache $0.30; Groq lista $3/$15.
Moonshot afirma >90% de cache hit en cargas de coding — bucles agent con prefijo largo bajan el precio efectivo de entrada. La salida cuesta 5× el miss de entrada; salidas largas y tokens de reasoning inflan la factura.
Comparativa interna: K2.6 → K3
K3 no es un «K2.6 más grande», sino un salto generacional. Parámetros ~1T→2.8T; contexto 262K→1M; visión→vídeo nativo; atención pasa a KDA+AttnRes.
En OpenRouter principal: K2.6 $0.684/$3.42 vs K3 $3/$15 — ~4,4× en entrada y salida, ~4–5× mezclado. Capacidad: AA Intelligence Index v4.1 ~44 (K2.6) → ~57 (K3), tercero independiente, 2026-07-22.
Veredicto: si tu flujo Kimi es coding autónomo, sensible al coste y 256K basta, K2.6 sigue siendo el default. Paga el premio 4–5× de K3 solo si necesitas 1M de repo, vídeo nativo o techo más cercano a los cerrados de frontera.
Brecha real frente a la élite
Inteligencia agregada: AA Intelligence Index v4.1 (metodología única, independiente) sitúa Fable 5 ≈60, GPT 5.6 Sol ≈59, K3 ≈57, Opus 4.8 ≈56 — tres puntos, misma liga frontier. Moonshot también admite retraso global vs Fable/Sol.
Coding (tabla oficial Moonshot + terceros, distintos harness): Sol lidera DeepSWE y Terminal-Bench 2.1; K3 destaca en SWE Marathon, Program Bench y Frontend Code Arena #1; Fable en FrontierSWE y GDPval-AA v2 Elo.
Agente/conocimiento: Fable gana JobBench y Briefcase; K3 BrowseComp, Automation y Spreadsheet. UX: historial thinking sensible, exceso de iniciativa, por detrás de Fable/Sol (Limitations); AA ~36 t/s y verbose en Index. Benchmarks externos, no proxy de AI Hippo.
Coste en la práctica: dos escenarios
Cálculo con el listing principal OpenRouter de este snapshot (entrada miss), sin tokens extra de reasoning.
A — turno agent (100K in + 20K out): K3 ~$0.60, K2.6 ~$0.14, Sol ~$1.10, Fable ~$2.00. K3 ~4,3× K2.6, muy por debajo de Fable.
B — documento largo (500K in + 5K out): K3 miss ~$1.58; con 500K cache-hit, ~$0.30 total. Sol ~$2.65, Fable ~$5.25, K2.6 ~$0.36.
La ventaja de K3 brilla con prefijo largo y alto cache hit; reasoning largo acerca la factura al coste por tarea de AA. Comparación de specs/coste, no benchmark de capacidad.
Cuándo elegirlo y cuándo no
Elige K3: coding agente de largo horizonte (terminal/navegador), repo 1M, vídeo nativo, probar la ruta open cerca de frontier vía API antes de pesos, aceptando thinking obligatorio y restricciones de harness.
Evita K3 / mira otro: entregables profesionales one-shot → Fable 5; ecosistema Claude Code maduro → Fable/Sol; throughput puro, coste mínimo, 256K basta → K2.6; pesos descargables ya → espera al 2026-07-27 y valida licencia/cluster.
Decide con páginas modelo/Token/compare de AI Hippo; el ranking compuesto es proxy contexto/$ , no benchmark de capacidad.
Lista de verificación de despliegue
Antes de integrar: ¿el harness devuelve todo el thinking history (p. ej. Kimi Code)? ¿Evitaste cambiar a K3 a mitad de sesión? ¿Limitaste la proactividad en system prompt o AGENTS.md?
Ops: diseña prefijos largos para cache; monitoriza tokens por tarea (con reasoning). Tras pesos 2026-07-27, self-host 2.8T MoE cuesta mucho más que K2.6 1T — calcula cluster antes de «open total».
Fuentes
Evidence and actions
- Ventana temporal: catalog snapshot + vendor benchmarks (2026-07-22)
- Tamaño de muestra: 4
- Tipo de fuente: catalog_and_pricing
- Consulta specs y precio de K3 en /es/model/moonshotai-kimi-k3/
- Compara con K2.6 en /es/model/moonshotai-kimi-k2.6/
- Verifica precios en /es/token/
- Compara con Fable 5 y GPT-5.6 Sol en /es/compare/