Kimi K3: Moonshot reduce a semanas la brecha con Anthropic y OpenAI

2,8 billones de parámetros, pesos abiertos y un API ~1,7× más barato que Claude Opus 4.8. Los números no dicen que China haya ganado: dicen que el retraso de 8-12 meses ya es cuento.

15 min de lectura

En este artículo

El resultado que jode el guion

El 16 de julio de 2026 Moonshot soltó Kimi K3. No un paper, no un teaser, no un "próximamente en beta cerrada". Un modelo de peso abierto con 2,8 billones de parámetros, arquitectura Mixture-of-Experts, visión nativa y una ventana de contexto de 1 millón de tokens.

En el benchmark GDPval-AA v2 de Artificial Analysis, K3 sacó 1687 puntos. Claude Opus 4.8 Max se quedó en 1600. En AA-Briefcase, una prueba privada de trabajo de conocimiento agencial a largo plazo, K3 hizo 1527 y quedó segundo del mundo, por delante de GPT-5.6 Sol Max (1495). En BrowseComp marcó 91,2 y se quedó con el SOTA ejecutándose como agente único, sin comprimir el contexto.

Casi el doble de parámetros que DeepSeek V4-Pro, cuatro veces más contexto que K2.6 y un API que deja a Opus 4.8 mirando el recibo con cara de tonto.

Eso no es "otro modelo chino interesante". Es el momento en el que el consenso de "van 8 a 12 meses por detrás" se cae de culo. Según las pruebas iniciales y las comparaciones con Fable 5 y GPT-5.6, la brecha se comprime a semanas. Glitchwire lo resume sin anestesia: la brecha open-source que dábamos por estructural acaba de desaparecer. Expansion, citando al Financial Times, lo enmarca como un golpe directo al liderazgo de Anthropic.

Las dos lecturas no se contradicen: se refuerzan. Una mira el producto. La otra mira el tablero geopolítico y de capital. Juntas dibujan algo más molesto para los laboratorios cerrados de EE.UU.: un modelo que no es el mejor del mundo, pero que ya no se puede despreciar por procedencia, precio o retraso.

Quién es Moonshot y por qué esto no es un milagro de garaje

Moonshot no es un laboratorio de tres tíos y un servidor prestado. A mediados de junio de 2026 sus ingresos recurrentes anuales ya superaban los 300 millones de dólares. Está cerrando una ronda con una valoración de unos 31.500 millones (venía de 20.000 en mayo). Eso es mucho dinero… hasta que miras al vecindario.

DeepSeek, el rival chino del momento, arranca una ronda valorada en unos 71.000 millones, según el Financial Times vía Expansion. Anthropic tocó 965.000 millones en mayo. OpenAI, 852.000. La distancia de capitalización sigue siendo brutal. Moonshot no es "la startup china más valiosa" ni está a punto de comprar San Francisco. Está en otra liga de cheque, y aun así ha metido un modelo de frontera abierta en la mesa.

Eso es lo que hace el caso interesante: no hace falta igualar la capitalización de Anthropic para joderle el margen. Hace falta un modelo lo bastante bueno, lo bastante barato y con pesos que se puedan bajar.

El modelo anterior, K2.6, ya era de peso abierto bajo una licencia MIT modificada con uso comercial y pocas restricciones. K3, según Moonshot, pondrá los pesos completos a disposición en los próximos días. Ojo: pesos abiertos no es lo mismo que "código abierto permisivo con licencia confirmada". De K3, a día de lanzamiento, solo consta que se liberan los pesos. La licencia exacta no está confirmada en el material público. Quien diga "es MIT y haz lo que te dé la gana" está inventando.

Qué han construido de verdad (sin el PowerPoint)

K3 no es un GPT con otra pegatina. Moonshot mete dos innovaciones con nombre y apellido: Kimi Delta Attention y Attention Residuals. La promesa técnica es mejorar el flujo de información en secuencias largas. Traducción de barra: cuando el modelo traga un documento de 800 páginas, un repo entero o una conversación de agente que dura horas, no se le "olvida" el principio del rollo como un interno el lunes por la mañana.

La arquitectura es Mixture-of-Experts (MoE). En un transformer clásico, cada token pasa por las mismas capas feed-forward. En MoE, esas capas se sustituyen por un conjunto de subredes "expertas" y un enrutador que decide a cuáles mandar cada trozo del input. No despiertas a los 2,8 billones de parámetros a la vez para cada token; despiertas a los expertos que tocan. Es la misma lógica que ya vimos en otros grandes abiertos: más capacidad total sin multiplicar el coste de inferencia de forma lineal. Si quieres el contraste con otro MoE abierto que no apuesta a ser "el más listo" sino a dejar de pagar dos veces, el caso de Inkling y los pesos abiertos va en la misma familia de problema económico.

Números de producto que sí constan:

  • 2,8 billones de parámetros (casi el doble que DeepSeek V4-Pro, según el blog técnico de Moonshot).
  • Ventana de 1 millón de tokens (4× la de K2.6).
  • Visión nativa.
  • API: 0,30 $ por millón de tokens de entrada en caché, 3 $ sin caché y 15 $ de salida.

Frente a Claude Opus 4.8, que Glitchwire sitúa en 5 $ de entrada y 25 $ de salida, K3 sale aproximadamente 1,7× más barato en ambas direcciones. K2.6 ya costaba alrededor de un tercio del precio de Opus 4.8; análisis de terceros lo describieron en su momento como 8× más barato en entrada y 10× en salida que Opus 4.7. La estrategia de precio no es un accidente: es el palo.

Aquí aparece la fricción entre fuentes. Expansion/FT habla de que Anthropic planea subir el precio de Opus 4.8 un 50 % en septiembre de 2026. Glitchwire, el mismo día del lanzamiento de K3, trabaja con un Opus 4.8 a 5 $/25 $. Lo que sí se sostiene en ambos relatos es la presión: hay un modelo chino abierto y barato pisando el segmento, y Anthropic mueve ficha de precios en 2026. El detalle del listado exacto lo pelearán las webs de precios; el efecto de mercado ya está encima de la mesa.

Los números que importan (y los que faltan)

Vamos a lo que se puede medir sin humo.

GDPval-AA v2 (Artificial Analysis) K3: 1687. Claude Opus 4.8 Max: 1600. Por detrás: Claude Fable 5 Max y GPT-5.6 Sol Max. Capacidades de nivel frontera, no "el rey del mundo". Quien diga que K3 supera a Fable está mintiendo con el Excel delante.

AA-Briefcase K3: 1527, segundo global. GPT-5.6 Sol Max: 1495. Aquí K3 gana terreno en tareas de conocimiento agencial sostenidas en el tiempo: el tipo de trabajo que no es un chat de tres mensajes, sino un agente que mantiene hilo, tools y objetivos durante mucho rato.

BrowseComp 91,2, SOTA. Agente único. Sin compresión de contexto. Aprovechando la ventana de 1M tokens para navegación y comprensión extensa. Si tu caso de uso es "mira media internet, cruza fuentes y no te pierdas", este es el número que te interesa.

Ahora la parte que los hype-threads se saltan:

  • No hay puntuaciones públicas en Terminal-Bench 2.1. Sin eso, comparar a K3 con los últimos Anthropic en tareas de terminal es hacer magia con humo.
  • Los benchmarks independientes aún son escasos. La mayor parte de las comparaciones salen de Artificial Analysis, pruebas de comunidad y números auto-reportados por Moonshot.
  • Testers tempranos en X cuentan que K3 destaca en tareas de agente a largo plazo y en generación 3D, pero puede ser notablemente lento: una prueba de codificación frontend se fue a 35 minutos.

Ese 35 minutos no es un "a veces tarda un poco". Es una hostia operativa. Si cobras por hora de desarrollador o por latencia de producto, un modelo barato y listo que se duerme media hora no es gratis: te lo cobras en tiempo de cola y en paciencia del usuario. La lentitud, eso sí, no está cuantificada de forma sistemática. No sabemos si es generalizada o depende de hardware y configuración. Consta el reporte anecdótico; no un paper de latencia p50/p99.

Si quieres el marco general de por qué un 91,2 en un benchmark no te dice si el modelo te va a aguantar en producción, ya desmontamos esa trampa en benchmarks de IA: lo que miden y lo que ocultan. K3 es un caso de manual: ranking de frontera en unas pruebas, agujeros negros en otras, y feedback de campo que no casa con el titular.

La tesis: no es que China haya "ganado", es que el reloj se ha roto

Hay un relato perezoso que dice "los modelos chinos ya dominan todos los sectores". Falso. Las empresas de EE.UU. siguen liderando en las tareas más complejas, y el propio Financial Times lo deja claro en el encuadre del artículo de Expansion. Fable 5 Max y GPT-5.6 Sol Max siguen por encima de K3 en GDPval-AA v2. Eso no se discute con banderitas.

Hay otro relato, también perezoso, que dice "van un año por detrás y siempre será así". Ese se acaba de morir.

Marc Andreessen (a16z) ya había señalado que GLM-5.2 de Z.ai fue el primer modelo chino en igualar e incluso superar a los modelos públicos de los grandes laboratorios de EE.UU. K3 no es el primer aviso; es el aviso que llega con API barata, 1M de contexto y promesa de pesos completos. La secuencia importa: primero se iguala en público, luego se abre el grifo de pesos, luego el precio hace el resto.

En febrero de 2026 Anthropic acusó a laboratorios chinos de "ataques de destilación a escala industrial". Algunas empresas lo rechazaron y lo leyeron como excusa para proteger un monopolio. No vamos a sentar aquí un tribunal de destilación: no hay en el material una sentencia ni una auditoría forense que zanje el debate. Lo que sí hay es un clima: cuando el rezagado te pisa los talones, el líder grita trampa y el retador grita cartel. El mercado, mientras tanto, mira el precio del millón de tokens y si el agente le cierra la tarea.

Seamos justos: la postura de Anthropic no es un berrinche sin base. Entrenar un modelo de frontera cuesta cientos de millones en cómputo, datos y talento. Si un competidor alcanza resultados similares en semanas usando destilación sobre tu propio modelo, el problema no es solo de precio de API: es que el incentivo para invertir en la próxima generación se desploma. Anthropic no está defendiendo solo su margen; está defendiendo la tesis de que el I+D de frontera merece la pena económicamente. Que esa defensa llegue envuelta en una subida de precios no ayuda a que parezca desinteresada, pero la pregunta de fondo, ¿quién paga la próxima frontera si el primero que llega es el último que cobra? es legítima y no se responde con un meme.

La tesis propia, contrastando F1 y F2:

  1. F2 (Glitchwire) pone el foco en producto: arquitectura, benchmarks de Artificial Analysis, precio de API, SOTA en BrowseComp, pesos abiertos y desaparición de la "open-source gap".
  2. F1 (Expansion/FT) pone el foco en capital y poder: valoración de Moonshot, DeepSeek a 71.000 M, Anthropic y OpenAI en la estratosfera, el plan de precios de Opus y el desafío al liderazgo de Anthropic.

Donde coinciden: K3 es un lanzamiento serio, chino, competitivo y barato que comprime el retraso histórico. Donde discrepan en énfasis: uno habla de gap técnico abierto; el otro de tablero financiero y de si Anthropic puede seguir cobrando prima de frontera. La síntesis: la carrera de la IA ya no se gana solo en el laboratorio. Se gana en la intersección de rendimiento suficiente, coste de inferencia y disponibilidad de pesos. En esa intersección, K3 no necesita ser el número 1 del mundo para joder el modelo de negocio de quien vive de API caras y pesos cerrados.

Esa lectura encaja con lo que ya vimos en la adopción: los modelos abiertos chinos copan una porción monstruosa de Hugging Face. El laboratorio gana el paper; el open weight gana el fork, el fine-tune y el despliegue en la empresa que no quiere mandar sus datos a un endpoint de California a 25 $ el millón de salida.

La trampa (porque un caso real sin pegas es un publirreportaje)

Si copias el headline de Moonshot y lo pegas en tu roadmap sin matices, te va a explotar.

Trampa 1, "Es open source, así que control total" De momento es peso abierto con liberación "en los próximos días". Licencia exacta de K3: no confirmada. K2.6 sí venía con MIT modificada y uso comercial con restricciones mínimas. Asumir que K3 es idéntico en términos legales es fe de carbonero.

Trampa 2, "Supera a Anthropic y OpenAI" No. Supera a Opus 4.8 Max en GDPval-AA v2 y a GPT-5.6 Sol Max en AA-Briefcase. Sigue detrás de Fable 5 Max y de GPT-5.6 Sol Max en el primer benchmark. "Nivel frontera" ≠ "el mejor modelo del planeta".

Trampa 3, "Los benchmarks ya bastan" Sin Terminal-Bench 2.1 público, sin batería amplia de evaluadores independientes y con dependencia fuerte de Artificial Analysis y de la propia Moonshot, estás comprando una foto de un ángulo. En producción, el ángulo que te falta suele ser el que te mata.

Trampa 4, "Barato y listo = barato de operar" 0,30 $ de entrada en caché es una ganga en papel. Si una tarea de frontend se come 35 minutos, el coste real se traslada a GPU-tiempo, colas y personas mirando una barra de progreso. El precio por millón de tokens no es el precio por tarea completada. Quien confunda las dos cosas va a firmar un "ahorro" que luego no aparece en la cuenta de resultados.

Trampa 5, "Si es chino y abierto, ya tengo soberanía" Soberanía de pesos no es soberanía de chips, de nube ni de regulación de exportación. El material no dice que puedas montar K3 en cualquier sitio sin fricciones. Dice que Moonshot va a soltar los pesos. El resto es trabajo tuyo: infra, compliance, evaluación y un plan B cuando el modelo sea lento o cuando un benchmark privado no se traduzca a tu dominio.

Trampa 6, Capital ≠ producto, y al revés DeepSeek vale ~71.000 M en su ronda. Moonshot ~31.500 M. Anthropic y OpenAI están en otra galaxia. Eso no invalida K3. Invalida el cuento de que "el que tiene más valoración gana la semana". También invalida el cuento inverso: un buen modelo abierto no convierte a Moonshot en dueña del mercado global. Convierte a Moonshot en un problema de precios y de narrativa para quien cobraba renta de frontera sin competencia creíble.

Qué se puede copiar y qué te va a salir caro

Copiable (con cerebro):

  • Usar K3 como capa barata de agente largo cuando la ventana de 1M y BrowseComp importen más que el último punto de un leaderboard cerrado.
  • Meter el API en un router multi-modelo: las tareas caras y delicadas a un frontier cerrado; el volumen y la navegación extensa a K3. El ahorro de ~1,7× frente a Opus 4.8 no es cosmético cuando multiplicas por millones de tokens.
  • Cuando salgan los pesos, evaluar self-host o hosting en proveedores que ya tragan MoE grandes. El valor de un open weight no es el orgullo ideológico: es no pagar dos veces (API + incapacidad de auditar).

No copiable a ciegas:

  • Sustituir Opus/Fable/GPT-Sol en todas las cargas porque "K3 va segundo en AA-Briefcase". Segundo en una prueba privada no es licencia de arrasar el stack.
  • Prometer a tu jefe "somos SOTA en BrowseComp" si tu producto no se parece a BrowseComp.
  • Ignorar la latencia reportada. Un agente listo y lento puede ser peor que un agente un poco más tonto y rápido, según el SLA.

El movimiento de Moonshot también se lee mejor si lo pones junto a otros MoE abiertos recientes: LongCat y compañía ya demostraron que China no fabrica solo modelos "bonitos en el paper". K3 sube la apuesta en tamaño (2,8T), en contexto (1M) y en precio de API. El patrón se repite: arquitectura MoE, números agresivos, narrativa de "ya no vamos tarde".

Cierre

K3 no entierra a Anthropic ni a OpenAI. Entierra una comodidad: la de mirar los modelos chinos como copias con retraso de temporada. Con 2,8 billones de parámetros, 1M de contexto, 1687 en GDPval-AA v2, segundo puesto en AA-Briefcase, SOTA en BrowseComp y un API ~1,7× más barato que Opus 4.8, Moonshot ha convertido el "van un año por detrás" en una frase de consultor desempleado.

El dato gordo no es que China domine. El dato gordo es que ya no necesitas el mejor modelo del mundo para destrozar el margen del que se creía intocable. Te basta con uno casi tan bueno, mucho más barato y con pesos a punto de salir a la calle.

Preguntas frecuentes

¿Kimi K3 es mejor que Claude Opus 4.8 y GPT-5.6?

No de forma absoluta. En GDPval-AA v2, K3 (1687) supera a Claude Opus 4.8 Max (1600) pero sigue detrás de Claude Fable 5 Max y GPT-5.6 Sol Max. En AA-Briefcase, K3 (1527) queda segundo mundial por delante de GPT-5.6 Sol Max (1495). Es nivel frontera en varias pruebas agénticas, no el líder global en todas.

¿Kimi K3 es de código abierto?

Es un modelo de peso abierto: Moonshot ha dicho que liberará los pesos completos en los próximos días. La licencia exacta de K3 no está confirmada en el material público. El anterior, K2.6, usó una MIT modificada con uso comercial y pocas restricciones; no se puede asumir lo mismo para K3 sin el texto legal.

¿Cuánto cuesta la API de K3 frente a Anthropic?

Según Glitchwire, K3 cobra 0,30 $ por millón de tokens de entrada en caché, 3 $ sin caché y 15 $ de salida. Claude Opus 4.8 aparece a 5 $ de entrada y 25 $ de salida. Eso deja a K3 ~1,7× más barato en ambas direcciones. Expansion/FT reporta además un movimiento de precios de Anthropic previsto para septiembre de 2026; las cifras entre fuentes no alinean del todo, pero la presión a la baja es el punto común.

¿Puedo fiarme solo de los benchmarks de K3?

No. Faltan scores públicos en Terminal-Bench 2.1 y hay pocos benchmarks independientes amplios. Gran parte de la comparativa depende de Artificial Analysis, comunidad y cifras de Moonshot. Testers en X reportan fuerza en agentes largos y generación 3D, pero también lentitud (un caso de frontend en 35 minutos). Mide en tu carga real antes de migrar producción.

Fuentes

  1. La 'start up' de IA china Moonshot lanzará un modelo capaz de desafiar el liderazgo de Anthropicexpansion.com · 2026-07-16
  2. Kimi K3 Is Here. The Open-Source AI Gap Just Disappeared. — Glitchwireglitchwire.com · 2026-07-16