LongCat-2.0: arquitectura MoE de 1,6 billones de parámetros, benchmarks reales y lo que el hype omite

Meituan lanza un modelo con resultados técnicos legítimos en SWE-bench y Terminal-Bench. Pero los datos que faltan importan tanto como los que sí publican.

9 min de lectura Actualizado el

En este artículo

El Cuñado tiene razón en una cosa (y se equivoca en el resto)

El Cuñado dice: "LongCat-2.0 es un monstruo open source que destroza a los modelos cerrados y lo puedes correr en casa."

La realidad: los benchmarks son legítimos, la arquitectura es ingeniería seria y la licencia MIT existe. Pero "correrlo en casa" con 1,6 billones de parámetros, sin que nadie publique los requisitos exactos de VRAM, es el tipo de afirmación que suena bien en Twitter y se desmorona en cuanto intentas montar el clúster.

Vamos por partes.


Qué es LongCat-2.0 y por qué la arquitectura importa

LongCat-2.0 es un modelo desarrollado por Meituan (la empresa china de delivery y servicios) bajo una arquitectura MoE: Mixture of Experts.

MoE funciona así: en vez de encender toda la red neuronal cada vez que el modelo procesa un token, solo activan un subconjunto de "expertos" especializados. El resultado es que LongCat-2.0 tiene 1,6 billones de parámetros totales, pero en cada inferencia solo activa ~48.000 millones. Para que te hagas una idea: GPT-3 tenía 175.000 millones de parámetros totales y los activaba todos. Aquí estamos hablando de una escala diez veces mayor en parámetros totales, pero con un coste de inferencia comparable al de modelos medianos.

Esto no es magia. Es una apuesta de diseño con tradeoffs reales: los modelos MoE son más eficientes en inferencia, pero más complicados de entrenar y de servir en producción. Cada experto necesita estar disponible en memoria, lo que dispara los requisitos de hardware aunque el coste por token sea bajo.

Los 1,6 billones de parámetros son un titular. Los ~48.000 millones activos son el número que importa para entender el coste real de usarlo.

Además de la arquitectura MoE estándar, LongCat-2.0 incorpora algo llamado N-gram Embedding: una vía adicional de expansión de parámetros que no depende de los expertos MoE tradicionales. El detalle técnico completo no está publicado, pero la idea es ampliar la capacidad representacional del modelo más allá de lo que permite la estructura de expertos sola.


El dato que más pesa: 50.000 chips chinos

El claim más llamativo de Meituan es que LongCat-2.0 se entrenó y se ejecuta íntegramente sobre un clúster de 50.000 chips domésticos chinos, con código de inferencia optimizado para ese hardware específico.

Esto tiene implicaciones geopolíticas y técnicas que van más allá del modelo en sí.

Geopolíticamente, China lleva años intentando demostrar que puede desarrollar infraestructura de IA sin depender de GPUs de NVIDIA (vetadas por controles de exportación de EE.UU. desde 2022). Si los datos de Meituan son verídicos, es la primera demostración pública a esta escala de que es posible entrenar un modelo de billón de parámetros sobre silicon chino.

El matiz importante: el artículo de Meituan especifica ese clúster de 50.000 tarjetas para el proceso descrito, pero no detalla si hubo alguna dependencia de hardware extranjero en otras fases del desarrollo. Afirmar que es 100% independiente de chips occidentales sería ir más lejos de lo que los datos permiten. Puedes ver la tensión entre soberanía tecnológica y dependencia de hardware en otros actores del sector, y China no es inmune a esa dinámica.

Lo que sí está documentado: el código de inferencia está optimizado específicamente para ese hardware, lo que significa que si intentas ejecutarlo sobre otra arquitectura, el rendimiento puede degradarse de formas que nadie ha publicado en detalle.


Los benchmarks: qué dicen y qué no dicen

Aquí es donde la cosa se pone interesante. Los números son reales. El problema es el contexto que falta.

SWE-bench Pro es el benchmark más serio para evaluar capacidad de resolución de código real. Mide si un modelo puede generar parches que solucionen problemas auténticos de repositorios de GitHub. No es un test de autocompletar código; es resolver bugs de producción.

LongCat-2.0 saca 59,5 puntos, frente al 54,2 de Gemini 3.1 Pro, el 58,6 de GPT-5.5 y el 57,3 de Claude Opus 4.6 (datos de Meituan). Son diferencias de 1-5 puntos en un benchmark difícil. Eso no es "destrozar" a la competencia; es liderar de forma legítima pero ajustada.

SWE-bench Multilingual: 77,3 puntos, prácticamente empatado con Claude Opus 4.6 (77,8). En código multilingüe (no idiomas humanos, sino múltiples lenguajes de programación) el modelo está al nivel del mejor disponible ahora mismo.

Terminal-Bench 2.1: 70,8 puntos en interacción real con terminal. Este benchmark evalúa si el modelo puede ejecutar instrucciones complejas en consola (no solo generarlas, sino razonar sobre el estado del sistema y corregir errores). Es una métrica relevante para casos de uso agéntico.

Y aquí viene el problema gordo:

No existe metodología pública de evaluación. Meituan no ha publicado el número de muestras utilizadas, los prompts exactos, la configuración de temperatura, ni cómo se manejaron los casos de empate o error. Sin esto, los benchmarks son números sin contexto estadístico. No son falsos, pero tampoco son verificables externamente.

Cuando un modelo solo compite en los tests que elige, la campana de alarma debería sonar sola. ¿Dónde están los resultados en MMLU, HumanEval o ARC-Challenge? Silencio. ¿Comparativas directas con otros modelos open source en tareas de agente end-to-end? También silencio.


Post-entrenamiento: los tres grupos de expertos

El post-entrenamiento de LongCat-2.0 aplica destilación online multi-profesor con tres grupos de expertos especializados:

  • Agent: ejecución autónoma de tareas complejas.
  • Reasoning: razonamiento adaptativo, especialmente en matemáticas y lógica.
  • Interaction: alineación de seguridad y calidad de respuesta.

La destilación online multi-profesor es una técnica donde el modelo aprende simultáneamente de varios "profesores" especializados durante el entrenamiento, en vez de primero entrenar y luego refinar. El resultado práctico es que el modelo hereda capacidades distintas de cada grupo sin necesidad de hacer fine-tuning separado por tarea.

En pruebas prácticas, esto se traduce en resultados como resolver un problema oficial de AIME 2026 en menos de un minuto con pasos claros y respuesta correcta (441), o completar tareas end-to-end como construir un agente SQL, migrar un repositorio de código legacy a nuevas APIs, o desarrollar una aplicación completa de juegos infantiles desde cero.

¿Son impresionantes? Sí. ¿Son sistemáticos? No lo sabemos. No hay tasa de error publicada ni evaluación reproducible de cuántas veces falla en tareas equivalentes.


El contexto de 1M tokens: ingeniería real con asterisco

LongCat-2.0 soporta contextos de hasta 1 millón de tokens gracias a su mecanismo de atención dispersa (LSA, Locally Sparse Attention), que reduce la complejidad de la atención de cuadrática a lineal. Esto es técnicamente relevante: la atención estándar tipo transformer tiene un coste O(n²) en función de la longitud del contexto, lo que hace que procesar documentos muy largos sea prohibitivamente caro. LSA rompe esa limitación.

En la práctica, el modelo generó una novela web de 30.000 palabras con coherencia temática y arcos argumentales consistentes, y produjo una escena 3D pixel art completa a partir de una descripción textual. Estas pruebas sugieren que el contexto largo funciona de forma operativa, no solo sobre el papel.

El asterisco: no hay cifras públicas sobre degradación de rendimiento a medida que el contexto se aproxima al límite de 1M tokens. En otros modelos con ventanas de contexto largas (como Gemini 1.5) se ha documentado que el rendimiento cae significativamente en los extremos del contexto. Para LongCat-2.0, no tenemos ese dato.


La trampa del self-hosting

El post corto ya lo mencionaba, pero merece un desarrollo propio porque es donde más gente se va a quemar.

Licencia MIT significa que puedes emplear el modelo comercialmente sin restricciones de Meituan. Eso es real. Los pesos están en HuggingFace, el código en GitHub y ModelScope. Accesible.

Pero "accesible" y "ejecutable en casa" no son lo mismo cuando hablamos de un modelo MoE con 1,6 billones de parámetros totales.

El modelo activa ~48.000 millones de parámetros por inferencia, pero los parámetros inactivos también tienen que estar en algún sitio durante la ejecución. En modelos MoE, todos los expertos deben estar disponibles en memoria para poder ser seleccionados dinámicamente. Esto significa que los requisitos de VRAM son sustancialmente mayores que lo que sugiere el número de parámetros activos.

Para contexto: Meituan no ha publicado los requisitos exactos de VRAM ni benchmarks de latencia de inferencia en hardware commodity. Sin ese dato, afirmar que "lo puedes correr en casa" es especulación. Una startup con acceso a varios nodos de H100 podría montarlo. Un desarrollador con una RTX 4090 no.

Si te interesa la frontera entre lo que ejecutas localmente y lo que delegas a la nube, Qwen 3.6 27B es un punto de referencia más honesto para lo que realmente corre en hardware personal.


Lo que las pruebas prácticas muestran (y lo que no)

Las pruebas documentadas son heterogéneas: algunas impresionantes, otras con matices.

En generación de juegos, el modelo produjo un Number Sliding Puzzle funcional en un solo intento. En el mismo tipo de tarea (un juego de Click to Pop Bubbles) hubo errores visuales de renderizado. No fue un fallo catastrófico, pero tampoco es el modelo infalible que vende el hype.

Esto sugiere que LongCat-2.0 tiene varianza en tareas de código con componentes gráficos. Cuánta varianza exactamente y bajo qué condiciones, no está cuantificado. No hay tasa de error sistemática publicada para ningún tipo de tarea.

La inestabilidad ocasional documentada en código es una señal real que el relato de marketing omite completamente. Un modelo con resultados excelentes en el 80% de los casos y errores silenciosos en el 20% restante puede ser más peligroso en producción que uno con rendimiento mediano pero predecible.


Preguntas frecuentes

¿LongCat-2.0 es realmente open source?

LongCat-2.0 está publicado bajo licencia MIT, que permite uso comercial sin restricciones de Meituan. Los pesos están disponibles en HuggingFace y el código en GitHub y ModelScope. Lo que no está publicado es la composición de los datos de entrenamiento ni el número exacto de expertos en la arquitectura MoE. "Open weights con licencia MIT" es más preciso que "open source" en el sentido completo del término.

¿En qué se diferencia MoE de un modelo denso normal?

Un modelo denso activa todos sus parámetros en cada inferencia. MoE (Mixture of Experts) solo activa un subconjunto de "expertos" por token. LongCat-2.0 tiene 1,6 billones de parámetros totales pero activa ~48.000 millones por inferencia, lo que reduce el coste computacional por token. El tradeoff es que todos los expertos deben estar en memoria, disparando los requisitos de RAM/VRAM para self-hosting.

¿Los resultados de benchmarks de LongCat-2.0 son verificados externamente?

No. Los datos de SWE-bench Pro (59,5), SWE-bench Multilingual (77,3) y Terminal-Bench 2.1 (70,8) provienen exclusivamente de Meituan. No hay metodología pública de evaluación ni replicación independiente publicada. Son números creíbles dado el contexto técnico del modelo, pero no verificados por terceros.

¿Se puede emplear LongCat-2.0 en producción ahora mismo?

Técnicamente es posible: la licencia lo permite y los pesos están disponibles. Pero Meituan no ha publicado requisitos de VRAM, benchmarks de latencia ni tasa de error sistemática en tareas de producción. Las pruebas prácticas documentan inestabilidad ocasional en código con componentes gráficos. Emplearlo en producción sin evaluación propia sobre tus casos de uso específicos sería asumir un riesgo que los datos públicos actuales no permiten cuantificar.

Fuentes

  1. China's First Self-Developed Trillion-Parameter Large Model for Card Training and Inference Officially Open Sourceeu.36kr.com
  2. Maxsun Squeezes Intel's 10-Core Raptor Lake Onto a $200 Motherboard, Undercutting Traditional CPU+Board Combos by Nearly Halfwccftech.com · 2026-05-10
  3. Autopsy Of A Freshly Cooked 10Gbit SFP+ Network Adapterhackaday.com · 2026-06-21