Qwen3.8-Max: 2,4 billones de parámetros, 95B activos y una guerra que no se gana en el comunicado

Alibaba saca su modelo más grande, promete diez días de desarrollo autónomo y pesos abiertos la próxima semana. El titular es monstruoso; el matiz, donde se decide si esto es poder real o marketing con GPU.

15 min de lectura

En este artículo

Lo que ha pasado de verdad (sin el comunicado)

El 3 de agosto de 2026 Alibaba presentó Qwen3.8-Max, el modelo que vende como su IA más avanzada hasta la fecha. Los números del anuncio, según la cobertura de agencias recogida por Infobae, son estos: 2,4 billones de parámetros en total, 95 mil millones de parámetros activos, orientado a programación, trabajo colaborativo y ejecución larga de proyectos. Precio de API: 2 dólares por millón de tokens de entrada y 6 dólares por millón de tokens de salida.

Eso no es un upgrade cosmético. Es un empujón industrial en medio de una pelea china que ya no se disimula: Kimi K3 de Moonshot, GLM-5.2 de Zhipu y la presión constante de los modelos de razonamiento baratos de DeepSeek. El mercado lo leyó en clave de dinero: las acciones de Alibaba en Hong Kong subieron un 6% hasta HK$124,00 tras el anuncio (Yahoo Finanzas).

La pregunta del título, ¿es el nuevo rey de la IA china en programación? es mala si la contestas con un sí o un no. Es buena si la usas para separar tres capas que casi nadie separa:

  1. El tamaño y la arquitectura (lo que el modelo es).
  2. Lo que Alibaba dice que hace en autónomo y en benchmarks.
  3. Lo que eso implica de verdad para quien programa, paga API o espera pesos en local.

La tesis de este artículo es simple y un poco incómoda: Qwen3.8-Max no llega para coronarse en un trono abstracto; llega para fabricar ventaja de escala, destilados y narrativa open-weight mientras Occidente sigue jugando a jardín cerrado. El “rey de la programación” es el cebo. La fábrica es el negocio.

2,4 billones suena a Dios; 95B activos suena a factura

Hay que clavar esto antes de hablar de reyes. En un modelo MoE (Mixture of Experts, mezcla de expertos), no se enciende el monstruo entero cada vez que escribes una línea. El total de parámetros es la biblioteca completa; los parámetros activos son los estantes que se consultan por token. Aquí: 2,4T en el almacén, 95B trabajando en cada paso.

Traducción de bar: no es un motor de 2.400 caballos rugiendo sin parar. Es un edificio con miles de especialistas donde, para cada frase, solo entran unos cuantos al despacho. Por eso se puede escalar el “tamaño de marketing” sin multiplicar el coste de inferencia en la misma proporción. El truco no es magia; es ingeniería de routing de expertos.

Eso importa por tres motivos prácticos:

  • Coste por token. El precio publicado (2$ entrada / 6$ salida por millón) se entiende mejor si miras activos, no el cartel de 2,4T.
  • Latencia y hardware. Quien sueñe con “tirarme el Max en el PC de casa el día uno” tiene que esperar a ver qué publican exactamente y con qué requisitos. De momento, lo confirmado es API + promesa de pesos abiertos “la próxima semana”, no un instalador mágico.
  • Destilación. Un modelo frontera gordo es, entre otras cosas, profesor de modelos pequeños. Si la línea Qwen ya manda en local con versiones previas, un Max más capaz es gasolina para esa cadena. Eso ya lo vimos en la lógica de Qwen en local como fábrica de destilados, y este anuncio encaja ahí mejor que en el cuento del trono único.

Quien confunde parámetros totales con potencia usable está comprando el cartel de la discoteca, no la pista.

Lo que Alibaba promete: diez días de desarrollo autónomo

Según el propio marco del anuncio (Infobae/agencias), Qwen3.8-Max puede sostener más de diez días de desarrollo autónomo hasta llevar un proyecto a producción, con ciclos de aprendizaje y corrección. Casos de uso que citan: optimización de diseños de chips o estrategias de comercio electrónico.

Léelo otra vez sin el subidón. “Más de diez días” no es un benchmark público con protocolo reproducible que podamos auditar aquí. Es una capacidad declarada por el fabricante: el modelo aguantaría tandas largas de trabajo con ida y vuelta, no solo el típico chat de tres mensajes y un snippet.

Eso apunta al terreno que de verdad está caliente en 2026: no el autocomplete listo, sino el agente que se queda en el proyecto. Programar no es solo generar una función. Es mantener estado, corregir regresiones, no alucinar requisitos a los tres días y no convertir el repo en un cementerio de TODOs inventados.

Aquí viene el contraste con otra fuente que no habla de Qwen, y por eso es útil. El paper GAUGE (arXiv:2607.24889v1, julio 2026) evalúa agentes de IA en modelado financiero y deja un reguero de humildad: el mejor agente saca 53,4 sobre 100, frente a 88,3 de analistas senior y 66,0 de junior. La brecha interna duele más: capacidades mecánicas en torno al 93% de acierto y juicio alrededor del 78%.

GAUGE no evalúa Qwen3.8-Max ni dice nada de su rendimiento en finanzas. Quien extrapole “entonces Qwen falla en chips” se está inventando la película. Lo que sí aporta es marco: mecanizar pasos ≠ tener criterio de producción. Un modelo puede ser bestia generando y parcheando código y seguir siendo mediocre decidiendo qué no construir, cuándo parar o qué riesgo de negocio aceptar.

Seamos justos: un agente que aguanta diez días seguidos sin perder el hilo es un salto de ingeniería real. Mantener coherencia en sesiones ultra-largas, con herramientas y repos vivos, no es un truco de prompt; requiere avances en memoria, gestión de contexto y recuperación de errores. Si Alibaba ha resuelto eso, incluso parcialmente, el mérito técnico existe aunque el benchmark no sea público. La pregunta no es si es impresionante; es si esa resistencia se traduce en resultados de producción que un equipo pueda firmar sin miedo.

Si Alibaba pone el foco en “diez días hasta producción”, la pregunta adulta no es “¿suena impresionante?”. Es: ¿quién mide el juicio al día 8, cuando el proyecto ya no se parece al prompt inicial y las decisiones de arquitectura tienen consecuencias?

Las comparativas que “ganan”… firmadas por la casa

Qwen ha difundido comparativas donde Qwen3.8-Max supera a “algunos sistemas estadounidenses” en programación, agentes, razonamiento visual y comprensión de vídeo. La misma cobertura deja el matiz que muchos titulares se saltan: los resultados varían según cada evaluación.

Lo que no consta en el material verificado:

  • Puntuaciones exactas.
  • Nombres y versiones concretas de los modelos rivales en cada test.
  • Metodología auditable de esas comparativas.

Por tanto, aquí no vamos a escribir la sandez de “tumba a GPT-4o y a Claude”. No hay en los hechos una tabla con fechas, builds y protocolos que aguante esa frase. Hay marketing de leaderboard con dirección de la victoria ya impresa en la nota de prensa.

Regla de supervivencia con benchmarks de fabricante:

  • Si no hay número, no hay corona.
  • Si el número solo lo enseña quien vende el modelo, es un argumento de venta, no un veredicto.
  • Si “varía según evaluación”, estás ante el truco más viejo del sector: elegir el examen donde tu alumno brilla.

¿Puede ser muy fuerte en código y agentes? Sí. ¿Lo demuestra el comunicado? No al nivel que el hype necesita. La honestidad editorial es aburrida y por eso funciona: promesa alta, evidencia pública todavía blanda.

Precio: 2$ / 6$ por millón no es “el más barato del mundo”

El precio anunciado es limpio de leer:

Dirección Precio por 1M tokens
Entrada 2 $
Salida 6 $

Un token es la unidad mínima de texto que el modelo mastica; los precios de API se cobran por millones de esos trozos, de entrada (lo que mandas) y de salida (lo que devuelve). En tareas de programación agéntica la salida se infla: logs, diffs, reintentos, tests, explicaciones. El 6$ de salida es donde muchas facturas dejan de ser “baratas del slide”.

Lo que no vamos a afirmar: que sea el precio más bajo del mercado. No hay en los hechos una comparativa cerrada con DeepSeek, Google, OpenAI u otros en la misma fecha y condiciones. Y ya vimos en la guerra china de precios que lo barato por token no es lo barato por trabajo terminado: un modelo “caro” que resuelve en un pase puede salir más barato que un chollo que necesita ocho reintentos y un humano de niñera.

Para un equipo de producto, la métrica seria no es $/M tokens. Es $/PR fusionado, $/bug cerrado en staging o $/día de agente sin intervención. Qwen3.8-Max entra en esa conversación con un cartel agresivo; el arbitraje real se verá en uso, no en la tabla del anuncio.

Pesos abiertos “la próxima semana”: la jugada estratégica

Alibaba dice que publicará los pesos abiertos de Qwen3.8-Max la próxima semana, en la línea de varios desarrolladores chinos frente al enfoque cerrado de OpenAI o Anthropic.

Fecha exacta: no está pinada más allá de esa ventana. Disponible ya para descarga local: no consta. Quien lo dé por hecho hoy está adelantando el calendario.

Pero el significado estratégico sí se puede leer sin inventar:

  • Presión sobre el jardín cerrado. Cada vez que un lab chino suelta pesos fuertes, obliga a justificar por qué el API occidental cuesta lo que cuesta y por qué no puedes auditar ni afinar en serio.
  • Ecosistema y lock-in inverso. Pesos fuera = finetunes, cuantizaciones, forks, routers locales, despliegues air-gapped. La plataforma se extiende más allá de la nube de Alibaba aunque la nube de Alibaba cobre el premium del Max completo.
  • Señal a inversores y Estado. Alibaba no va de farol con el cheque: anunció más de 52.000 millones de dólares en tres años en IA y nube, y en mayo de 2026 ya había superado un plan de hasta 380 mil millones de yuanes (unos 55.96 mil millones de dólares) en tres años (Yahoo Finanzas). Esto no es un side project del equipo de modelos; es línea de inversión de gigante.

Ojo con el openwashing: pesos descargables ≠ código abierto de verdad (licencia, datos, receta de entrenamiento, derechos reales de uso comercial). La trampa de las licencias “abiertas” de IA es un género entero; cuando salgan los pesos habrá que leer el texto legal, no el adjetivo del hilo de Twitter. Mientras tanto, la dirección es clara: China está usando open weights como arma industrial, no como ética de garaje.

Lo que SÍ sabemos de Qwen en local (y lo que no puedes extrapolar)

Aquí hay que ser quirúrgico para no mezclar generaciones.

El ranking de Javadex (junio 2026) sobre modelos en Ollama no incluye Qwen3.8-Max. Evalúa versiones anteriores. En ese corte:

  • Qwen 3 72B aparece como mejor modelo general en Ollama (9,5/10).
  • Qwen 3 32B como mejor para código (9,0/10).
  • Variantes recientes de la familia superan el 77% en SWE-bench.
  • En código local, Javadex sigue poniendo a DeepSeek-Coder-V2 (16B) como referencia dura: más de 300 lenguajes y del orden de 12 GB de VRAM.

SWE-bench mide si el modelo resuelve tareas reales de ingeniería de software (issues de repos, no crucigramas de HumanEval). Pasar del 77% en variantes Qwen previas es una señal de familia fuerte en código. No es un score de Qwen3.8-Max.

Extrapolación prohibida: “como el 72B mandaba en junio, el Max es el rey en agosto”. Lo honesto es otro silogismo:

La línea Qwen ya competía arriba en local y en código antes del Max. El Max es la pieza frontera que alimenta esa línea (API hoy, pesos/derivados después). El cetro local se decidirá en los destilados y en el hardware que pidas, no en el billón del comunicado.

Si te importa correr modelos en tu máquina, el anuncio del Max es una noticia de upstream. El día que te cambie la vida será cuando exista una variante cuantizada seria, con licencia clara, que se acerque al listón de código sin pedirte un rack.

El mapa chino: no es Qwen contra el vacío

El lanzamiento no ocurre en el desierto. La propia cobertura lo enmarca en competencia interna dura:

  • Moonshot / Kimi K3
  • Zhipu / GLM-5.2
  • DeepSeek y su presión por razonamiento a bajo coste

Eso cambia la lectura. Qwen3.8-Max no es solo “China contra OpenAI”. Es Alibaba contra el resto del pack chino y, a la vez, contra el relato occidental de que la frontera solo se cocina en California con muro de API.

En ese mapa, sacar un MoE enorme + prometer pesos + poner precio agresivo es una jugada de ocupación de territorio:

  • Territorio de desarrolladores (código, agentes, PRs).
  • Territorio de empresas que quieren multicloud y plan B.
  • Territorio de la opinión pública tech (“mirad, open weights”).

DeepSeek ya demostró que puedes mover el mercado entero con precio y suficiente calidad. Alibaba responde con escala de grupo, distribución cloud y una marca Qwen que ya tenía tracción en local. No es la misma película que un lab pequeño: es un conglomerado que puede permitirse quemar dinero de verdad, y ha dicho con cuánto.

Programación: dónde puede doler de verdad (y dónde es postureo)

Olvida un momento el “mejor del mundo”. Mira tareas.

Donde un modelo de este tipo puede ser una hostia útil:

  • Boilerplate y migraciones largas con patrón claro.
  • Agentes que levantan tests, leen fallos y pitean un parche.
  • Trabajo multimodal ligero (UI screenshots, trozos de vídeo de demos) si las claims de visión se sostienen fuera del slide.
  • Ciclos largos donde el coste de contexto y la disciplina de herramientas importan más que el chiste del one-shot.

Donde el anuncio no te salva:

  • Juicio de arquitectura cuando hay trade-offs de negocio.
  • Specs ambiguas (el 80% de las empresas).
  • Seguridad y superficie de ataque de agentes con herramientas.
  • Responsabilidad: alguien tiene que firmar el merge.

La fantasía tóxica es “diez días autónomos y a producción” leída como “puedo despedir al equipo”. La lectura adulta es “puedo comprimir el tramo mecánico si pongo arneses, evaluación y un humano en los gates”. Sin eso, tienes un becario infinito con mucha confianza y memoria selectiva.

Si montas agentes en serio, el cuello de botella rara vez es solo el modelo frontera. Es memoria, routing, presupuestos y no pisarse el contexto; de eso va el trabajo sucio de orquestación, no el keynote.

Qué está suavizando el relato corporativo

Periodismo de comunicado = repetir “el más avanzado hasta la fecha” hasta que parezca un hecho de la naturaleza. Lo que se suaviza:

  1. Autoevaluación. Las victorias en benchmarks las enseña Qwen; la metodología no viene en el pack de hechos verificados.
  2. Disponibilidad local. Se vende el aura open-source antes de tener fecha cerrada y artefactos en mano.
  3. Parámetros como fetiche. 2,4T es el gancho; 95B activos es la variable de ingeniería. Adivina cuál manda en el titular de portada.
  4. El salto de familia. Se habla poco de que la reputación local de Qwen se construyó con otras tallas (72B, 32B, etc.), no con este Max.
  5. La brecha mecánica/juicio. El sector celebra autonomía prolongada mientras papers como GAUGE recuerdan que el juicio sigue siendo el agujero. No es una refutación de Qwen; es el antídoto al delirio general.

Cómo leer este anuncio si programas o pagas la nube

Lista corta, sin coach:

  1. Prueba en tu repo, no en el leaderboard del vendedor. Un puñado de issues reales > mil gráficos de radar.
  2. Mide salida, no solo entrada. El 6$/M de output en modos agénticos es el sitio donde se desangran los POCs “baratos”.
  3. Espera a los pesos y lee la licencia. Hasta entonces, es un modelo de API con promesa.
  4. No tires tus rutas DeepSeek/Kimi/Claude/GPT. El vendor lock-in ya no es debate de congreso; es riesgo operativo. Un router por tier sigue siendo higiene.
  5. Separa Max frontera de hijo local. El valor para el PC llegará por derivados, no porque te tragues 2,4T en la torre.
  6. Pon un canario de código (tests, linters, políticas de merge) antes de dejar diez días de “autonomía” sueltos. Autónomo sin freno es otra forma de llamar a la pagaza.

Entonces, ¿es el rey chino de la programación?

En el sentido del meme: aún no hay veredicto público limpio. Hay un modelo nuevo, grande, caro de entrenar, agresivo de precio, con claims fuertes en agentes y código, y con el viento de una familia que ya puntuaba alto en local antes de este lanzamiento.

En el sentido industrial: es una pieza de rey aunque no lleve corona de benchmark. 52.000+ millones de inversión plurianual, subida del 6% en bolsa el día D, open weights como arma, MoE de 2,4T/95B y una pelea a cuchillo con DeepSeek, Moonshot y Zhipu. Eso no es un release notes: es estrategia de bloque.

En el sentido de tu día a día escribiendo software: será “rey” el día que te baje el coste por trabajo terminado y no te llene el git de seguridad teatral. Hasta que no haya números terceros, pesos en mano y pruebas en repos de verdad, lo serio es tratarlo como candidato frontera de pago con narrativa open-weight, no como monarca ungido.

Alibaba no necesita que tú creas en la singularidad. Necesita que creas lo justo para migrar cargas, descargar el siguiente destilado y acostumbrarte a que el centro de gravedad del código asistido no solo vive en un suburbio de San Francisco.

El resto es humo con contador de parámetros.

Fuentes

  1. GAUGE: Grading Agent-Built Financial Models Without a Golden Answerarxiv.org
  2. La china Alibaba presenta Qwen3.8-Max, su modelo de IA más avanzado hasta la fechainfobae.com · 2026-08-03
  3. Ollama Modelos: Ranking Completo de los Mejores Modelos para Ejecutar en Local [2026]javadex.es · 2026-03-05
  4. Alibaba presenta modelo de IA Qwen 3.8-MAX; acciones subenes-us.finanzas.yahoo.com · 2026-08-03