GLM-5.3: la misma base que GLM-5.2 y un relato de paliza

Z.ai no ha cambiado el modelo de debajo. Ha vuelto a post-entrenar GLM-5.2, ha ganado CyberGym por décimas y ha perdido DeepSWE. El resto es precio, on-prem y comunicado.

7 min de lectura

En este artículo

El Cuñado no abre el paper. Abre el titular, se fuma medio hilo y baja a la cena con una certeza de hormigón.

El Cuñado dice: "Bro, GLM-5.3 es un modelo nuevo que les come la tostada a GPT y a Mythos. China ha ganado. Mira el benchmark."

La realidad es: Z.ai afirma que GLM-5.3 usa el mismo modelo base que GLM-5.2 y que todas las mejoras salen del post-entrenamiento, según el recuento de Interconnects. En CyberGym llega al 84.5% y deja atrás a Mythos 5 (83.8%) y a GPT-5.6 Sol (83.6%); esas cifras las confirma también la documentación de Z.ai. En DeepSWE v1.1 se queda en 66.9, por detrás de Kimi K3 (67.5) y Fable 5 (69.7), según Yahoo.

Por qué importa saberlo: Si tu stack depende de un comunicado, te casas con un modelo que gana una liga y pierde la de al lado. La diferencia útil está en la tarea, el precio y si te dejan instalarlo en tu rack.

La base no se ha tocado

Interconnects y Z.ai coinciden en lo que de verdad mueve el producto: no hay base nueva. Hay otra pasada de post-entrenamiento sobre GLM-5.2. Eso no es un detalle de laboratorio. Es el mecanismo. El preentrenamiento, la parte cara, la que te obliga a juntar tokens, GPUs y meses, ya estaba hecho. Lo que han movido es la fase de encima: más datos de tarea, más señal, más vueltas al mismo esqueleto.

Quien haya seguido a Z.ai no debería sorprenderse. El paper original de GLM, de 2021 (arXiv:2103.10360), ya iba de exprimir una receta con el mismo tamaño y los mismos datos, no de inventar un dinosaurio más grande. Propusieron un modelo de lenguaje general con relleno de espacios en blanco autorregresivo: en vez de solo adivinar la siguiente palabra, o de tapar un hueco como BERT, el modelo aprendía a rellenar blancos sin soltar la generación de izquierda a derecha. Con ese truco superaba a BERT, T5 y GPT en varias tareas a igualdad de tamaño y de datos.

La ficha de glm-10b en Hugging Face, de marzo de 2021, enseña el mismo vicio de ingeniería: preentrenado en Pile, 48 capas transformer, tamaño oculto 4096 y 64 cabezas de atención. Nada de magia de arquitectura de última hora. Un laboratorio que lleva años iterando el mismo linaje.

GLM-5.2 ya rozaba la frontera en ciber. GLM-5.3 es, por boca de Z.ai, esa misma base con más post-entrenamiento. El comunicado vende salto. El mecanismo es otro round.

Ahí encaja otra pieza que Yahoo sí recoge y el hype suele esconder: Z.ai está en la Entity List de EE.UU. Las empresas estadounidenses no pueden exportarle tecnología controlada. No hace falta un discurso de bloques para leer la consecuencia práctica. Si no te llega el último stack de fuera, o iteras lo que ya tienes o te paras. Post-entrenar la base que controlas es, entre otras cosas, lo que te queda cuando el grifo de silicio y de software te lo cierran por lista.

Gana un ranking, pierde el de al lado

CyberGym es el número que viaja bien en un tuit. 84.5% contra 83.8% y 83.6%. Tres décimas sobre Mythos 5. Nueve sobre GPT-5.6 Sol. Es un liderato real y estrecho. No es una paliza. Si cambias de juez, el podio se mueve.

DeepSWE v1.1, el otro tablero que trae Yahoo, deja a GLM-5.3 tercero de ese corte: 66.9 frente a 67.5 de Kimi K3 y 69.7 de Fable 5. El mismo laboratorio que se cuelga la medalla de "top open-weight coding model" pierde la prueba de software ante dos rivales. Las fuentes consultadas no recogen otros benchmarks ni la metodología del Z.ai Code Bench, así que no hay que inventar una superioridad que no está medida ahí.

Un punto y pico en CyberGym y casi tres puntos abajo en DeepSWE no es "la frontera ha cambiado de dueño". Es un modelo competitivo y desigual.

Esa desigualdad es el dato operativo. Un equipo de ciber que evalúa exploits y un equipo que vive en repos y parches no están comprando el mismo animal. El post-entrenamiento empuja fuerte donde ha habido señal. Donde no, el modelo se queda en el pelotón. Quien lea "el mejor modelo de código de pesos abiertos" y lo traduzca por "ya no necesito al resto" se va a pegar el mismo hostión que el que compró un curso de 997 € porque un slide decía "número 1".

La guerra de rankings chinos y americanos se parece cada vez más a la de Qwen3.8-Max: el comunicado declara victoria total y los tableros, uno al lado del otro, enseñan un empate sucio. La tesis útil no es "Z.ai ha ganado". Es que ya no hace falta estrenar base para entrar en esa pelea. Hace falta un ciclo corto de post-entrenamiento y un canal para que alguien lo use de verdad.

El millón de ARR y el céntimo por token

Interconnects recoge que Z.ai alcanzó, según su propio reporte, 1.000 millones de dólares de ingresos recurrentes anuales gracias a un negocio fuerte de despliegue on-premises. Léelo otra vez, pero al revés de como lo cuenta el Cuñado: el número, si se sostiene, habla de racks en casa del cliente, no de que GLM-5.3 sea el motor que factura. Un ARR reportado no descompone producto, contrato ni margen. No demuestra que este checkpoint concreto pague las nóminas.

El on-prem, en cambio, sí encaja con el tipo de modelo que están sirviendo. Un Mixture-of-Experts de contexto largo te come memoria por dos sitios a la vez: los expertos que despiertas y la caché KV de la ventana. En un API ajena pagas ese desperdicio con recargo. En tu sala de máquinas decides tú el batch, la cuantización y qué se queda en GPU. Por eso el despliegue local no es folklore de soberanía. Es donde el post-entrenamiento se convierte en coste controlable.

Yahoo pone el otro lado del mostrador. El plan de codificación GLM funciona por cuota de puntos. La API de Zhipu cuesta, aproximadamente, una décima parte de las tarifas por token de los modelos frontera de EE.UU. Las fuentes consultadas no recogen si GLM-5.3 heredará el precio de GLM-5.2, así que no hay que clavar una cifra que no está. Lo que sí está es la palanca: iterar la misma base y venderla barata, o instalarla detrás del firewall, compite peor en la rueda de prensa y mejor en la factura.

Eso es el tablero de verdad. No el comunicado. Un lab que no puede importar tecnología controlada, que reentrena lo que ya tiene, que publica lideratos estrechos y derrotas igual de estrechas, y que cobra una fracción. La distribución, API barata, on-prem, y la promesa de pesos abiertos con la que Yahoo titula el envío, es el producto. El "modelo nuevo que lo cambia todo" es el envoltorio.

Si evalúas para producción, el checklist El resto es ruido de hilo.

Preguntas frecuentes

¿GLM-5.3 es un modelo base nuevo?

No. Z.ai afirma que GLM-5.3 usa el mismo modelo base que GLM-5.2 y que todas las mejoras vienen del post-entrenamiento, según Interconnects. No hay, en las fuentes consultadas, anuncio de una arquitectura distinta. Lo que cambia es la fase de encima: más entrenamiento sobre la base que ya existía. Quien lo venda como "nuevo cerebro" está vendiendo el envoltorio, no el mecanismo.

¿GLM-5.3 es mejor que GPT-5.6 y que Kimi K3?

Depende del tablero. En CyberGym saca 84.5% y supera a GPT-5.6 Sol (83.6%) y a Mythos 5 (83.8%), según Z.ai e Interconnects. En DeepSWE v1.1 se queda en 66.9, por detrás de Kimi K3 (67.5) y Fable 5 (69.7), según Yahoo. Es competitivo y desigual. No consta en las fuentes consultadas el resto de benchmarks.

¿Cuánto cuesta usar GLM frente a un modelo frontera de EE.UU.?

La API de Zhipu cuesta aproximadamente una décima parte de las tarifas por token de los modelos frontera estadounidenses, y el plan de codificación GLM cobra por cuota de puntos, según Yahoo. No consta en las fuentes consultadas si el precio de GLM-5.3 será el mismo que el de GLM-5.2, ni una tarifa exacta por millón de tokens de este checkpoint.

¿Z.ai puede comprar tecnología de IA de empresas de EE.UU.?

No la controlada. Z.ai está en la Entity List de Estados Unidos, lo que prohíbe a empresas estadounidenses exportarle tecnología controlada, según Yahoo. Eso no mide la calidad del modelo; sí explica por qué el laboratorio aprieta el post-entrenamiento de una base propia y el despliegue on-premises en lugar de esperar un stack importado.

Fuentes

  1. GLM-5.3: How Chinese labs keep stride with the frontierinterconnects.ai · 2026-08-14
  2. GLM-5.3 - Overview - Z.AI DEVELOPER DOCUMENTdocs.z.ai
  3. China's Z.AI Ships GLM-5.3, Calling It the Top Open-Weight Coding Modeltech.yahoo.com · 2026-08-14
  4. GLM: General Language Model Pretraining with Autoregressive Blank Infillingarxiv.org
  5. zai-org/glm-10b · Hugging Facehuggingface.co · 2021-03-18