GLM-5.2 vs Mythos: ¿nuevo sheriff chino en ciberseguridad o humo con acento de Pekín?

Zhipu AI dice que su modelo iguala a Mythos en ciberseguridad. Ahora hay un benchmark independiente que pone números encima de la mesa. Lo que dicen esos números es más matizado —y más interesante— que el titular.

10 min de lectura Actualizado el

En este artículo

El Cuñado dice que China ya juega en la misma liga

El Cuñado: "Z.ai ha construido una IA de ciberseguridad que iguala a Mythos. China ya está en la misma liga, tío."

La realidad: Semgrep publicó el 22 de junio de 2026 ("We have Mythos at Home") un benchmark con metodología pública donde GLM-5.2 saca 39% F1 en detección de IDOR, por encima de Claude Code (32-37%), a ~0,17 $ por vulnerabilidad. Suena bien. Pero el harness completo de Semgrep alcanza 53-61% y deja a GLM-5.2 atrás. La ventaja de GLM solo aparece en la comparación sin andamiaje. Ganar en un subtest estrecho no es igualar a Mythos en ciberseguridad.

Por qué importa saberlo: Porque si el claim completo es verdad, hay un modelo con capacidad de ataque a infraestructura crítica que cualquiera puede descargarse esta tarde. Y si es exagerado, como sugieren los datos de Semgrep, alguien está usando el miedo geopolítico para inflar un lanzamiento de producto. Cualquiera de las dos opciones merece más de un titular.


Qué es GLM-5.2 y por qué el open-weights es el dato que más duele

Zhipu AI, conocida también como Z.ai, es uno de los laboratorios de IA más importantes de China, respaldado por la Universidad Tsinghua. El 28 de junio de 2026 lanzaron GLM-5.2, un modelo de 753.000 millones de parámetros, bilingüe nativo en chino e inglés, y, aquí viene lo relevante, de pesos abiertos.

Pesos abiertos significa que los parámetros del modelo están disponibles para descarga directa. No hace falta una cuenta, no hace falta pedir permiso a nadie, no hay una API que registre quién lo usa. Es como publicar el código fuente de una herramienta de hacking: el 99% de la gente que la descarga son investigadores, estudiantes o curiosos. El 1% restante es el problema.

Los modelos de pesos abiertos no tienen un portero. Cualquiera entra, y nadie lleva el registro.

Esto no es una hipótesis: el gobierno de EE. UU. ya identifica los modelos de IA capaces de detectar vulnerabilidades como una amenaza de seguridad nacional seria, según The Verge. Por eso Washington ha restringido el acceso de China a modelos como Mythos y al hardware necesario para entrenarlos. No es paranoia: es que ya saben lo que estos modelos pueden hacer cuando están en las manos equivocadas.

El matiz importante, que el titular de Forbes no se molestó en incluir: GLM-5.2 se queda atrás de Anthropic y OpenAI en tareas generales. La brecha se ha cerrado específicamente en bug-finding, no en el conjunto. Eso sugiere una capacidad dirigida, no paridad general. Que alguien haya optimizado un modelo para encontrar agujeros en sistemas es preocupante por sí solo, independientemente de si iguala o no a Mythos en todo lo demás.


El problema de medir ciberseguridad: los benchmarks mienten con elegancia

Antes de aceptar o rechazar el claim de Z.ai, hay que entender por qué medir rendimiento en ciberseguridad es particularmente complicado.

Los benchmarks estándar de IA, los que miden razonamiento, código, matemáticas, tienen metodologías públicas y reproducibles. En ciberseguridad, el problema es que el entorno controlado no captura lo que importa en producción.

Puedes diseñar un CTF (Capture The Flag, competición donde los participantes atacan sistemas preparados con vulnerabilidades conocidas) donde el modelo brille. Y ese mismo modelo puede ser inútil frente a infraestructura real con ruido, contexto ambiguo, sistemas legacy y vectores de ataque que no estaban en el dataset de entrenamiento. Ya lo vimos con versiones anteriores de GLM: ganar en papel no es ganar cuando alguien te mete un sistema real por delante.

El benchmark que sí tiene metodología pública y reproducible es el del AISI, el Instituto de Seguridad de IA del Reino Unido, y los resultados son los que deberían estar en los titulares, no las afirmaciones de Z.ai.


Lo que Mythos sí puede hacer: los números que asustan de verdad

Mientras Z.ai lanza claims que los datos matizan, Mythos Preview tiene números concretos publicados por organismos independientes. Y esos números son lo suficientemente serios como para que el debate sobre GLM-5.2 no sea solo geopolítico.

Según CyberScoop (mayo de 2026), el AISI evaluó a Claude Mythos Preview y GPT-5.5 y encontró que ambos han superado significativamente la tendencia de duplicación en completar tareas cibernéticas autónomas. Para contextualizar: el AISI estimaba que el tiempo en que los modelos frontera alcanzaban el 80% de fiabilidad en tareas cibernéticas se duplicaba cada 5 meses aproximadamente (METR, de forma independiente, encontró un tiempo de duplicación de ~4 meses desde finales de 2024). Mythos Preview no siguió esa curva: la rompió.

Los datos concretos:

  • "The Last Ones": simulación de ataque a una red corporativa en 32 pasos. Mythos Preview lo completó en 6 de cada 10 intentos.
  • "Cooling Tower": el rango que ningún modelo había completado hasta entonces. Mythos Preview lo resolvió en 3 de cada 10 intentos.

Mythos Preview fue el primer modelo en completar ambos rangos del AISI. Eso no es una mejora incremental: es un salto cualitativo.

Palo Alto Networks, por su parte, testó Claude Mythos, Opus 4.7 y GPT-5.5-Cyber en condiciones más cercanas al mundo real. Su conclusión, según CyberScoop: estos modelos son extraordinariamente capaces de descubrir vulnerabilidades y generar rutas de explotación en tiempo casi real. Del escaneo con IA emitieron 26 CVEs (identificadores de vulnerabilidades públicamente conocidas) a través de más de 130 productos. No es un CTF preparado: son vulnerabilidades reales en software real.


Dónde Mythos falla: las trampas que SecurityWeek sí encontró

XBOW hizo el trabajo sucio de testear Mythos Preview de forma independiente, y sus conclusiones (SecurityWeek, mayo 2026) añaden matices que el hype sobre Mythos tiende a ignorar.

Lo que funciona bien: descubrimiento de vulnerabilidades en código nativo y reversing. Mythos Preview es un paso significativo por encima de todos los modelos existentes en estas tareas, especialmente cuando se testea contra sistemas "live + source" (sistema en ejecución con acceso al código fuente) en lugar de solo código estático.

Lo que no funciona tan bien:

  • Requiere prompts muy precisos para dar lo mejor de sí. Con instrucciones vagas, se vuelve demasiado literal y conservador.
  • Su juicio es mixto: rechaza falsos positivos mejor que modelos anteriores, pero puede perder verdaderos positivos en el proceso.
  • Tiende a sobreestimar la relevancia práctica de sus hallazgos: encuentra algo, lo reporta como crítico, y resulta que en contexto real es difícilmente explotable.

El dato más incómodo para Anthropic: cuando el presupuesto de tokens está fijo, Mythos Preview supera a Opus 4.6 en vulnerabilidades web, pero es superado por GPT-5.5 en ese mismo dominio. Y Mythos Preview cuesta 5 veces más que un modelo Opus. XBOW se preguntó explícitamente si un modelo más barato con más tiempo de cómputo podría igualar su precisión. La respuesta fue que no es terriblemente ineficiente, pero tampoco es el mejor de su clase en benchmarks normalizados por coste.

Esto es relevante para el debate con GLM-5.2: si el claim de Z.ai se refiere a ciertas tareas de bug-finding en condiciones controladas, es perfectamente posible que un modelo más pequeño y especializado iguale o supere a un modelo generalista más grande en esa franja concreta. No sería la primera vez. Pero eso no es "igualar a Mythos en ciberseguridad": es ganar en un subconjunto específico bajo condiciones específicas.


Lo que el benchmark de Semgrep sí dice, y lo que no

Volvamos al claim original. Según The Verge (28 de junio de 2026), "algunos investigadores" afirman que GLM-5.2 iguala a Mythos en ciertos escenarios de búsqueda de errores y ciberseguridad.

Ahora hay un dato concreto encima de la mesa: Semgrep publicó el 22 de junio de 2026 ("We have Mythos at Home") una medición donde GLM-5.2 saca 39% F1 en detección de IDOR, por encima de Claude Code (32-37%), a aproximadamente 0,17 $ por vulnerabilidad. Metodología pública, reproducible. Eso es real.

Pero el contexto que el titular omite:

  • El harness completo de Semgrep alcanza 53-61% en el mismo benchmark, superando a GLM-5.2 con claridad.
  • La ventaja de GLM solo aparece en la comparación sin andamiaje: modelo contra modelo, sin el sistema de apoyo que Semgrep construyó alrededor.
  • IDOR (Insecure Direct Object Reference) es una categoría específica de vulnerabilidad web. Ganar ahí no es ganar en el espectro completo de ciberseguridad ofensiva.

Lo que todavía no sabemos:

  • Si Z.ai respalda oficialmente ese claim o es una afirmación de terceros que el artículo recoge sin más contexto.
  • Qué hardware y cuánto tiempo necesita GLM-5.2 para ejecutar esas tareas. "Hardware fácilmente disponible" es lo que dice The Verge, sin especificar.
  • Cómo se comporta en los rangos del AISI, "The Last Ones", "Cooling Tower", donde Mythos Preview demostró su salto cualitativo.

Un benchmark independiente con metodología pública es exactamente lo que pedíamos. Semgrep lo dio. Y lo que dice es: GLM-5.2 gana en un subtest estrecho, no iguala a Mythos. Eso no es un titular de derrota para Z.ai, pero tampoco es el que están vendiendo.


El riesgo real que no depende de si el claim es verdad

Hay algo en este debate que se pierde cuando nos quedamos discutiendo si GLM-5.2 iguala o no a Mythos: el riesgo de open-weights en ciberseguridad existe independientemente de la calidad del modelo.

Un modelo que encuentra el 39% de las vulnerabilidades que encuentra el harness completo de Semgrep, disponible para descarga libre, sin supervisión, sin registro de uso, ya es un problema serio. No hace falta que iguale al mejor sistema del mundo para ser una herramienta útil para actores maliciosos con tiempo y motivación.

Las restricciones de EE. UU. al acceso chino a modelos como Mythos y al hardware de entrenamiento tienen esta lógica detrás: si controlas el hardware y los modelos frontera, controlas quién puede desarrollar capacidades ofensivas de primer nivel. Pero esa lógica se rompe cuando el modelo se publica con pesos abiertos. No hace falta el hardware de entrenamiento si ya tienes el modelo entrenado.

Esto conecta con un problema más amplio que va más allá de China: la seguridad de los modelos de IA generativa en manos de atacantes es un problema estructural del sector, no un accidente puntual. GLM-5.2 es el ejemplo más visible esta semana. No será el último.


La tesis que nadie quiere decir en voz alta

El benchmark de Semgrep resuelve parte de la pregunta: GLM-5.2 tiene capacidad real y medible en detección de IDOR, con metodología pública y números concretos. Eso es más de lo que teníamos hace una semana.

Lo que también resuelve: que ganar en ese subtest no es igualar a Mythos. El harness completo de Semgrep supera a GLM-5.2. Los rangos del AISI, donde Mythos Preview demostró que los modelos frontera ya pueden ejecutar ataques cibernéticos autónomos de múltiples pasos contra infraestructura real, siguen sin tener respuesta pública de Z.ai.

Y sabemos que la capacidad de encontrar vulnerabilidades en código nativo, una de las áreas donde GLM-5.2 supuestamente compite, es exactamente la que XBOW identificó como el punto fuerte de Mythos Preview. Si Z.ai ha optimizado un modelo de 753.000 millones de parámetros específicamente para esa tarea y lo ha publicado con pesos abiertos, el debate no es si iguala a Mythos en todo.

El debate es si estamos equipados para gestionar un mundo donde esa capacidad, parcial, medible, real, es un archivo descargable.

Semgrep puso los primeros números encima de la mesa. La segunda pregunta lleva meses sin respuesta y nadie parece tener prisa.

Fuentes

  1. China’s Z.ai claims it can match Mythos on cybersecuritytheverge.com · 2026-06-28
  2. Buckle Up: The Bad Guys Now Have A Model As Powerful As Mythosforbes.com · 2026-06-28
  3. Researchers say AI just broke every benchmark for autonomous cyber capabilitycyberscoop.com · 2026-05-13
  4. Mythos Proves Potent in Vulnerability Discovery, Less Convincing Elsewheresecurityweek.com · 2026-05-14