Red Queen Gödel Machine: lo que NVIDIA publicó de verdad y lo que el hype añadió sin permiso

Un preprint de NVIDIA y Cambridge sobre IA que se autoevoluciona. Un porcentaje de mejora en código. Y de repente, ASI en 2028. Aquí está la cadena de distorsión, dato a dato.

12 min de lectura Actualizado el

En este artículo

El Cuñado ya tiene nuevo material

El Cuñado dice: "Bro, NVIDIA ha demostrado que la IA se autoevoluciona sola. En dos años tenemos superinteligencia total. El mundo cambia para siempre, tío."

La realidad es: el paper "Red Queen Gödel Machine" publicado el 28 de junio de 2026 muestra una mejora técnica concreta en cómo un sistema de IA puede mejorar su propio código iterativamente. La tasa de aprobación en generación de código sube del 69,9% al 71,7%. Eso es un 1,8 puntos porcentuales. Real, medible, interesante. Y a años luz de "superinteligencia total".

Por qué importa saberlo: porque entre el paper y el titular de KuCoin que lo popularizó hay una cadena de distorsión que vale la pena desmontar tramo a tramo. No porque el trabajo sea malo (no lo es) sino porque si no entiendes qué demuestra de verdad, no puedes evaluar qué viene después.


Qué dice el paper de la Red Queen Gödel Machine de verdad

El trabajo, firmado por investigadores de NVIDIA y la Universidad de Cambridge, revive un concepto que lleva acumulando polvo desde 2003: la Máquina de Gödel de Jürgen Schmidhuber.

La idea original era elegante y paralizante a la vez: un sistema de IA que se automodifica, pero solo cuando puede demostrar matemáticamente que la modificación lo mejora. El problema es que esa exigencia de prueba formal convirtió el concepto en un límite teórico impracticable durante veinte años. Nadie pudo construirlo porque las pruebas matemáticas previas a cualquier cambio son computacionalmente inasumibles en sistemas reales.

Lo que NVIDIA y Cambridge proponen en la Red Queen Gödel Machine (RQGM) es un truco pragmático: en lugar de demostración matemática formal, usas selección evolutiva. El sistema divide el aprendizaje en épocas. En cada época, un evaluador (congelado durante esa ronda) puntúa a los candidatos. Solo se reemplaza al evaluador si uno nuevo lo supera estadísticamente en datos de referencia anclados. El concursante y el evaluador coevolucionan juntos. Nadie demuestra nada formalmente; se compite y el mejor gana.

"La evolución de utilidad controlada" resuelve el problema de la prueba matemática sustituyéndola por competición estadística en entorno aislado. Es más humilde que la idea original. También es más real.

El nombre "Red Queen" viene de Lewis Carroll: en el País de las Maravillas, hay que correr todo lo que puedas para quedarte en el mismo sitio. Aquí, el evaluador mejora para no quedarse obsoleto; el concursante mejora para seguir siendo útil. Ninguno puede parar.


Los números reales, sin inflar

Los resultados del paper son estos, según la publicación recogida por KuCoin:

Generación de código (benchmark Polyglot):

  • Mejor resultado previo: 69,9% de tasa de aprobación.
  • Con RQGM: 71,7%.
  • Coste: entre 1,35 y 1,72 veces menos tokens que los competidores.

Redacción de artículos académicos:

  • Tasa de aceptación en panel de revisión fijo: del 21,8% al 40,5%.
  • Esto incluye coevolución conjunta de agente escritor y agente revisor.

Demostración matemática de nivel olímpico:

  • El evaluador evolucionado fue más preciso que la línea base estática.
  • Redujo los costes de búsqueda en tres veces.

Corrección de sesgo de los LLM:

  • En la línea base más fuerte, los revisores eran 1,91 veces más propensos a aceptar artículos escritos por IA que por humanos.
  • Tras la evolución, el sistema trató a ambos por igual manteniendo un 80% de precisión factual.

Ese último punto es probablemente el resultado más interesante del paper y el que menos titulares ha generado. Un sistema que detecta y corrige su propio sesgo hacia el contenido generado por IA es útil en entornos reales. No es superinteligencia, pero es un problema técnico concreto con una solución técnica concreta.

Lo que el paper no dice:

  • Cuántas ejecuciones hay detrás de cada cifra ni los intervalos de confianza.
  • Si los resultados se mantienen fuera de los benchmarks del laboratorio.
  • Si el mecanismo escala a tareas abiertas sin métricas de evaluación predefinidas.
  • Nada sobre ASI. Cero menciones a 2028.

Además, el panel de revisión que evalúa los artículos académicos es fijo y posiblemente sintético, no revisión por pares real. Eso limita bastante lo que se puede inferir sobre el rendimiento en condiciones reales.


De dónde salió la ASI en 2028

El paper no menciona superinteligencia artificial en ningún momento. La fecha de 2028 tampoco aparece en el texto. Entonces, ¿de dónde sale?

Según el artículo de KuCoin que popularizó el paper, Jack Clark (cofundador de Anthropic) estimó una probabilidad del 60% de que surja una IA altamente autónoma para finales de 2028. Eso es una opinión personal de alguien relevante en el sector, recogida en un medio que no es técnico ni revisado. No es un dato del estudio. No está respaldado por los resultados del paper. Es una predicción de un individuo, con el mismo estatus epistémico que cualquier otra predicción de alguien que lleva años en el sector y tiene incentivos para hablar de esto.

La cadena de distorsión funciona así:

  1. NVIDIA y Cambridge publican un preprint técnico con mejoras incrementales en benchmarks específicos.
  2. KuCoin publica un artículo sobre el paper y mete en el mismo texto la opinión de Jack Clark sobre 2028.
  3. El titular combina ambas cosas: "NVIDIA paper on AI self-evolution sparks debate over 2028 ASI timeline".
  4. El Cuñado lee el titular, no el paper, y llega a la cena de Navidad con la conclusión definitiva.

Esto no es un error de KuCoin necesariamente. Es el funcionamiento habitual del ciclo de hype en IA: un resultado técnico real sirve de gancho para una conversación más grande sobre el futuro, y en el proceso los matices se pierden por el camino.


El contexto más amplio: todo el mundo está empujando la misma narrativa

El paper de RQGM no existe en el vacío. Aparece en un momento en que varios actores del sector tienen interés en que se hable de automejora recursiva y timelines cortos hacia la AGI o la ASI.

OpenAI declaró en junio de 2026 que "la IA haciendo investigación de IA se convertirá en el factor determinante del ritmo de progreso en los próximos años" y que para marzo de 2028 podrían tener "una fracción significativa de su investigación realizada por sistemas de IA". Eso es una proyección interna, no un hito verificado. También en junio de 2026, OpenAI presentó su primer chip propio, Jalapeño, desarrollado en nueve meses con Broadcom, y afirmó que la IA ayudó a diseñarlo. Si quieres profundizar en qué significa ese chip para la independencia de OpenAI respecto a NVIDIA, lo analizamos en detalle en Jalapeño, el primer chip de OpenAI: ¿independencia real de Nvidia o diapositiva para inversores?.

Tanto OpenAI como Anthropic pidieron en 2026 la creación de un organismo internacional de supervisión de la IA, reconociendo la posibilidad de una "explosión de inteligencia" si los modelos se automejoran recursivamente. Eso es llamativo: las mismas empresas que impulsan el desarrollo más rápido posible piden supervisión porque reconocen que el escenario de automejora recursiva sin control es un problema real.

Y luego está el hardware. La plataforma GB300 NVL72 de NVIDIA alcanzó en junio de 2026 un rendimiento 20 veces superior por megavatio respecto a la generación Hopper (H200) en el benchmark AA-AgentPerf, desarrollado por Artificial Analysis. Soporta 60.000 agentes concurrentes por MW frente a 2.600 de la generación anterior. Eso es capacidad de cómputo real, no hype. Pero capacidad de cómputo no es lo mismo que automejora recursiva hacia la superinteligencia: es infraestructura que permite escalar los sistemas actuales.

El patrón es consistente: resultados técnicos reales, narrativa de timeline corto superpuesta encima, y el debate sobre ASI como telón de fondo que da urgencia a todo.


Lo que el paper resuelve y lo que no toca

La RQGM hace algo técnicamente relevante: resuelve el problema que tenía la Máquina de Gödel original durante veinte años. Schmidhuber propuso en 2003 un sistema que se automodifica con garantías formales. Era teóricamente correcto e impracticable. NVIDIA y Cambridge lo hacen practicable sustituyendo la prueba matemática por competición estadística.

Eso es un avance real en un problema técnico concreto. Merece atención.

Lo que no resuelve:

El problema de la generalización. Los benchmarks del paper son Polyglot (código), revisión de artículos académicos y demostraciones matemáticas de nivel olímpico. Todos tienen métricas de evaluación bien definidas. El mundo real está lleno de tareas donde no hay una métrica clara de "aprobado/suspendido". No sabemos si el mecanismo funciona fuera de ese tipo de entornos.

El problema de la escalabilidad sin supervisión. El mecanismo de coevolución evaluador-concursante funciona en laboratorio con supervisión humana implícita en el diseño del benchmark. No está claro si escala a un sistema de IA general que se autoevoluciona sin intervención humana en el diseño de las métricas.

El problema de la replicación. El paper es un preprint publicado en arXiv, sin revisión por pares completada. Eso no lo invalida (muchos trabajos importantes pasan por arXiv antes de la revisión formal) pero significa que los números no han sido verificados de forma independiente. La distancia entre un preprint y un resultado consolidado puede ser grande. Hay que esperar a ver si el paper aguanta la revisión sin que los números se degraden y si otros laboratorios replican la metodología.

El problema del sesgo de evaluación. El paper corrige un sesgo interesante (la propensión a aceptar contenido generado por IA), pero lo hace dentro de un sistema cerrado con un panel de revisión fijo. Eso no es lo mismo que un sistema que detecta y corrige sesgos en entornos abiertos.


La distancia real entre esto y ASI

Aquí está la brecha que el hype cruza sin mirar atrás.

Un sistema que mejora su tasa de aprobación en generación de código del 69,9% al 71,7% usando coevolución es un sistema que hace mejor una tarea específica en condiciones de laboratorio. Es útil. Es interesante técnicamente. No es una demostración de que la automejora recursiva conduce a la superinteligencia.

La automejora recursiva que preocupa a los investigadores de seguridad (y que está detrás de las peticiones de supervisión internacional de OpenAI y Anthropic) es un escenario donde un sistema mejora sus propias capacidades cognitivas de forma acelerada, sin que los humanos puedan seguir el ritmo ni intervenir. La RQGM no demuestra que ese escenario sea inminente. Demuestra que un sistema puede mejorar iterativamente en benchmarks bien definidos usando selección evolutiva. Eso es un componente posible de un camino hacia sistemas más capaces. No es el destino.

La diferencia importa porque las decisiones de política, inversión y regulación que se tomen en los próximos dos años dependen de si la gente entiende qué está pasando de verdad o si está reaccionando al titular de KuCoin.

En 2023, una carta abierta pedía una pausa de seis meses en el desarrollo de modelos de frontera. La firmaron Elon Musk, Yoshua Bengio y otros. El argumento central era el riesgo de una "explosión de inteligencia" por incentivos comerciales sobre la seguridad. La pausa no ocurrió. El debate sobre gobernanza tampoco ha llegado a ningún acuerdo concreto. Y mientras tanto, los resultados técnicos siguen acumulándose.

Si el tema de la gobernanza te interesa más allá del hype, la tensión entre resultados incrementales y riesgo sistémico está bien documentada en Gobernanza de IA a escala: pilares técnicos, casos reales de fallos y checklist práctico.


Qué vigilar para saber si esto es real

Tres señales concretas que te dirán si la RQGM es un avance sólido o un resultado de laboratorio que no escala:

Revisión por pares. El paper está en arXiv como preprint. Cuando pase por revisión formal, los revisores van a pedir intervalos de confianza, detalles sobre el número de ejecuciones y pruebas de robustez. Si los números aguantan, el trabajo es sólido. Si se degradan o los autores no pueden responder a las preguntas metodológicas, hay que recalibrarlo.

Replicación independiente. Los resultados de un laboratorio no son resultados de la ciencia hasta que otro laboratorio los reproduce con metodología publicada. Eso lleva tiempo. Si en los próximos seis a doce meses otros grupos replican el mecanismo de coevolución con resultados similares, el avance es real. Si nadie lo replica o los intentos fallan, la foto cambia.

Generalización fuera de benchmarks. Los benchmarks del paper tienen métricas claras. Si alguien demuestra que el mecanismo funciona en tareas sin métricas predefinidas (razonamiento abierto, toma de decisiones en entornos ambiguos) eso sería un salto cualitativo. Hasta que ocurra, los resultados son válidos dentro de su dominio y no fuera.

El Cuñado no va a esperar a ninguna de esas tres cosas. Tú sí puedes.


Preguntas frecuentes

¿Qué es la Red Queen Gödel Machine?

Es un sistema de IA propuesto por NVIDIA y la Universidad de Cambridge que adapta la Máquina de Gödel original (2003) para hacerla practicable. En lugar de requerir pruebas matemáticas formales para automodificarse, usa selección evolutiva: un evaluador y un concursante coevolucionan, y solo el que supera estadísticamente al anterior sobrevive.

¿Demuestra el paper de la Red Queen Gödel Machine que la ASI llegará en 2028?

No. El paper no menciona superinteligencia artificial ni la fecha 2028 en ningún momento. Esa conexión la introdujo un artículo de KuCoin que mezcló los resultados técnicos del paper con una opinión personal de Jack Clark (Anthropic) sobre timelines. Son dos cosas distintas presentadas juntas.

¿Cuánto mejora realmente el rendimiento de la RQGM?

En generación de código (benchmark Polyglot), la tasa de aprobación sube del 69,9% al 71,7%, con un coste entre 1,35 y 1,72 veces menor en tokens. En revisión de artículos académicos, la tasa de aceptación pasa del 21,8% al 40,5%. En corrección de sesgo, el sistema equiparó el trato a contenido humano y de IA manteniendo un 80% de precisión factual.

¿Por qué hay que esperar antes de sacar conclusiones grandes?

Porque el paper es un preprint en arXiv sin revisión por pares completada, los benchmarks tienen métricas bien definidas que no representan tareas abiertas del mundo real, y ningún laboratorio independiente ha replicado aún los resultados. Hasta que eso ocurra, los números son válidos en su dominio de laboratorio, no fuera de él.

Fuentes

  1. NVIDIA paper on AI self-evolution sparks debate over 2028 ASI timeline | KuCoinkucoin.com · 2026-06-28
  2. OpenAI Joins Anthropic in Call for International AI Watchdoggizmodo.com · 2026-06-09
  3. OpenAI Distances Itself From Nvidia With Jalapeño, Its First In-House AI Chipgizmodo.com · 2026-06-24
  4. NVIDIA GB300 Dominates Agentic AI Workloads With 20x Performance Leap Over Hopper As Rubin Nears Launchwccftech.com · 2026-06-14
  5. ‘Too powerful for the public’: Inside Anthropic’s bid to win the AI publicity wartheguardian.com · 2026-04-12