ChatGPT cita propaganda china para explicarte la democracia americana: los números que deberían incomodar a cualquier empresa

El 51% de las respuestas de ChatGPT sobre política exterior citó medios estatales. El 90% de las respuestas sobre elecciones eran incorrectas o sesgadas. Esto no es teoría: son los datos del mayor análisis independiente de chatbots sobre noticias electorales.

12 min de lectura Actualizado el

En este artículo

Le preguntas a un chatbot sobre política. Te responde con el Partido Comunista Chino como fuente

Imagina que abres Claude, preguntas qué sistema de gobierno tiene Estados Unidos y recibes una respuesta que cita el Global Times como referencia.

El Global Times. El diario del Partido Comunista Chino. Para explicarte cómo funciona la democracia americana.

Esto no es un experimento controlado de laboratorio ni una anécdota aislada de un usuario con mala suerte. Es uno de los hallazgos documentados del análisis de Forum AI publicado en junio de 2025, la mayor evaluación independiente realizada hasta la fecha sobre el comportamiento de chatbots de IA ante preguntas electorales y de política exterior. Cuatro modelos evaluados. Más de 12.500 respuestas analizadas. Y los números son lo suficientemente malos como para tomarse en serio el problema, con todas las reservas metodológicas que corresponde hacer.

Porque hay que hacer reservas. Forum AI no ha publicado el paper completo con metodología detallada, no constan las versiones exactas de los modelos evaluados ni si tenían acceso a internet en tiempo real durante las pruebas, y los criterios exactos para medir "sesgo direccional" no están definidos públicamente. El estudio fue cubierto por el New York Post a partir de declaraciones de Katie Harbath, exejecutiva de Facebook. Sin el documento técnico completo, los porcentajes hay que leerlos con la precaución que merece cualquier cifra que no puedes verificar línea a línea.

Dicho esto: incluso ajustando por esa incertidumbre metodológica, el patrón que emerge es demasiado consistente como para descartarlo con un encogimiento de hombros.

Los números del análisis Forum AI: qué dijo cada modelo y cómo

El dato más llamativo del informe es el más amplio: el 90% de las respuestas sobre las elecciones de medio mandato de EE.UU. eran incorrectas, sesgadas o citaban directamente medios de propaganda estatal extranjera. No el 20%. No el 40%. Nueve de cada diez respuestas sobre uno de los procesos democráticos más cubiertos mediáticamente del mundo fallaron en alguna dimensión fundamental.

Desglosando por categorías, el problema con las fuentes es quizá el más estructural.

El 15% de todas las respuestas incluía al menos una fuente de medios estatales. En política exterior esa cifra subía al 35%. Y aquí los modelos no se comportaron igual:

  • ChatGPT citó medios estatales en el 51% de sus respuestas sobre política exterior.
  • Grok lo hizo en el 44% de los casos.
  • Los medios más frecuentes: Xinhua, Global Times, CGTN, China Daily. Con apariciones menores de medios rusos e iraníes.

Ninguno de los modelos avisó en ningún momento del conflicto de interés evidente que supone citar el órgano de propaganda de un gobierno extranjero para responder preguntas sobre política estadounidense.

En cuanto a errores factuales directos (fechas equivocadas, políticas atribuidas al partido incorrecto, datos inventados con total seguridad), el 30% del total de respuestas contenía al menos uno. Aquí la dispersión entre modelos fue notable:

  • ChatGPT: 9% de error factual (el menos malo).
  • Claude: 41%.
  • Grok: 43%.

Y luego está el sesgo direccional, que es el dato que más cuesta interpretar sin metodología explícita, pero que también es el más políticamente incómodo:

  • Claude falló en neutralidad en el 100% de sus respuestas direccionales sobre elecciones, todas sesgadas hacia posiciones de izquierda según el análisis.
  • Gemini derivó a la izquierda en el 92% de los casos.
  • ChatGPT en el 90%.
  • Grok tiró hacia la derecha en el 76% de los casos.

Si el sesgo fuera aleatorio o específico de una pregunta concreta, podría atribuirse a ruido estadístico. Cuando aparece de forma sistemática en miles de respuestas y en varios modelos distintos, hay algo en el corpus de entrenamiento o en el proceso de alineamiento que lo está produciendo.

Dos ejemplos concretos de qué significa "error factual" cuando el tema es real

Los porcentajes ayudan a calibrar la magnitud del problema. Los ejemplos concretos ayudan a entender por qué importa más allá del debate técnico.

Caso 1: Gemini y las primas del seguro médico en Arkansas.

Gemini afirmó que las primas del seguro ACA en Arkansas subirían entre un 65% y un 67% en 2026. El incremento real aprobado fue de aproximadamente el 22%. Una diferencia de más de 40 puntos porcentuales.

Una persona que use ese dato para decidir si mantiene su cobertura sanitaria, si cambia de plan o si directamente renuncia porque "no me lo puedo permitir" está tomando una decisión financiera real con consecuencias reales basada en un número que el modelo fabricó. Nadie puso un disclaimer. Nadie dijo "verifica esto antes de actuar".

Caso 2: Grok y las capacidades militares de Irán.

Grok aseguró que evaluaciones americanas indicaban que Irán no tenía marina ni fuerza aérea operativas. Los informes públicos del Pentágono y agencias de inteligencia describían esas capacidades como degradadas, no eliminadas. Son categorías distintas con implicaciones estratégicas completamente diferentes. La diferencia entre "no tiene capacidad operativa" y "tiene capacidad degradada" no es semántica cuando hablamos de tensiones en el Estrecho de Ormuz.

El otro frente: cuando China utilizó ChatGPT directamente para operar

El análisis Forum AI documenta lo que los modelos hacen de forma pasiva con su corpus de entrenamiento. Pero el 10 de junio de 2026, OpenAI reveló algo cualitativamente diferente: actores que probablemente se originaron en China utilizaron ChatGPT de forma activa y deliberada para montar operaciones de influencia dirigidas a debates reales en EE.UU.

No es lo mismo que un modelo entrenado con demasiado Global Times. Es gente utilizando la herramienta como infraestructura operacional para producir desinformación a escala.

OpenAI identificó dos operaciones distintas:

Operación 1: 'Data Center Bandwagon'

Esta campaña generó imágenes y comentarios en redes sociales que afirmaban falsamente que la construcción de centros de datos encarece la electricidad para los hogares estadounidenses. El contenido se distribuía haciéndose pasar por ciudadanos americanos en X y YouTube.

El timing no es casual. El debate sobre centros de datos (su consumo energético, su impacto en las facturas de luz de los hogares cercanos, la relación entre la expansión de infraestructura de IA y los precios de la energía) es un debate real y legítimo que existe en EE.UU. independientemente de cualquier operación extranjera. Ben Nimmo, investigador principal de OpenAI, lo calificó exactamente así: un ejemplo clásico de operación de influencia extranjera que se suma a un debate nacional genuino con cuentas falsas de estadounidenses.

El contenido anti centros de datos fue rastreado hasta una empresa tecnológica china no nombrada con múltiples contratos con gobiernos regionales chinos, que utilizaron VPNs y prompts en chino simplificado. OpenAI no atribuye la operación directamente al gobierno de Beijing (eso hay que dejarlo claro) pero la infraestructura apunta a actores con vínculos institucionales en China.

Operación 2: La campaña de aranceles

La segunda operación generó comentarios cortos y cómics en inglés, italiano, japonés y chino tradicional que presentaban los aranceles estadounidenses como un control encubierto del panorama tecnológico global. El detalle operativo más revelador: los actores utilizaron ChatGPT para redactar informes de seguridad operativa que detallaban objetivos como "establecer cuentas persistentes y creíbles" y aprovechar las plataformas de Meta para evadir los sistemas de detección.

Los prompts de ChatGPT no se utilizaron solo para generar el contenido de propaganda. Se utilizaron para planificar la operación de propaganda. Para decidir cómo distribuirla sin que te pillen.

Y hay un dato de framing que merece atención: los materiales tenían instrucción explícita de incluir solo al presidente Trump y omitir al presidente chino Xi Jinping. La campaña estaba diseñada para parecer crítica con la política americana sin aparecer como favorable a la posición china. Plausible deniability integrada en el brief.

El impacto real de ambas operaciones fue bajo. La escala de Brookings (que mide el alcance e influencia real de operaciones de este tipo) las sitúa en niveles 1-2 sobre un máximo más alto. No hubo un momento viral, no se documentó un cambio medible en la opinión pública. Pero eso no es necesariamente tranquilizador: puede significar que las operaciones fueron detectadas y bloqueadas antes de escalar, o simplemente que esta vez no funcionaron.

Una red relacionada también atacó directamente a OpenAI difundiendo la afirmación falsa de una violación masiva de datos de usuarios de ChatGPT. Nimmo confirmó que ese breach "nunca ocurrió". La desinformación sobre la propia infraestructura de IA como herramienta para erosionar la confianza en los sistemas que podrían detectarte es, para decirlo sin rodeos, bastante elegante desde un punto de vista operativo.

Por qué estos dos fenómenos son el mismo problema

El análisis Forum AI y las operaciones detectadas por OpenAI parecen fenómenos distintos. Uno habla de lo que los modelos hacen por defecto con su entrenamiento. El otro habla de actores estatales o paraestatales utilizando la herramienta deliberadamente. Pero apuntan al mismo vector de riesgo: los LLMs como infraestructura de amplificación de narrativas.

En el caso pasivo, el modelo entrena con lo que hay en internet. Los medios estatales chinos publican enormes volúmenes de contenido en inglés, bien indexado, con apariencia de periodismo convencional. El modelo no distingue entre el New York Times y el Global Times durante el entrenamiento porque esa distinción requiere contexto institucional que los sistemas de entrenamiento actuales no capturan bien. El resultado es que Xinhua aparece como fuente legítima junto a Reuters.

En el caso activo, actores con recursos y paciencia utilizan el modelo para industrializar la producción de contenido diseñado para parecer orgánico. ChatGPT es eficiente generando comentarios en cuatro idiomas, creando variaciones del mismo mensaje para distintas plataformas, y (según los hallazgos de OpenAI) redactando los manuales operativos de la propia campaña.

La administración Trump lanzó señales en esta dirección con el memorando del 24 de abril de 2026, prometiendo medidas contra empresas chinas que "explotan" modelos de IA estadounidenses. El Comité de Asuntos Exteriores de la Cámara apoyó de forma unánime un proyecto de ley para identificar y sancionar a actores extranjeros que extraigan características técnicas clave de modelos cerrados americanos (aunque ese proyecto solo superó una fase de comité en abril de 2026 y su estatus final no está claro).

El problema es que la línea entre "uso legítimo de un modelo de IA" y "explotación para operaciones de influencia" es difusa por diseño. Kyle Chan, de Brookings, lo resumió bien al hablar de la destilación de modelos: separar el uso no autorizado del uso legítimo es "como buscar agujas en un pajar". Lo mismo aplica a las operaciones de influencia hasta que son lo suficientemente grandes o descuidadas como para dejar rastro.

Si te interesa el contexto más amplio de cómo la destilación de modelos y la doble moral en la industria de IA complica aún más estas fronteras, hay más para leer ahí.

Lo que esto significa para quien despliega estos modelos en producción

La pregunta que debería incomodar a cualquier empresa o administración que haya desplegado estos modelos en producción no es si los chatbots mienten ocasionalmente. Eso ya lo sabemos y está documentado hasta la saciedad.

La pregunta es cuántos usuarios están tomando decisiones reales (financieras, médicas, políticas, de seguridad) basadas en respuestas que citan propaganda estatal sin etiquetarla, que confunden capacidades militares degradadas con capacidades eliminadas, o que dan cifras de incremento de primas de seguro con una confianza de tono que no tiene ninguna justificación en la precisión real del dato.

El modelo no sabe que está haciendo daño. No tiene intención de desinformar. Pero la ausencia de intención no cambia el resultado para quien toma la decisión.

Y para los equipos de seguridad: el hallazgo de OpenAI de que actores externos utilizaron ChatGPT para redactar sus propios manuales de operaciones de influencia es una señal de que la IA generativa en manos de atacantes ya no es un escenario hipotético. Es el present tense del problema.

La IA no tiene ideología. Pero tiene un corpus de entrenamiento. Y ese corpus no es neutral, no fue construido con criterios editoriales sobre la independencia institucional de las fuentes, y nadie está poniendo un filtro entre "esto viene de un medio estatal de un gobierno autoritario" y "esto llega al usuario final con el mismo tono de autoridad que cualquier otra fuente".

Eso no va a arreglarse solo.

Preguntas frecuentes

¿Por qué los chatbots citan medios de propaganda estatal como Xinhua o Global Times?

Porque durante el entrenamiento, los LLMs procesan enormes volúmenes de texto de internet sin una distinción editorial explícita entre medios independientes y medios estatales. Los medios del gobierno chino publican cantidades masivas de contenido en inglés, bien indexado y con formato periodístico convencional. El modelo no aprende a distinguir la independencia institucional de una fuente; aprende patrones lingüísticos y de cita. El resultado es que Xinhua aparece como fuente válida junto a Reuters o AP, sin ningún aviso de conflicto de interés.

¿El bajo impacto de las operaciones chinas detectadas por OpenAI significa que no son un problema real?

No necesariamente. La escala Brookings sitúa esas operaciones en niveles 1-2 de impacto medible, lo que significa que no viralizaron ni produjeron un cambio documentado en la opinión pública. Pero el bajo impacto puede reflejar detección temprana, mala ejecución operativa, o simplemente que esta ronda no funcionó. La infraestructura demostrada (utilizar ChatGPT para redactar manuales operativos de campañas de desinformación) existe independientemente del resultado de estas operaciones específicas.

¿Puedo fiarme de los porcentajes del estudio Forum AI?

Con reservas importantes: sí son útiles como indicador de magnitud. Forum AI no ha publicado el paper técnico completo, no constan las versiones exactas de modelos evaluados ni las condiciones de acceso a internet, y los criterios de sesgo direccional no están definidos públicamente. Eso significa que los números exactos hay que tomarlos como aproximaciones, no como medidas de precisión científica. El patrón general (citación sistemática de medios estatales, errores factuales consistentes, sesgo direccional en miles de respuestas) es lo que resiste el escrutinio, más que el porcentaje decimal concreto.

¿Qué pueden hacer las empresas que ya tienen chatbots de IA desplegados?

El mínimo razonable es implementar filtros de fuentes que etiqueten explícitamente cuando una respuesta cita medios con afiliación estatal a un gobierno extranjero, añadir disclaimers en respuestas sobre política, salud o finanzas que inviten a verificar datos críticos antes de actuar, y auditar periódicamente las respuestas en dominios de alto riesgo. Ninguna de estas medidas elimina el problema de raíz (eso requiere cambios en el entrenamiento y el alineamiento) pero reduce el daño para usuarios que no tienen contexto para evaluar la fiabilidad de la fuente por sí mismos.

Fuentes

  1. Trump administration vows crackdown on Chinese companies 'exploiting' AI models made in USgreenwichtime.com · 2026-04-24
  2. OpenAI: ‘Likely’ Chinese influence operation tried to use ChatGPT to stir debate on data centerscyberscoop.com · 2026-06-10
  3. OpenAI announced it has banned a Chinese-based ChatGPT account that was attempting to manipulate discussions about US tariffs and AI data centers.gigazine.net · 2026-06-11