La frontera dentada de la IA: por qué falla en lo fácil justo después de clavar lo difícil

Los modelos de IA no mejoran de forma ordenada de fácil a difícil. Su perfil de capacidades es una sierra vieja: picos de genialidad y valles donde cae lo que haría un niño de diez años.

10 min de lectura Actualizado el

En este artículo

El colega que habla siete idiomas y no sabe contar

Imagina que contratas a alguien que domina derecho fiscal internacional, escribe en siete idiomas y puede explicarte la teoría de juegos mientras te prepara el café. Le pides que cuente las palabras de una frase corta. Falla. Le pides que sume tres números de dos cifras. Falla. Le preguntas en qué año nació un personaje histórico que él mismo acaba de mencionar dos párrafos antes. Falla.

Eso no es una metáfora exagerada. Es una descripción bastante precisa de cómo se comportan los modelos de lenguaje de frontera en 2025.

El fenómeno tiene nombre: jagged intelligence, o frontera dentada. Lo acuñó Ethan Mollick, investigador de Wharton, para describir algo que cualquiera que use estos modelos en serio acaba notando tarde o temprano: el perfil de capacidades de un LLM no es una curva ordenada que sube de lo fácil a lo difícil. Es como los dientes de una sierra vieja (picos donde el modelo parece un genio y valles abruptos donde cae en cosas que un niño de diez años resolvería sin pensarlo).

Lo importante: esto no es un bug que se va a parchear en la próxima versión. Es una característica estructural de cómo funcionan estos sistemas. Y entenderlo cambia completamente cómo deberías usarlos.

Por qué la dificultad humana y la dificultad para la IA no son la misma cosa

Aquí está el núcleo del problema, y merece que nos detengamos.

Cuando los humanos aprendemos, la dificultad de las tareas sigue una lógica bastante coherente. Contar objetos en una lista es más fácil que redactar un argumento filosófico. Sumar dos números es más fácil que analizar un contrato. Esta jerarquía de dificultad está tan grabada en nuestra intuición que la aplicamos automáticamente a todo lo que parece inteligente.

Con los LLMs, esa intuición te traiciona.

Un modelo de lenguaje no aprende tareas en un orden de dificultad humana. Aprende patrones estadísticos sobre secuencias de texto. Lo que para él resulta "fácil" es lo que aparece con más frecuencia y consistencia en los datos de entrenamiento. Lo que resulta "difícil" es lo que requiere razonamiento fuera de esos patrones, o lo que exige mantener un estado preciso a lo largo de muchos pasos.

Redactar un análisis filosófico coherente sobre el libre albedrío: hay millones de ejemplos en internet. El modelo ha visto ese patrón miles de veces. Lo ejecuta bien.

Contar cuántas veces aparece la letra "r" en una frase de doce palabras: requiere un proceso iterativo, posición a posición, sin atajos estadísticos. El modelo no tiene un contador interno. Tiene que simular el conteo generando tokens, y en ese proceso se pierde.

Para la IA, redactar un argumento complejo y contar objetos en una lista no tienen la diferencia de dificultad que tienen para nosotros.

Esto explica patrones que de otra forma parecen inexplicables: modelos que traducen textos técnicos con precisión quirúrgica pero se confunden con las instrucciones de formato del mismo encargo. Modelos que construyen estructuras argumentativas sólidas pero se equivocan con la fecha que ellos mismos acaban de mencionar. Modelos que generan código funcional de cincuenta líneas pero fallan al nombrar correctamente una variable simple que aparece en el enunciado.

El efecto halo que no ves venir

El problema no es solo que fallen. El problema es cuándo y cómo fallan, y qué hace eso con tu atención.

Cuando lees un texto bien estructurado, con argumentación sólida, transiciones fluidas y tono coherente, tu cerebro activa algo que los psicólogos llaman efecto halo: asumes que el resto también está bien hecho. Funciona perfectamente con personas, porque en humanos la calidad suele ser consistente dentro de un dominio. Si alguien escribe bien, probablemente también revisa bien sus datos.

Con la IA, esa heurística te la juega.

Un modelo puede producir tres párrafos impecables sobre la historia del derecho contractual europeo y, en la cuarta línea, citar mal una fecha o inventarse el nombre de un caso judicial. El texto brillante no avisa del error que viene. De hecho, lo oculta: tu nivel de alerta baja justo cuando debería subir.

Este es el mecanismo real del riesgo. No es que la IA se equivoque (cualquier herramienta se equivoca). Es que se equivoca en el momento en que estás menos preparado para detectarlo, envuelto en la confianza que te ha generado lo que acabas de leer.

Los errores que más daño hacen en producción no son los que aparecen en la parte difícil del encargo. Son los que se cuelan en lo que parecía tan trivial que nadie lo revisó.

El mapa de los valles: dónde caen los modelos en lo "fácil"

No hay un mapa oficial publicado con estadísticas de qué modelos fallan en qué tareas básicas con qué frecuencia. Eso es importante decirlo con claridad: lo que sigue es un patrón observado consistentemente por quienes usan estos sistemas de forma intensiva, no una ley respaldada por un benchmark estandarizado.

Dicho esto, los valles más frecuentes se agrupan en categorías reconocibles:

Aritmética y conteo directo. Sumas simples, contar elementos en una lista, calcular porcentajes básicos. Los modelos no tienen calculadora interna; generan el resultado como si fuera el siguiente token más probable. A veces aciertan. A veces no.

Fechas y cronología. Especialmente cuando hay que calcular intervalos ("¿cuántos años pasaron entre X e Y?") o cuando la fecha aparece mencionada en el propio contexto y hay que recuperarla con precisión. El modelo puede haberla generado él mismo dos párrafos antes y aun así equivocarse al referenciarla.

Nombres propios y términos técnicos exactos. Los LLMs tienden a generar variantes plausibles de nombres poco frecuentes en lugar de reproducirlos con exactitud. Un apellido, el nombre de un producto, una sigla específica: son puntos de fallo frecuentes que pasan desapercibidos en un texto por lo demás correcto.

Instrucciones de formato explícitas. "Responde en exactamente cinco puntos", "no uses más de cien palabras", "el primer elemento debe ser X". Cuanto más compleja es la respuesta de fondo, más probable es que el modelo incumpla la restricción de forma sin aparente relación con el contenido.

Listas cortas y enumeraciones cerradas. Paradójicamente, las listas cortas y definidas generan más errores que las largas y abiertas. En una lista de diez elementos sobre "ventajas del cloud computing", el modelo tiene margen. En "lista los cuatro firmantes del documento que acabo de pegarte", el margen desaparece y el error también es más probable.

Coherencia interna en textos largos. Un dato que aparece en el párrafo dos puede contradecir lo que el modelo genera en el párrafo siete. No porque "mienta": porque la ventana de atención tiene límites y la consistencia no está garantizada.

La trampa del texto pulido: un ejemplo concreto

Para que quede claro cómo funciona esto en la práctica, un escenario habitual.

Le pides a un modelo que redacte un informe de cuatro páginas sobre la situación de un mercado. El resultado es sólido: estructura clara, análisis con matices, conclusiones razonables. Lees las primeras dos páginas y te convences de que el trabajo está bien hecho.

En la página tres hay una tabla con cifras. El modelo ha generado los números con la misma fluidez con que generó los párrafos. Algunos son correctos porque los extrae del contexto que le has dado. Otros son plausibles pero inventados, porque el modelo no tiene acceso a los datos reales y genera lo que estadísticamente "suena bien" para ese tipo de tabla.

En la página cuatro hay una lista de cinco empresas del sector. Tres son reales. Una tiene el nombre ligeramente modificado. La quinta no existe.

El texto es impresionante. El informe es potencialmente inutilizable sin una revisión exhaustiva de exactamente las partes que parecían más mecánicas.

Este no es un caso extremo ni inventado para el ejemplo. Es el patrón que aparece cuando se usan LLMs para generar contenido que mezcla argumentación de alto nivel con datos concretos.

Cómo revisar cuando no puedes revisarlo todo

La respuesta obvia es "revísalo todo". La respuesta práctica es que si tienes que revisar todo con la misma intensidad que lo harías sin IA, la herramienta no te está ahorrando nada.

La solución no es revisar más. Es revisar diferente: redistribuir la atención de forma contraintuitiva.

Revisa más lo que parece fácil que lo que parece difícil.

Cuando un modelo produce un análisis complejo, tu instinto te dice que ahí es donde puede haber errores. Dedicas tiempo a evaluar el razonamiento, la lógica, las conclusiones. Bien. Pero no bajes la guardia en la lista de tres elementos al final del párrafo, en la fecha entre paréntesis, en el nombre propio que aparece una vez, en la suma que "cuadra a primera vista".

Un protocolo concreto que funciona:

Al revisar output de LLM:
1. Identifica todos los datos discretos: fechas, números, nombres propios, siglas
2. Verifica cada uno contra la fuente original o una fuente externa
3. Comprueba que las instrucciones de formato se han cumplido literalmente
4. En listas cerradas, cuenta los elementos tú mismo
5. En textos largos, busca contradicciones entre la primera y la segunda mitad

Esto no elimina la revisión del razonamiento de fondo. La complementa. El razonamiento de fondo es donde el modelo suele ser más fiable; los datos discretos son donde suele fallar más y donde el texto brillante te distrae de mirar.

Lo que esto no es: un argumento contra IA

Conviene ser claro aquí para no caer en el otro extremo.

La frontera dentada no es un argumento para no estos modelos. Es un argumento para usarlos con el modelo mental correcto.

Si contratas a ese experto en siete idiomas y derecho fiscal internacional, no lo mandas a casa porque no sepa contar bien. Cambias el proceso: para los análisis complejos, le dejas trabajar. Para las sumas y los nombres exactos, verificas tú o usas una herramienta diferente. El valor que aporta en lo primero supera con creces el coste de revisar lo segundo.

Con los LLMs es exactamente lo mismo. El error no es usarlos. El error es usarlos como si su perfil de capacidades fuera uniforme, como si la calidad que ves en un párrafo garantizara la calidad del siguiente dato.

La frontera dentada es una característica del sistema, no un defecto transitorio. Los modelos mejoran con cada versión, pero el patrón estructural (que la dificultad para ellos no es la misma que para nosotros) no desaparece. Cambia de forma, se desplaza, pero la sierra sigue siendo una sierra.

La honestidad que falta en la mayoría de guías de IA

Hay algo que casi nadie dice cuando habla de "cómo bien la IA": no existe un mapa publicado y verificado de qué modelos fallan en qué tareas básicas con qué frecuencia. Los benchmarks que existen miden razonamiento, código, matemáticas formales, comprensión lectora. No miden "¿con qué frecuencia este modelo se inventa un nombre propio en un texto de otro modo correcto?" o "¿cuántas veces falla en seguir una instrucción de formato simple cuando el contenido es complejo?".

Eso significa que el conocimiento práctico sobre la frontera dentada viene, por ahora, de la experiencia acumulada de quienes usan estas herramientas de forma intensiva, no de papers con intervalos de confianza.

Lo cual tiene una implicación directa: la única forma de calibrar dónde está la sierra en el modelo que usas para tu caso de uso concreto es probarlo tú, con tus tareas reales, y documentar los fallos. No los fallos en el razonamiento complejo (esos los ves venir). Los fallos en lo que diste por hecho que estaba bien. Algunos modelos pequeños, como VibeThinker-3B, están siendo diseñados específicamente para mejorar en razonamiento paso a paso, lo que en teoría debería reducir algunos de estos valles (aunque la sierra nunca desaparece del todo).

El riesgo real no es que la IA se equivoque. Es que se equivoque donde no estás mirando, justo después de algo que te ha impresionado lo suficiente como para bajar la guardia.

Fuentes

  1. How To Avoid The AI Perfection Trapforbes.com · 2026-06-18
  2. LLMs Will Protect Each Other if Threatened, Study Findsgizmodo.com · 2026-04-02