Cuando la IA se construye a sí misma: los números de Anthropic y lo que no te están contando

Más del 80% del código de Anthropic lo escribe Claude. Eso suena a ciencia ficción. El paper de la propia empresa dice otra cosa: el 8× es un termómetro roto, la autonomía de 16 horas es el dato que duele, y la auto-mejora recursiva todavía no ha llegado.

14 min de lectura

En este artículo

Anthropic ha soltado un dato que parece sacado de una novela de Asimov mal traducida: más del 80% del código que se mergea en su propia base de código ya lo escribe Claude. Antes del preview de Claude Code en febrero de 2025, esa cifra estaba en dígitos bajos. Ahora, en mayo de 2026, es la norma. Y no va sola: las líneas de código mergeadas por ingeniero y día se han disparado hasta 8 veces la media de 2024 en el segundo trimestre de 2026.

La fuente de todo esto es un solo texto de la propia Anthropic, When AI builds itself, en anthropic.com, y eso ya te dice dos cosas. Una: los números son internos, sin auditoría externa. Dos: si vas a tomarte en serio un 8× de “mejora por IA”, más te vale mirar cómo se construyó el baseline y qué coño mide de verdad la métrica. Porque aquí el humo no está en inventar cifras: está en dejar que te las comas sin masticar.

El 8× y el 80%: qué miden y qué no

Empieza por lo concreto. Según los datos internos de Anthropic:

  • Entre 2021 y 2024, las líneas de código mergeadas por ingeniero y día se quedaron planas.
  • En 2025 empezaron a subir.
  • En 2026 la curva se puso vertical: en Q2 2026 llegan a 8× la media de 2024.
  • Eso se traduce, a nivel de organización, en que los ingenieros de Anthropic envían 8 veces más código por trimestre que en el periodo 2021–2025.

Y el otro dato estrella: más del 80% del código mergeado en mayo de 2026 lo ha “escrito” Claude. Antes del preview de Claude Code (febrero 2025), era un porcentaje de un solo dígito bajo.

Hasta aquí el titular. Ahora la trampa que la propia Anthropic pone en el texto y que mucha gente va a saltarse: las líneas de código son una métrica imperfecta de productividad. Ellos mismos avisan de que el 8× probablemente sobreestima la ganancia real.

¿Por qué? Porque un modelo que genera más código no necesariamente genera mejor software. Puede estar escribiendo tests redundantes, wrappers, boilerplate y refactors que un humano no habría metido. Mergear más no es lo mismo que entregar más valor. Es como medir la productividad de un taller de coches por kilos de chapa soldada: suena técnico, suena cuantitativo… y se te va de las manos en cuanto alguien suelda de más.

Por eso el segundo número del mismo paper importa más que el primero. En una encuesta de marzo de 2026 a 130 investigadores de Anthropic, la mediana del impulso de productividad auto-reportado por la IA fue de ~4×. Cuatro veces. No ocho.

Ojo al matiz: es una encuesta, n=130, estimación subjetiva de “output”, con todo el sesgo de selección y de deseo que eso implica. Pero al menos mira al efecto percibido sobre el trabajo real, no al contador de líneas. Si alguien te vende el 8× como si fuera productividad neta, te está vendiendo el termómetro, no la fiebre.

Mi criterio aquí es el de siempre con métricas de “mejora por IA”: antes de creerme un número, pregunto si el baseline lo construyó alguien que quería que el baseline ganara. Si el baseline es un espantapájaros, código manual sin herramientas, sin scripts, sin el nivel de ingeniería que ya tenías en 2024, el 8× es un truco de magia barato. Anthropic al menos avisa. Muchos de los que van a citar este paper no lo harán.

Seamos justos: el dato del 8× no es un invento caprichoso. Viene de un sistema de telemetría interna que Anthropic lleva años afinando, y la empresa tiene incentivos para no mentir descaradamente cuando sus propios inversores y clientes van a pedir auditorías. Además, el paper dedica párrafos enteros a advertir que la métrica sobreestima, algo que un vendedor de humo omitiría. El problema no es que los números sean falsos: es que miden una cosa (volumen de código) y el mercado los lee como si midieran otra (productividad neta). La culpa no es del termómetro, es de quien lo usa para diagnosticar sin mirar al paciente.

Dos puntos de inflexión, no un milagro de la noche a la mañana

La curva no es un “y de repente llegó la AGI”. Anthropic describe dos inflexiones claras en sus datos internos:

  1. 2025: Claude empieza a ejecutar código, no solo a sugerirlo en el chat.
  2. 2026: Claude trabaja de forma autónoma durante horizontes más largos, y eso dobla el ritmo de aceleración.

Esa secuencia encaja con la historia de cómo han ido delegando el desarrollo de la IA a la propia IA:

  • 2021–2023: codificación manual.
  • 2023–2025: chatbots (tú pides, el modelo propone, tú pegas y arreglas).
  • 2025–2026: agentes de codificación (el modelo corre en bucle: escribe, ejecuta, falla, corrige).
  • 2026: agentes autónomos que delegan subtareas a otros agentes.

No es magia. Es un cambio de interfaz y de contrato de trabajo. Pasar de “completa esta función” a “cierra este ticket en un horizonte de horas” no es un salto de inteligencia abstracta: es un salto de agencia operativa. El modelo deja de ser un autocompletado caro y pasa a ser un operario con teclado, terminal y permiso (limitado) para tocar cosas.

Y aquí entra un principio de diseño que en producción salva culos: el LLM planifica y parsea; el código ejecuta y toca la red. Si dejas que el modelo mute estado a lo loco, mergee sin revisión, despliegue sin gates, gire llaves en producción, no tienes un agente: tienes un mono con root. Anthropic habla de ingenieros que dirigen y revisan. El 80% “escrito por Claude” no significa 80% mergeado a ciegas sin humano. Quien te diga eso está inventando el final de la película.

La curva que de verdad debería quitarte el sueño: la autonomía en horas

El dato de productividad es ruidoso. El de cuánto tiempo puede trabajar un modelo solo es más limpio y más incómodo.

Anthropic resume la tendencia que lleva midiendo el ecosistema (con METR y similares): la duración de las tareas que la IA puede completar de forma autónoma se está doblando cada ~4 meses. Antes el ritmo era de unos 7 meses por doblado. La secuencia que citan:

  • Opus 3 (marzo 2024): tareas de unos 4 minutos.
  • Sonnet 3.7: alrededor de 1,5 horas.
  • Opus 4.6: del orden de 12 horas.
  • Claude Mythos Preview: en el benchmark de tareas largas de METR, trabaja de forma autónoma al menos 16 horas, el techo de lo que METR puede medir sin inventar tareas nuevas.

Lee eso otra vez. En dos años pasamos de “resuélveme este bug de cuatro minutos” a “déjame solo un turno de noche entero”. Y el techo del benchmark no implica que 16 horas sea el máximo real: implica que ya no sabemos medirlo con las tareas que tenemos. Cuando el termómetro se queda corto, el problema no es que el paciente no tenga fiebre.

La extrapolación que hace Anthropic del trend, y esto es proyección, no hecho cerrado, es que en 2027 podrían aparecer sistemas capaces de tareas de semanas. Eso no es una promesa de producto ni una fecha de lanzamiento. Es una línea dibujada sobre una curva que se ha vuelto más empinada. Quien la convierta en “en 2027 la IA hace sprints de dos semanas sola y se acabó el empleo” está mintiendo con un PowerPoint. Quien diga “da igual, siempre serán 4 minutos” está mirando al techo de 2024.

Benchmarks saturados: SWE-bench, CORE-Bench y la ilusión de que “ya lo resuelve todo”

Si la autonomía es la curva de tiempo, los benchmarks son la curva de “¿sabe hacer el examen?”. Y los exámenes se están quedando pequeños a una velocidad obscena.

Anthropic señala dos ejemplos que se han saturado (cerca del 100% de éxito en lo que miden):

  • SWE-bench, el test de ingeniería de software del mundo real: de aciertos en dígitos bajos a saturación (~100%) en dos años.
  • CORE-Bench, que mide si la IA puede reproducir investigación existente: de ~20% de éxito en 2024 a saturación en 15 meses. Lo presentan como precursor de algo más gordo: si ya puedes reproducir papers a escala, el siguiente escalón es hacer investigación original.

Aquí hay que ser cabrones con el matiz, porque los benchmarks de IA son papel mojado si los lees como si fueran productividad en producción. Saturar SWE-bench no significa que Claude te monte el backend de tu empresa con el backlog de Jira y cero supervisión. Significa que, en el subconjunto de problemas que ese benchmark define, los modelos han llegado al techo. Cuando un benchmark se satura, deja de discriminar. Deja de ser útil para saber quién va delante. Y, sobre todo, no mide juicio de negocio, arquitectura a largo plazo ni “qué problema merecía la pena resolver”.

Anthropic es explícita en el hueco que queda:

Claude ya puede igualar o superar a humanos hábiles ejecutando experimentos bien especificados. Los huecos grandes siguen estando en ejercer juicio para elegir objetivos de investigación y de ingeniería.

Eso no es una nota al pie. Es la diferencia entre un técnico brutal y un jefe de laboratorio. El modelo cierra tickets bien definidos. Todavía se le atraganta decidir qué tickets deberían existir. Si confundes las dos cosas, acabas con una organización que produce 8× más código en la dirección equivocada.

“AI builds itself”: lo que ya es real y lo que sigue siendo ciencia ficción

El título del texto de Anthropic empuja al click: When AI builds itself. La tentación es saltar a la auto-mejora recursiva plena, la IA diseña a su sucesor sin humanos en el bucle, . Anthropic dice, sin ambigüedad, que eso todavía no se ha conseguido y que no es inevitable. A la vez avisa de que podría llegar antes de lo que las instituciones esperan, y que eso amplifica riesgos de control.

Hay que separar tres capas que la gente mezcla en un batido:

  1. IA que escribe el código de la empresa que hace IA (el 80%, los agentes de 2025–2026). Esto ya está pasando en Anthropic, según sus propios datos.
  2. IA que acelera la I+D de IA (más experimentos, más iteraciones, más código de entrenamiento, evaluación y tooling por unidad de tiempo humano). El 4× auto-reportado y la curva de autonomía apuntan a que el bucle parcial ya gira.
  3. Auto-mejora recursiva plena (el sistema diseña y entrena a su sucesor de forma autónoma, con feedback cerrado). No está lograda. Presentarla como hecho consumado es mentira.

La capa 2 es la que debería interesarte si montas producto o regulas. No hace falta que la IA “despierte” para que el ritmo de cambio se te vaya de las manos. Basta con que cada generación de modelos acorte el tiempo de construir la siguiente en un factor medible. Eso es aceleración de I+D, no singularidad de salón.

Si quieres el desmontaje del mito de la rebelión y el problema real del control cuando ya no sabes apagar el bucle, ya lo cubrimos al hilo de la auto-mejora recursiva. Aquí el punto es más seco: Anthropic está documentando su propio acelerador y, al mismo tiempo, diciendo en voz alta que el riesgo de control crece si el bucle se cierra del todo.

Qué implica esto si no trabajas en Anthropic

Primera lectura errónea: “entonces mi equipo también va a x8 mañana con un copiloto”. No. Anthropic lleva años construyendo el stack de agentes, el acceso a modelos frontera, el corpus de código interno y la cultura de revisión. El 80% no es un prompt mágico. Es infraestructura + proceso + modelo + humanos que siguen dirigiendo.

Segunda lectura errónea: “si el 80% lo escribe la IA, el ingeniero sobra”. Al revés: el cuello de botella se mueve. De teclear a especificar, descomponer, revisar, definir criterios de aceptación y decidir qué no se construye. El human-in-the-loop que solo mira y dice “ok” se convierte en placebo; el que diseña el contrato de lo que el agente puede tocar sigue siendo el trabajo caro. Eso encaja con lo que ya se ve fuera: el human-in-the-loop no se ha vuelto obsoleto, se ha vuelto un placebo cuando no hay supervisión de verdad.

Tercera lectura, la operativa: si vas a meter agentes de código en tu flujo, diseña primero la máquina de estados, transiciones legales, auditoría, qué puede mergear, qué requiere humano, y después coloca al LLM. El modelo propone; el motor valida. El LLM no debería mutar estado a lo bestia. Esa arquitectura híbrida (determinista + LLM) no es romanticismo de ingeniería: es la diferencia entre un 4× útil y un incidente de seguridad con commits firmados por un bot.

Cuarta lectura, la de métricas: si tu jefe llega el lunes con el paper de Anthropic y un objetivo de “x8 líneas”, dale el 4× de la encuesta y la frase de la propia empresa sobre que las líneas de código sobreestiman. Mide entregas, defectos escapados, tiempo de ciclo y capacidad de mantener el sistema. No midas chatarra mergeada.

La trampa de la fuente única (y por qué aun así importa)

Casi todo lo anterior cuelga de un solo documento de Anthropic. No hay auditoría independiente pública de esas cifras de productividad. No está definido con precisión quirúrgica qué cuenta exactamente como “línea mergeada” ni cómo se filtra el código auto-generado basura. La encuesta de 130 personas puede estar sesgada. Las fechas exactas de saturación de cada versión de SWE-bench y CORE-Bench no vienen desglosadas aquí con milímetros. El techo de 16 horas de METR es un techo de medición, no un techo de capacidad.

Eso no invalida el texto. Lo califica. Cuando la empresa que vende el acelerante publica el cronómetro de su propia carrera, haces tres cosas: lees los números, lees las advertencias que ellos mismos meten (el 8× sobreestima; el RSI pleno no está; el juicio de objetivos sigue siendo humano) y te niegas a convertir una proyección de 2027 en profecía.

El valor del paper no es “Anthropic ha inventado la auto-mejora recursiva”. El valor es más incómodo: una de las labs frontera está diciendo, con datos internos, que el bucle de IA-escribiendo-IA ya mueve la aguja de su I+D, que la autonomía se mide en turnos de trabajo y que el riesgo de control no espera a que salga un titular de AGI.

Si trabajas con agentes de código, asume que el suelo se mueve cada pocos meses, no cada pocos años. Si diseñas gobernanza, asume que las métricas de productividad van a llegar antes que los marcos para auditarlas. Si eres ingeniero, deja de competir con el modelo a teclear y empieza a competir en criterio: qué construir, qué no, y cómo demostrar que lo que el agente produjo no es basura elegante.

El 80% del código lo puede escribir Claude. El 100% de la responsabilidad de lo que se mergea sigue firmado por humanos. Cuando eso deje de ser cierto, el paper de Anthropic se leerá como un aviso temprano, no como un caso de éxito de productividad.

Preguntas frecuentes

¿Es cierto que más del 80% del código de Anthropic lo escribe Claude?

Sí, según datos internos de Anthropic a mayo de 2026: más del 80% del código mergeado en su codebase fue autoría de Claude. Antes del preview de Claude Code en febrero de 2025, esa cifra estaba en dígitos bajos. El dato no implica que ese código se mergee sin dirección ni revisión humana: el propio relato de Anthropic habla de ingenieros que dirigen y revisan el trabajo de los agentes.

¿El aumento de 8× en líneas de código significa que los ingenieros son 8 veces más productivos?

No. Anthropic advierte de que las líneas de código son una métrica imperfecta y que el 8× probablemente sobreestima la ganancia real. Una encuesta de marzo de 2026 a 130 empleados situó la mediana del impulso de productividad auto-reportado en torno a 4×. Más código mergeado no equivale automáticamente a más valor entregado.

¿Ha logrado la IA la auto-mejora recursiva plena?

No. Anthropic afirma que la auto-mejora recursiva plena, que la IA diseñe de forma autónoma a su propio sucesor, aún no se ha conseguido y no es inevitable. Lo que sí documentan es un bucle parcial: agentes que escriben gran parte del código de la lab y aceleran la I+D, con riesgos de control que podrían materializarse antes de lo que esperan las instituciones.

¿Cuánto tiempo puede trabajar Claude de forma autónoma en una tarea?

En el benchmark de tareas largas de METR, Claude Mythos Preview trabajó de forma autónoma al menos 16 horas, el límite superior de lo que METR mide sin nuevas tareas. La tendencia general que cita Anthropic es que la duración de tareas autónomas se dobla cada ~4 meses: de unos 4 minutos con Opus 3 (marzo 2024) a alrededor de 1,5 horas con Sonnet 3.7 y unas 12 horas con Opus 4.6.

Fuentes

  1. When AI builds itselfanthropic.com