Ornith-1.5 empata a Opus 4.8 en agentes y deja la auto-mejora en caja negra
Según ornith.ai, el 397B iguala a Claude Opus 4.8 en Terminal-Bench 2.1 y DeepSWE. El bucle de RL está bien pensado. La evidencia pública, no tanto.
En este artículo
El Cuñado no se ha leído la ficha. Ha visto "self-improvement" y 86.1, y ha cerrado el círculo.
El Cuñado dice: "Ornith-1.5 se auto-mejora de extremo a extremo y ya está al nivel de Claude Opus. Se acabó el lab: el modelo se entrena solo y Anthropic puede ir haciendo las maletas."
La realidad es: En ornith.ai, Ornith-1.5-397B obtiene 86.1 en Terminal-Bench 2.1 y 56.0 en DeepSWE, frente a 85.0 y 59.0 de Claude Opus 4.8. Empate en dos benches agénticos. El bucle existe, tres etapas, recompensa explícita, validez como puerta dura, y extiende el auto-andamiaje de Ornith-1.0. Lo que no consta en las fuentes consultadas es una verificación independiente de esos números, una auditoría externa del loop, ni resultados en MMLU o HumanEval.
Por qué importa saberlo: Te estás jugando el diagnóstico. Un hito de modelos que se mejoran solos no es lo mismo que una tabla publicada por quien firma el modelo. El primero te cambia el mapa. El segundo te pide que copies el examen.
Lo que hay en la ficha, sin el eslogan
Ornith-1.5 se presenta en ornith.ai como un paso hacia modelos fundacionales construidos mediante auto-mejora de extremo a extremo. Tres escalas: 397B MoE, 35B MoE y 9B Dense. MoE, Mixture of Experts, es el truco de no encender a toda la plantilla: en cada token trabajan unos especialistas, no el bicho entero. El 35B activa solo 3B parámetros por token.
Con esa dieta, el 35B supera a Qwen 3.6-35B en todos los benches de codificación y agénticos que ellos publican, y deja atrás a Gemma 4-31B y a Meta Muse Glimmer-30B en codificación agéntica. El 9B Dense marca 47.0 en Terminal-Bench 2.1 y 70.6 en SWE-Bench Verified, igualando o superando a Gemma 4-31B y Qwen 3.6-35B, que son más grandes. Existe Ornith-1.5-9B-Mobile, una versión cuantizada que, según la misma ficha, puede desplegarse en iPhone y Android.
Las fuentes consultadas no recogen licencia, ni si los pesos se descargan con libertad o se sirven con acceso restringido, ni términos comerciales. Quien te lo venda como open-source o como pack listo para facturar está improvisando.
El tono nos suena. Con Qwen3.8-27B el frontier estaba en el bench y el atasco, en el reloj. Con GLM-5.3 la paliza era, sobre todo, un relato de post-entrenamiento sobre la misma base. Ornith no está en el banquillo por eso. La ficha se lee como ficha, no como profecía.
Opus 4.8 como faro, un solo marcador
Los números del 397B no son un empate de cortesía. 86.1 contra 85.0 en Terminal-Bench 2.1; 56.0 contra 59.0 en DeepSWE. Un punto arriba en terminal, tres abajo en DeepSWE. Contra GLM-5.2 (82.7 y 46.2) y DeepSeek-V4-Flash-0731 (82.7 y 54.4) queda por encima en los dos. Si esos benches son honestos, un modelo salido de un loop de auto-mejora sentado en la mesa de Opus 4.8 sería un hito. El "si" no es cobardía. Es el tamaño de la afirmación.
Anthropic, en su anuncio de Claude Sonnet 5, vende otra ruta al mismo faro: el Sonnet más agéntico hasta la fecha, capaz de planear, usar herramientas y ejecutar con autonomía, con rendimiento cercano a Opus 4.8 y precio de 2 dólares por millón de tokens de entrada y 10 por millón de salida. Las dos casas miden el listón en Opus y en tareas agénticas. Ahí coinciden. En el cuento, no: Ornith vende el modelo que se mejora solo; Anthropic, un Sonnet más barato que casi llega. Las fuentes no cruzan Ornith-1.5 con Sonnet 5 en la misma tabla. Ese combate no está jugado.
Tampoco consta en las fuentes consultadas la metodología exacta de Terminal-Bench 2.1 ni de DeepSWE. Sin protocolo de evaluación en lo consultado, un 86.1 es un marcador con membrete. El checklist anti-hype para evaluar un modelo empieza por una pregunta grosera: quién puntúa, con qué tareas, y si tú puedes repetirlo. Aquí el que puntúa y el que anuncia son el mismo.
Si el 9B de verdad sostiene un 70.6 en SWE-Bench Verified frente a modelos más gordos, ese es el dato que le importa a quien no va a alquilar un cluster. Sigue saliendo de una sola ficha.
Un loop que premia lo difícil y lo nuevo
El bucle de Ornith-1.5 tiene tres etapas, generación de tareas, construcción de andamiaje y generación de soluciones, optimizadas juntas con aprendizaje por refuerzo. La recompensa de la tarea no se suma: se multiplica.
R(q,s) = V(q,s) × dificultad_de_frontera × novedad
si V(q,s) = 0 → R = 0Validez es puerta dura. Si V(q,s)=0, cobras cero. Como el bouncer del after: sin sello, no entras, y no hay negociación. Multiplicar en vez de sumar mata el truco de farmar novedad sobre basura inválida. La dificultad de frontera se estima con la tasa de éxito empírica de los rollouts del propio modelo, las tiradas contra la tarea, con objetivo p*=0.2. Ni chinchita ni muro: bastante jodido para que no sea recitar, bastante asequible para que existan trayectorias ganadoras. La novedad es 1 menos la máxima similitud con tareas ya generadas o entrenadas. Menos copiarse los deberes.
El andamiaje tiene otra cuenta: alineación con la tarea × fidelidad de recompensa × resistencia al hackeo de recompensas. Lo de resistir el hackeo no es adorno. En RL, el modelo aprende a cobrar el bonus sin hacer el trabajo; es el atajo clásico. Meterlo en la fórmula es de gente que se ha quemado antes.
Hay que conceder el contrapunto, porque el diseño no es un PowerPoint. Puerta dura, frontera calibrada, penalización por redundancia: son piezas contra el colapso de recompensa, ese momento en que el sistema encuentra un truco y se queda dando vueltas a su propio medidor. Si los benches aguantan, el 397B al nivel de Opus 4.8 es el mejor argumento de que el self-improvement puede producir modelos competitivos.
El asterisco es otro. El loop premia validez, rareza y dificultad para el propio modelo. La frontera p*=0.2 no es la frontera del mundo: es el punto en el que él acierta una de cada cinco. El generador de tareas y el resolutor se entrenan juntos, así que el sistema puede volverse excelente fabricando problemas a la medida de su umbral y resolviéndolos con el andamiaje que él mismo se construye. Novedad y dificultad no equivalen a utilidad. Nadie cobra un ticket cerrado porque la tarea se pareciera poco a las anteriores.
Un loop que se pone deberes a p*=0.2 puede acabar campeón de sus deberes. Eso todavía no te ha ahorrado una tarde.
No hay que llamar fraude al self-improvement para no tragar el relato entero. "De extremo a extremo" suena a sistema que se basta. Lo publicado es una receta de recompensas y una tabla. Caja negra con fórmula elegante: los números no son verificables de forma independiente en las fuentes consultadas, y nada en esa fórmula garantiza habilidades generales frente a optimizar el propio marcador.
En evals pequeños, smevals, sin leaderboard de escaparate, se ve si el modelo aguanta al cambiar el enunciado, el repo o la herramienta. De Ornith-1.5 no hay, en las fuentes consultadas, esa pasada. Hay Terminal-Bench 2.1, DeepSWE y SWE-Bench Verified, firmados por la misma casa.
Si un lab que no sea el suyo replica el 86.1 y el 56.0, el hito se sostiene y el loop merece el respeto que pide. Hasta entonces, Ornith-1.5 es un candidato serio en agentes... y un relato de auto-mejora que todavía no ha pasado por caja.
Preguntas frecuentes
¿Ornith-1.5 supera a Claude Opus 4.8?
Según ornith.ai, Ornith-1.5-397B obtiene 86.1 en Terminal-Bench 2.1 y 56.0 en DeepSWE, frente a 85.0 y 59.0 de Claude Opus 4.8. Gana por un punto en terminal y pierde por tres en DeepSWE: un empate en dos benches agénticos, no una victoria global. Las fuentes consultadas no recogen otras pruebas ni una verificación independiente de esas cifras.
¿Cómo funciona el self-improvement de Ornith-1.5?
El bucle tiene tres etapas, generación de tareas, andamiaje y soluciones, entrenadas juntas con aprendizaje por refuerzo, según ornith.ai. La recompensa de tarea es el producto de validez, dificultad de frontera (objetivo p*=0.2) y novedad; si V(q,s)=0, la recompensa es 0. El andamiaje se premia por alineación, fidelidad y resistencia al hackeo. No consta en las fuentes consultadas una auditoría externa de ese loop.
¿Se han verificado de forma independiente los benchmarks de Ornith-1.5?
No consta en las fuentes consultadas que Terminal-Bench 2.1, DeepSWE o SWE-Bench Verified hayan sido replicados por un tercero. Tampoco recogen la metodología exacta de esos tests. Los 86.1, 56.0, 47.0 y 70.6 que circulan salen de la ficha de ornith.ai. En lo consultado, son el marcador de la casa.
¿Ornith-1.5 se puede usar en el móvil?
Sí: ornith.ai describe Ornith-1.5-9B-Mobile, una versión cuantizada del 9B Dense que puede desplegarse en iPhone y Android. El 9B marca 47.0 en Terminal-Bench 2.1 y 70.6 en SWE-Bench Verified. Las fuentes consultadas no recogen licencia, precios ni si el despliegue es libre o restringido. Hay tres escalas en total: 397B MoE, 35B MoE y 9B Dense.