Ornith-1.5 empata a Opus 4.8 en agentes y deja la auto-mejora en caja negra
Según ornith.ai, el 397B iguala a Claude Opus 4.8 en Terminal-Bench 2.1 y DeepSWE. El bucle de RL está bien pensado. La evidencia pública, no tanto.
Según ornith.ai, el 397B iguala a Claude Opus 4.8 en Terminal-Bench 2.1 y DeepSWE. El bucle de RL está bien pensado. La evidencia pública, no tanto.
Cursor despliega Origin a usuarios de pago con pull requests dentro del editor. GitHub sigue como fuente de verdad. El juego es el hábito, no el almacén.
Los estados acusan a Meta de diseñar Instagram para enganchar a menores y de mentir sobre su seguridad. Lo que piden no es solo una factura: es rediseñar el scroll, las notificaciones y el ranking que sostienen el tiempo de uso.
El 27B de Alibaba corre agentes de código en un portátil y puntúa 52 frente a Opus. En nueve tareas reales fue unas 30 veces más lento que DeepSeek V4 Flash.
Más piezas
El briefing de IA para los que ya están hasta los huevos del hype. Cada 3 días y sin mierdas de spam: dato por delante, gurús a tomar por culo y cero relleno.
¿Primero quieres verla? Lee la última edición.