Grok 4.5 y Kimi K3 contra el listón real: ni un benchmark de juguete

Cinco piezas que cortan el rollo de los títulos vacíos y los números que nadie puede replicar.

El Top

  1. LABORATORIO Grok 4.5 y Kimi K3 acaban de salir: les pusimos el mismo encargo que a los buques insignia

    Dos modelos nuevos, el mismo encargo que ya resolvieron GPT Sol 5.6 y Fable 5. Sin gráficas de marketing, solo resultados crudos de un motor de reservas que hay que escalar de verdad.

  2. DESMONTAJE Prompt Engineer Certificado: el cosplay más caro de LinkedIn

    Badge de fin de semana y título de ingeniero sin una sola línea en GitHub. El mercado ya empieza a distinguir entre el papel y el que realmente sabe hacer que el modelo funcione.

  3. DESMONTAJE La IA te deja más confiado y más tonto: lo que dice el estudio (y lo que no)

    Experimento franco-italiano: más IA, menos «no sé», menos aciertos y el doble de seguridad en las respuestas. El efecto no es teoría, está medido.

  4. DESMONTAJE Deuda oculta de 1,65 billones en IA: lo que el balance de las Big Tech no te enseña

    Nikkei pone cifra a los arrendamientos de centros de datos y contratos de GPU que no aparecen como deuda. El balance miente por omisión, no por error.

  5. CASO REAL No dependas de un único proveedor de IA: el vendor lock-in ya no es teórico

    Cuando todo el negocio cuelga de una API o de unas cuentas de suscripción, no tienes arquitectura: tienes una apuesta. Datos de migración y riesgos concretos.

🔥 El Humómetro

los nuevos modelos de xAI y Alibaba ya superan a los líderes en tareas reales de producción

55% humo

Por ahora solo han pasado el primer examen; el resto sigue siendo PowerPoint.

Los datos mandan, los títulos no. La próxima trae más pruebas sin filtro.

— la moraleja