Grok 4.5 y Kimi K3 contra el listón real: ni un benchmark de juguete
Cinco piezas que cortan el rollo de los títulos vacíos y los números que nadie puede replicar.
El Top
- LABORATORIO Grok 4.5 y Kimi K3 acaban de salir: les pusimos el mismo encargo que a los buques insignia
Dos modelos nuevos, el mismo encargo que ya resolvieron GPT Sol 5.6 y Fable 5. Sin gráficas de marketing, solo resultados crudos de un motor de reservas que hay que escalar de verdad.
- DESMONTAJE Prompt Engineer Certificado: el cosplay más caro de LinkedIn
Badge de fin de semana y título de ingeniero sin una sola línea en GitHub. El mercado ya empieza a distinguir entre el papel y el que realmente sabe hacer que el modelo funcione.
- DESMONTAJE La IA te deja más confiado y más tonto: lo que dice el estudio (y lo que no)
Experimento franco-italiano: más IA, menos «no sé», menos aciertos y el doble de seguridad en las respuestas. El efecto no es teoría, está medido.
- DESMONTAJE Deuda oculta de 1,65 billones en IA: lo que el balance de las Big Tech no te enseña
Nikkei pone cifra a los arrendamientos de centros de datos y contratos de GPU que no aparecen como deuda. El balance miente por omisión, no por error.
- CASO REAL No dependas de un único proveedor de IA: el vendor lock-in ya no es teórico
Cuando todo el negocio cuelga de una API o de unas cuentas de suscripción, no tienes arquitectura: tienes una apuesta. Datos de migración y riesgos concretos.
🔥 El Humómetro
los nuevos modelos de xAI y Alibaba ya superan a los líderes en tareas reales de producción
Por ahora solo han pasado el primer examen; el resto sigue siendo PowerPoint.
Los datos mandan, los títulos no. La próxima trae más pruebas sin filtro.