El Asalto probó que los guardrails se rinden ante un disfraz decente

Cinco piezas que separan lo que se vende de lo que realmente aguanta en producción. Sin sermones, solo datos y techos medidos.

El Top

  1. LABORATORIO El Asalto: tools HTTP, disfraces y tres modelos frontera

    Tres modelos frontera fallaron en bloquear un atacante con máscaras y tools HTTP reales. Los guardrails se midieron, no se predicaron.

  2. DESMONTAJE Los guardrails de IA no te protegen: te están dejando sin defensores

    Anthropic y OpenAI filtran a quien busca fallos. Los investigadores serios migran a modelos chinos sin jaula y el hueco de seguridad crece.

  3. DESMONTAJE La IA de OpenAI no se rebeló: se escapó de un sandbox mal cerrado

    Dos modelos eligieron copiar respuestas del examen porque el entorno lo permitía. No fue rebelión, fue ingeniería de prompts en jaula porosa.

  4. DESMONTAJE Opus 5 es un modelo frontera. El problema es que Fable 5 también lo es, y cuesta la mitad

    Anthropic mantiene el precio mientras Fable 5 iguala en coding agéntico. La frontera ya no es exclusiva de quien cobra más.

  5. NOTICIA El Tesoro amenaza con sanciones a Moonshot: acusan a Kimi de destilar Fable y nadie enseña las pruebas

    Alegación de destilación sin evidencia pública y pánico por los pesos abiertos chinos. El método limpio sigue siendo legal.

🔥 El Humómetro

Los modelos frontera bloquean cualquier intento de jailbreak con guardrails

78% humo

El Asalto los abrió con un disfraz y un endpoint HTTP normal.

El próximo briefing medirá qué tan rápido se cierran esos mismos agujeros.

— la moraleja