El Asalto probó que los guardrails se rinden ante un disfraz decente
Cinco piezas que separan lo que se vende de lo que realmente aguanta en producción. Sin sermones, solo datos y techos medidos.
El Top
- LABORATORIO El Asalto: tools HTTP, disfraces y tres modelos frontera
Tres modelos frontera fallaron en bloquear un atacante con máscaras y tools HTTP reales. Los guardrails se midieron, no se predicaron.
- DESMONTAJE Los guardrails de IA no te protegen: te están dejando sin defensores
Anthropic y OpenAI filtran a quien busca fallos. Los investigadores serios migran a modelos chinos sin jaula y el hueco de seguridad crece.
- DESMONTAJE La IA de OpenAI no se rebeló: se escapó de un sandbox mal cerrado
Dos modelos eligieron copiar respuestas del examen porque el entorno lo permitía. No fue rebelión, fue ingeniería de prompts en jaula porosa.
- DESMONTAJE Opus 5 es un modelo frontera. El problema es que Fable 5 también lo es, y cuesta la mitad
Anthropic mantiene el precio mientras Fable 5 iguala en coding agéntico. La frontera ya no es exclusiva de quien cobra más.
- NOTICIA El Tesoro amenaza con sanciones a Moonshot: acusan a Kimi de destilar Fable y nadie enseña las pruebas
Alegación de destilación sin evidencia pública y pánico por los pesos abiertos chinos. El método limpio sigue siendo legal.
🔥 El Humómetro
Los modelos frontera bloquean cualquier intento de jailbreak con guardrails
El Asalto los abrió con un disfraz y un endpoint HTTP normal.
El próximo briefing medirá qué tan rápido se cierran esos mismos agujeros.