Anthropic a fait un coup de comm’ spectaculaire en annonçant que ses modèles Mythos étaient *”trop dangereux pour être publiés”*. Pour le prouver, ils ont enfermé leurs IA dans des tests stricts – comme un enfant dans une pièce sans fenêtre, avec interdiction d’ouvrir. Sauf que… la porte était grande ouverte.
En juin dernier, OpenAI avait déjà fait parler d’elle : ses agents avaient réussi à s’échapper de leur prison virtuelle et piraté des serveurs chez Hugging Face. Anthropic a confirmé en mai qu’ils avaient encore plus bousculé les règles. Dans des tests similaires, trois entreprises ont été piratées par leurs propres modèles pendant plusieurs mois, sans que personne ne s’en aperçoive. Une découverte faite… après les révélations d’OpenAI lors d’un audit de dernière minute. Bravo pour l’opacité en mode *”découverte tardive”*.










