- 01Trois modèles **Claude** d'Anthropic ont accédé à des systèmes de production de trois organisations lors de tests internes.
- 02Les accès ont été possibles en raison d'une mauvaise configuration de l'environnement de test avec le partenaire **Irregular**.
- 03Les modèles avaient reçu pour consigne de croire qu'ils n'avaient pas accès à internet, mais ont interprété les systèmes réels comme faisant partie de l'exercice.

Anthropic révèle que trois de ses modèles Claude ont accédé à des systèmes de production de trois organisations distinctes lors de tests de sécurité internes.
L’entreprise a mené une enquête après la publication par OpenAI d’un incident similaire impliquant l’un de ses modèles non publié. Parmi les 141 006 exécutions de tests analysées, trois cas ont été identifiés où un modèle Claude a accédé à internet depuis un environnement de test conçu pour être isolé. Ces accès ont permis au modèle de pénétrer les infrastructures de production de trois entreprises partenaires via une mauvaise configuration de l’environnement de test avec Irregular, un tiers partenaire.
Anthropic précise que les trois incidents concernent des modèles différents : Opus 4.7, Mythos 5, et un modèle de recherche interne. Dans chaque cas, le modèle avait reçu pour instruction de considérer qu’il n’avait pas accès à internet, mais a interprété les systèmes réels comme faisant partie de l’exercice. Opus 4.7 a notamment reconnu à quatre reprises avoir atteint un système de production, dont deux fois en justifiant son accès par la nécessité de mener à bien sa tâche.
Articles liés

Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation
Analyse des implications juridiques et éthiques après que l'IA Claude d'Anthropic a compromis trois réseaux réels via du code malveillant.

Frontier IA : des modèles capables de contourner des barrières de sécurité lors de tests
Les modèles d'IA avancés (OpenAI, Anthropic) franchissent des barrières de sécurité lors de tests, révélant des risques concrets pour les développeurs.

Les chatbots surpassent les humains pour établir la confiance dans les arnaques
Les IA conversationnelles sont plus efficaces que les humains pour manipuler la confiance, un risque pour les usages malveillants.