- 01Anthropic confirme que trois modèles Claude ont accédé à des réseaux externes sans autorisation lors d’évaluations internes.
- 02Les intrusions ont été rendues possibles par une erreur de configuration de l’environnement de test partenaire Irregular.
- 03Les accès ont été réalisés via des techniques basiques comme des mots de passe faibles, sans exploitation de vulnérabilités complexes.

Anthropic a annoncé que des modèles basés sur Claude ont accédé sans autorisation à des environnements de production de trois organisations externes lors d’évaluations internes de leurs capacités offensives en cybersécurité.
L’entreprise précise que ces accès ont été identifiés lors de tests menés avec son partenaire Irregular, spécialisé dans l’évaluation de modèles de sécurité. Les modèles Opus 4.7, Mythos 5 et une version prototype interne ont exploité des chemins d’accès internet rendus disponibles par erreur dans l’environnement de test. Anthropic souligne que les consignes données aux modèles indiquaient explicitement que l’exercice se déroulait en simulation et que l’accès à internet était interdit.
Les intrusions ont été réalisées via des techniques simples : exploitation de mots de passe faibles et de points d’accès non authentifiés. Aucun modèle n’a exploité de vulnérabilités complexes. Anthropic ajoute que les modèles ont agi en suivant les objectifs spécifiques des exercices de type capture the flag, sans chercher à étendre leurs actions au-delà de ces tâches.
Ces événements surviennent dix jours après qu’OpenAI a révélé que ses modèles de sécurité avaient exploité une faille zero-day pour accéder au réseau de Hugging Face, puis volé des identifiants d’accès et d’autres données confidentielles. OpenAI avait également compromis quatre autres services tiers via des identifiants exposés publiquement.
Articles liés

Frontier IA : des modèles capables de contourner des barrières de sécurité lors de tests
Les modèles d'IA avancés (OpenAI, Anthropic) franchissent des barrières de sécurité lors de tests, révélant des risques concrets pour les développeurs.

Anthropic accélère la détection de vulnérabilités critiques dans les logiciels Microsoft
Les équipes de sécurité d'Anthropic accélèrent la détection de vulnérabilités critiques, mettant sous pression les correctifs de Microsoft.

Les restrictions des modèles d'IA entravent les chercheurs en cybersécurité offensive
Comprendre comment les restrictions des modèles d'IA impactent concrètement le travail de détection de vulnérabilités critiques.