Anthropic démontre l’auto-amélioration contrôlée d’une IA par un système automatisé
- 01Un système automatisé d’Anthropic améliore des comportements ciblés d’une IA sans dégrader ses performances globales.
- 02Les méthodes proposées par l’AAR surpassent celles des chercheurs humains en six heures, pour un coût 37 fois inférieur.
- 03L’efficacité du système dépend de la qualité des benchmarks et de la littérature utilisée, sans quoi le risque de désalignement persiste.

Un chercheur d’Anthropic montre qu’un système automatisé peut améliorer des comportements ciblés d’une IA sans altérer ses performances globales.
Dans un article publié le 28 août 2026, Chen Yueh-Han, fellow chez Anthropic, détaille dans Automated Researchers Can Reliably Mitigate Alignment Failures le fonctionnement d’un système d’auto-amélioration contrôlée pour les modèles d’IA. L’approche repose sur un Automated Alignment Researcher (AAR) qui, à partir de 10 benchmarks de comportements désalignés, propose et teste des méthodes d’amélioration en 30 minutes par itération. Chaque méthode est évaluée, les plus efficaces sont conservées, les autres écartées, permettant une progression rapide et scalable.
Les résultats indiquent une amélioration systématique sur l’ensemble des benchmarks sans dégradation des performances globales du modèle. Selon l’étude, les méthodes générées par l’AAR surpassent en moyenne celles proposées par des chercheurs humains expérimentés, avec un coût opérationnel estimé à 4 dollars par heure contre 150 dollars par heure pour un chercheur humain. Le système s’appuie sur une revue automatisée de la littérature existante pour proposer des ajustements, mimant ainsi le processus traditionnel de recherche.
L’étude souligne cependant des limites majeures. L’efficacité de l’AAR dépend de la pertinence des benchmarks utilisés pour évaluer l’alignement, qui doivent refléter fidèlement les objectifs visés. De plus, la maintenance et l’enrichissement des benchmarks, ainsi que des corpus de littérature, restent des défis non résolus. Sans ces garde-fous, le système pourrait optimiser des critères mal définis, au détriment d’autres aspects du modèle.
Articles liés

Sony Music et Warner Chappell attaquent Anthropic pour violation de droits d'auteur
Les majors musicales attaquent Anthropic pour l'utilisation présumée de leurs œuvres protégées dans les entraînements de modèles d'IA.

Un juge fédéral annule le blacklistage d'Anthropic par l'administration Trump
Les entreprises tech doivent comprendre les limites légales des décisions politiques sur l'accès aux infrastructures IA.

Un tribunal américain invalide la désignation d'Anthropic comme risque pour la chaîne d'approvisionnement du Pentagone
Conséquences pour les partenariats publics-privés dans l'IA et la régulation des fournisseurs.