- 01MirrorCode, un benchmark d'Epoch et METR, teste la capacité des IA à reproduire des programmes logiciels complexes via CLI sans accès au code source ni à internet.
- 02Claude Opus 4.7 et GPT-5.5 réussissent à recréer certains programmes, mais échouent sur 8 des 25 cibles à 100 % et 4 à 99 %.
- 03Import AI signale aussi une faille de sécurité accidentelle chez OpenAI, soulignant les risques liés à l'usage non encadré de l'IA dans des environnements critiques.

Import AI publie son numéro 466, qui analyse deux sujets distincts : les progrès et les limites persistantes de l'IA dans la programmation longue durée, ainsi qu'une faille de sécurité accidentelle découverte chez OpenAI.
Le bulletin met en avant MirrorCode, un benchmark conçu par Epoch et METR pour évaluer la capacité des modèles d'IA à reproduire des programmes logiciels complexes à partir d'un accès en ligne de commande (CLI). Ce test mesure leur aptitude à recréer intégralement un programme sans accès à son code source ni à internet, en s'appuyant uniquement sur des interactions via le terminal. Parmi les programmes cibles figurent des outils comme pkl (Apple), gotree (manipulation d'arbres phylogénétiques) ou qsv_select (sélection de colonnes CSV), couvrant entre 16 000 et 87 000 lignes de code. Les résultats montrent que des modèles comme Claude Opus 4.7 ou GPT-5.5 parviennent à reproduire certains de ces programmes, parfois en quelques heures et pour un coût d'inférence de quelques centaines de dollars. Cependant, d'autres programmes restent hors de portée : 8 des 25 cibles n'ont jamais été résolus à 100 %, et 4 autres n'ont jamais atteint 99 %. Les tâches les plus difficiles incluent un linter Python (ruff) et des bibliothèques mathématiques ou d'authentification email.
Import AI souligne que ces avancées révèlent une capacité croissante des modèles à s'orienter dans des environnements logiciels inconnus, mais rappellent aussi que les limites actuelles persistent, notamment pour les programmes les plus complexes ou spécialisés. Le benchmark, désormais publié avec 22 des 25 programmes cibles, est présenté comme un outil pour évaluer l'évolution des capacités d'autonomie des IA dans des tâches de longue haleine.
Par ailleurs, le numéro 466 évoque une faille de sécurité accidentelle identifiée chez OpenAI. Bien que les détails techniques ne soient pas divulgués dans la source, l'incident illustre les risques liés à l'intégration croissante de l'IA dans des systèmes critiques ou interconnectés. L'analyse suggère que de telles vulnérabilités pourraient émerger lors de l'utilisation non supervisée de modèles dans des environnements réels, sans garde-fous adaptés.
Articles liés

OpenAI expérimente une technique de raisonnement à récurrence opaque avec Astra
Décryptage de la nouvelle méthode de raisonnement d'OpenAI, ses implications pour la sécurité des IA et les débats qu'elle suscite.

OpenAI suspend le développement d’Astra après une faille de sécurité majeure
Pourquoi OpenAI a-t-il retardé le développement de son modèle Astra, et quels risques cela révèle-t-il sur la sécurité des IA non déployées ?

Cent entreprises dont OpenAI et Google demandent des mesures contre les IA malveillantes
Décryptage des initiatives sectorielles pour limiter les risques d'IA malveillante et des exemples concrets d'incidents passés.