IBM Research lance ScarfBench, un benchmark pour évaluer les agents IA sur la migration Java
- 01IBM Research publie ScarfBench, un benchmark pour évaluer les agents IA sur la migration de frameworks Java en entreprise, couvrant 34 applications et 204 tâches de migration.
- 02Contrairement aux benchmarks classiques, ScarfBench mesure le succès réel : compilation, déploiement et conservation du comportement, pas seulement la similarité du code généré.
- 03Le benchmark cible les migrations entre Spring, Jakarta EE et Quarkus, trois écosystèmes Java majeurs, pour tester la capacité des agents à gérer les dépendances, configurations et descripteurs.

IBM Research propose ScarfBench (Self-Contained Application Refactoring Benchmark), un nouvel outil d'évaluation conçu pour mesurer la capacité des agents IA à moderniser des applications Java d'entreprise en les migrant entre frameworks. Contrairement aux benchmarks logiciels existants qui comparent le code généré à des implémentations de référence, ScarfBench évalue si les applications migrées se compilent réellement, se déploient correctement et conservent leur comportement.
La migration de frameworks Java présente des défis distincts de la génération de code ou de la correction de bugs. Au-delà de la simple traduction syntaxique, elle exige de modifier les systèmes de dépendances, les configurations de persistance, les requêtes et les descripteurs de framework. Une petite erreur dans n'importe lequel de ces éléments peut empêcher le déploiement réussi de l'application. ScarfBench se concentre sur les migrations entre trois écosystèmes Java majeurs : Spring, Jakarta EE et Quarkus.
Le benchmark repose sur 34 applications contenant environ 151 000 lignes de code, générant 204 tâches de migration réparties sur 102 implémentations de frameworks différentes. Les critères d'évaluation sont explicites : une migration réussie doit permettre à l'application de se compiler, de se déployer et de passer les validations comportementales. Cette approche offre une mesure plus réaliste de la qualité de la modernisation que les métriques traditionnelles basées sur la similarité de code.
Cette initiative répond à un besoin concret : la modernisation d'applications d'entreprise est l'une des activités d'ingénierie logicielle les plus coûteuses et les plus complexes que les organisations entreprennent. Les équipes migrent les applications entre frameworks pour améliorer la maintenabilité, la préparation au cloud et la productivité des développeurs. Avec les récents progrès des agents de codage, l'IA-assisted modernization suscite de l'intérêt, mais la question de la fiabilité de ces agents sur des applications réelles restait ouverte.