watch·ia
AccueilActusTutosGlossaireCette semaineTendancesSources
/
ACTUS
1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·

IBM Research lance ScarfBench, un benchmark pour évaluer les agents IA sur la migration Java

mardi 30 juin 202618:322 min de lecture1 source citée
L'essentiel — 3 points
  • 01IBM Research publie ScarfBench, un benchmark pour évaluer les agents IA sur la migration de frameworks Java en entreprise, couvrant 34 applications et 204 tâches de migration.
  • 02Contrairement aux benchmarks classiques, ScarfBench mesure le succès réel : compilation, déploiement et conservation du comportement, pas seulement la similarité du code généré.
  • 03Le benchmark cible les migrations entre Spring, Jakarta EE et Quarkus, trois écosystèmes Java majeurs, pour tester la capacité des agents à gérer les dépendances, configurations et descripteurs.
IBM Research lance ScarfBench, un benchmark pour évaluer les agents IA sur la migration Java

IBM Research propose ScarfBench (Self-Contained Application Refactoring Benchmark), un nouvel outil d'évaluation conçu pour mesurer la capacité des agents IA à moderniser des applications Java d'entreprise en les migrant entre frameworks. Contrairement aux benchmarks logiciels existants qui comparent le code généré à des implémentations de référence, ScarfBench évalue si les applications migrées se compilent réellement, se déploient correctement et conservent leur comportement.

La migration de frameworks Java présente des défis distincts de la génération de code ou de la correction de bugs. Au-delà de la simple traduction syntaxique, elle exige de modifier les systèmes de dépendances, les configurations de persistance, les requêtes et les descripteurs de framework. Une petite erreur dans n'importe lequel de ces éléments peut empêcher le déploiement réussi de l'application. ScarfBench se concentre sur les migrations entre trois écosystèmes Java majeurs : Spring, Jakarta EE et Quarkus.

Le benchmark repose sur 34 applications contenant environ 151 000 lignes de code, générant 204 tâches de migration réparties sur 102 implémentations de frameworks différentes. Les critères d'évaluation sont explicites : une migration réussie doit permettre à l'application de se compiler, de se déployer et de passer les validations comportementales. Cette approche offre une mesure plus réaliste de la qualité de la modernisation que les métriques traditionnelles basées sur la similarité de code.

Cette initiative répond à un besoin concret : la modernisation d'applications d'entreprise est l'une des activités d'ingénierie logicielle les plus coûteuses et les plus complexes que les organisations entreprennent. Les équipes migrent les applications entre frameworks pour améliorer la maintenabilité, la préparation au cloud et la productivité des développeurs. Avec les récents progrès des agents de codage, l'IA-assisted modernization suscite de l'intérêt, mais la question de la fiabilité de ces agents sur des applications réelles restait ouverte.

Réagir :
Partager —XLinkedIn
Sources citées