watch·ia
AccueilActusTutosGlossaireCette semaineTendancesSources
/
ACTUS
4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·

IBM Research lance ScarfBench, un benchmark pour évaluer les agents IA sur la migration Java

mardi 30 juin 202618:322 min de lecture1 source citée
L'essentiel — 3 points
  • 01IBM Research publie ScarfBench, un benchmark pour évaluer les agents IA sur la migration de frameworks Java en entreprise, couvrant 34 applications et 204 tâches de migration.
  • 02Contrairement aux benchmarks classiques, ScarfBench mesure le succès réel : compilation, déploiement et conservation du comportement, pas seulement la similarité du code généré.
  • 03Le benchmark cible les migrations entre Spring, Jakarta EE et Quarkus, trois écosystèmes Java majeurs, pour tester la capacité des agents à gérer les dépendances, configurations et descripteurs.
IBM Research lance ScarfBench, un benchmark pour évaluer les agents IA sur la migration Java

IBM Research propose ScarfBench (Self-Contained Application Refactoring Benchmark), un nouvel outil d'évaluation conçu pour mesurer la capacité des agents IA à moderniser des applications Java d'entreprise en les migrant entre frameworks. Contrairement aux benchmarks logiciels existants qui comparent le code généré à des implémentations de référence, ScarfBench évalue si les applications migrées se compilent réellement, se déploient correctement et conservent leur comportement.

La migration de frameworks Java présente des défis distincts de la génération de code ou de la correction de bugs. Au-delà de la simple traduction syntaxique, elle exige de modifier les systèmes de dépendances, les configurations de persistance, les requêtes et les descripteurs de framework. Une petite erreur dans n'importe lequel de ces éléments peut empêcher le déploiement réussi de l'application. ScarfBench se concentre sur les migrations entre trois écosystèmes Java majeurs : Spring, Jakarta EE et Quarkus.

Le benchmark repose sur 34 applications contenant environ 151 000 lignes de code, générant 204 tâches de migration réparties sur 102 implémentations de frameworks différentes. Les critères d'évaluation sont explicites : une migration réussie doit permettre à l'application de se compiler, de se déployer et de passer les validations comportementales. Cette approche offre une mesure plus réaliste de la qualité de la modernisation que les métriques traditionnelles basées sur la similarité de code.

Cette initiative répond à un besoin concret : la modernisation d'applications d'entreprise est l'une des activités d'ingénierie logicielle les plus coûteuses et les plus complexes que les organisations entreprennent. Les équipes migrent les applications entre frameworks pour améliorer la maintenabilité, la préparation au cloud et la productivité des développeurs. Avec les récents progrès des agents de codage, l'IA-assisted modernization suscite de l'intérêt, mais la question de la fiabilité de ces agents sur des applications réelles restait ouverte.

Réagir :
Partager —XLinkedIn
Sources citées