watch·ia
AccueilActusTutosGlossaireCette semaineTendancesSources
/
ACTUS
1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·

Google actualise Android Bench avec huit nouveaux modèles d'IA, mais Gemini recule au classement

mercredi 8 juillet 202616:392 min de lecture1 source citée
L'essentiel — 3 points
  • 01Google a étendu Android Bench avec huit nouveaux modèles et des métriques additionnelles (coût, efficacité) pour évaluer les LLM sur 100 tâches de développement Android.
  • 02Claude Fable 5 domine le classement avec 84,5 % de précision, tandis que Gemini 3.1 Pro recule à la cinquième place malgré un coût d'exécution plus modéré.
  • 03Les modèles les plus performants (Fable 5, GPT 5.5) consomment plus de 130 dollars en tokens par benchmark, soulevant une tension entre précision et coût opérationnel.
Google actualise Android Bench avec huit nouveaux modèles d'IA, mais Gemini recule au classement

Google a mis à jour Android Bench, son benchmark destiné à évaluer les performances des modèles de langage (LLM) sur des tâches de développement Android. Cette actualisation, annoncée en juillet 2026, élargit le panel de modèles testés et introduit de nouvelles métriques pour aider les développeurs à choisir les outils les plus adaptés à leurs besoins.

Le benchmark, lancé en mars 2026, évalue les capacités des LLM sur une suite de 100 tâches de développement Android. L'update ajoute huit nouveaux modèles : Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus et Qwen 3.7 Max. Google a également intégré des métriques supplémentaires comme le coût d'exécution et l'efficacité énergétique, et adopté un nouveau framework censé faciliter l'utilisation de l'outil. Les développeurs sont invités à exécuter leurs propres tests et à soumettre des retours pour orienter l'évolution future du benchmark.

Le classement révisé révèle une position inconfortable pour les modèles de Google. Gemini 3.1 Pro se classe désormais cinquième, derrière GPT 5.4, Claude Sonnet 5 et Claude Fable 5. Ce dernier affiche une précision de 84,5 % et prend la tête du classement. Cependant, les performances brutes ne racontent qu'une partie de l'histoire : Fable 5 et GPT 5.5 coûtent plus de 130 dollars en tokens pour exécuter les 100 problèmes avec 10 passages chacun, tandis que Gemini 3.1 Pro ne dépense que 87 dollars. Gemini 3.5 Flash, présenté comme un modèle économe, s'avère paradoxalement le plus coûteux du classement à 165 dollars par exécution, en raison d'un temps de traitement de 28 heures.

Cet écart de performance sur les tâches de codage Android pose un défi stratégique pour Google, qui oriente de nombreux de ses projets vers le développement d'agents IA. Le benchmark met en lumière une tension : alors que Google souhaite que les développeurs Android privilégient ses outils, ses propres modèles ne dominent pas le classement sur ce terrain spécifique. L'actualisation du benchmark et l'invitation faite aux développeurs de participer au processus d'évaluation reflètent une volonté de maintenir la pertinence de l'outil face à une concurrence qui s'intensifie.

Réagir :
Partager —XLinkedIn
Sources citées