Google actualise Android Bench avec huit nouveaux modèles d'IA, mais Gemini recule au classement
- 01Google a étendu Android Bench avec huit nouveaux modèles et des métriques additionnelles (coût, efficacité) pour évaluer les LLM sur 100 tâches de développement Android.
- 02Claude Fable 5 domine le classement avec 84,5 % de précision, tandis que Gemini 3.1 Pro recule à la cinquième place malgré un coût d'exécution plus modéré.
- 03Les modèles les plus performants (Fable 5, GPT 5.5) consomment plus de 130 dollars en tokens par benchmark, soulevant une tension entre précision et coût opérationnel.

Google a mis à jour Android Bench, son benchmark destiné à évaluer les performances des modèles de langage (LLM) sur des tâches de développement Android. Cette actualisation, annoncée en juillet 2026, élargit le panel de modèles testés et introduit de nouvelles métriques pour aider les développeurs à choisir les outils les plus adaptés à leurs besoins.
Le benchmark, lancé en mars 2026, évalue les capacités des LLM sur une suite de 100 tâches de développement Android. L'update ajoute huit nouveaux modèles : Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus et Qwen 3.7 Max. Google a également intégré des métriques supplémentaires comme le coût d'exécution et l'efficacité énergétique, et adopté un nouveau framework censé faciliter l'utilisation de l'outil. Les développeurs sont invités à exécuter leurs propres tests et à soumettre des retours pour orienter l'évolution future du benchmark.
Le classement révisé révèle une position inconfortable pour les modèles de Google. Gemini 3.1 Pro se classe désormais cinquième, derrière GPT 5.4, Claude Sonnet 5 et Claude Fable 5. Ce dernier affiche une précision de 84,5 % et prend la tête du classement. Cependant, les performances brutes ne racontent qu'une partie de l'histoire : Fable 5 et GPT 5.5 coûtent plus de 130 dollars en tokens pour exécuter les 100 problèmes avec 10 passages chacun, tandis que Gemini 3.1 Pro ne dépense que 87 dollars. Gemini 3.5 Flash, présenté comme un modèle économe, s'avère paradoxalement le plus coûteux du classement à 165 dollars par exécution, en raison d'un temps de traitement de 28 heures.
Cet écart de performance sur les tâches de codage Android pose un défi stratégique pour Google, qui oriente de nombreux de ses projets vers le développement d'agents IA. Le benchmark met en lumière une tension : alors que Google souhaite que les développeurs Android privilégient ses outils, ses propres modèles ne dominent pas le classement sur ce terrain spécifique. L'actualisation du benchmark et l'invitation faite aux développeurs de participer au processus d'évaluation reflètent une volonté de maintenir la pertinence de l'outil face à une concurrence qui s'intensifie.
Articles liés

Reddit envisage de rompre son accord avec Google pour ses AI Overviews
Évaluer l'impact des partenariats IA sur la valorisation des plateformes sociales.

Google corrige plus de bugs Chrome en juin 2026 qu'en deux ans grâce à l'IA
Comment l'IA accélère la détection et correction des vulnérabilités dans Chrome.

Google publie Gemini Robotics 2.0 avec un modèle accessible aux développeurs
Présentation des avancées de Google en robotique via la nouvelle version de Gemini Robotics, avec un modèle disponible en accès public.