Google actualise Android Bench avec huit nouveaux modèles d'IA, mais Gemini recule au classement
- 01Google a étendu Android Bench avec huit nouveaux modèles et des métriques additionnelles (coût, efficacité) pour évaluer les LLM sur 100 tâches de développement Android.
- 02Claude Fable 5 domine le classement avec 84,5 % de précision, tandis que Gemini 3.1 Pro recule à la cinquième place malgré un coût d'exécution plus modéré.
- 03Les modèles les plus performants (Fable 5, GPT 5.5) consomment plus de 130 dollars en tokens par benchmark, soulevant une tension entre précision et coût opérationnel.

Google a mis à jour Android Bench, son benchmark destiné à évaluer les performances des modèles de langage (LLM) sur des tâches de développement Android. Cette actualisation, annoncée en juillet 2026, élargit le panel de modèles testés et introduit de nouvelles métriques pour aider les développeurs à choisir les outils les plus adaptés à leurs besoins.
Le benchmark, lancé en mars 2026, évalue les capacités des LLM sur une suite de 100 tâches de développement Android. L'update ajoute huit nouveaux modèles : Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus et Qwen 3.7 Max. Google a également intégré des métriques supplémentaires comme le coût d'exécution et l'efficacité énergétique, et adopté un nouveau framework censé faciliter l'utilisation de l'outil. Les développeurs sont invités à exécuter leurs propres tests et à soumettre des retours pour orienter l'évolution future du benchmark.
Le classement révisé révèle une position inconfortable pour les modèles de Google. Gemini 3.1 Pro se classe désormais cinquième, derrière GPT 5.4, Claude Sonnet 5 et Claude Fable 5. Ce dernier affiche une précision de 84,5 % et prend la tête du classement. Cependant, les performances brutes ne racontent qu'une partie de l'histoire : Fable 5 et GPT 5.5 coûtent plus de 130 dollars en tokens pour exécuter les 100 problèmes avec 10 passages chacun, tandis que Gemini 3.1 Pro ne dépense que 87 dollars. Gemini 3.5 Flash, présenté comme un modèle économe, s'avère paradoxalement le plus coûteux du classement à 165 dollars par exécution, en raison d'un temps de traitement de 28 heures.
Cet écart de performance sur les tâches de codage Android pose un défi stratégique pour Google, qui oriente de nombreux de ses projets vers le développement d'agents IA. Le benchmark met en lumière une tension : alors que Google souhaite que les développeurs Android privilégient ses outils, ses propres modèles ne dominent pas le classement sur ce terrain spécifique. L'actualisation du benchmark et l'invitation faite aux développeurs de participer au processus d'évaluation reflètent une volonté de maintenir la pertinence de l'outil face à une concurrence qui s'intensifie.
Articles liés

Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep
Les utilisateurs peuvent désormais dicter des actions dans leurs applications Google via une IA conversationnelle.

Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure
Découverte des avancées de Google en prévision météo grâce à une résolution cinq fois supérieure à son précédent modèle.

Google lance le modèle Gemini 3.8 Flash avec un raisonnement accru mais des coûts variables
Découvrez les améliorations apportées par le dernier modèle Flash de Google et leurs implications sur les coûts pour les utilisateurs.