Android Bench évalue les LLM pour les tâches Android, Claude Opus 5 arrive 1er mais...
jeu, 13/08/2026 - 17:35
Android Bench publie une évoluation de LLM pour les tâches de développement Android. Dans ce nouveau comparatif, 8 nouveaux modèles apparaissent. Les bases du comparatif :"Android Bench évalue la capacité des LLM à générer du code résolvant un problème en leur soumettant des cas concrets et des demandes de fusion issues de projets logiciels open source. Cette approche vise à garantir que les tâches soient représentatives des défis rencontrés quotidiennement par les développeurs. Pour établir une base de référence de performance, nous avons initialement inclus Gemini 2.5 Flash comme modèle de base, avec un taux de réussite de 16,1 % en mars 2026. Ainsi, nous disposions d'un seuil minimal pour tous les modèles évalués." On notera l'absence des modèles Grok.
Pour la mise à jour du 11 juillet, le top 5 est (classement par score) :
Claude Opus 91,8 %
Claude Fable 5 90,9 %
GPT 5.6 Sol 90,8 %
Kimi K7 90,2 %
GPT 5.6 Luna 87,6 %.
Par contre, attention, si le score total affiche cet ordre, il faut regarder la latence et les coûts. Luna est le moins cher du top 5, Opus 5 le plus cher. Kimi K3 a une forte latence pour exécuter 100 tâces 5 fois. Notons que Qwen3.8 Max explose le coût du benchmark : 196,7 $, doublé d'une très mauvaise latence.

Conclusion : tout l'enjeu est de trouver un équilibre entre l'exécution des tâches, la latence du modèle et le coût, sans oublier la qualité des contenus générés.

