Google, Android uygulama geliştirme alanında büyük dil modellerini (LLM'ler) değerlendirmek için kullanılan Android Bench aracını yakın zamanda güncelledi. Artık, bu benchmark'ın lider tablosunun en üstünde Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus ve Qwen 3.7 Max gibi yeni modeller yer alıyor.
Mart ayından itibaren kullanıma sunulan bu araç, değerlendirmelerine maliyet ve verimlilik gibi kriterleri de ekledi ve geliştiriciler kendi testlerini çalıştırıp Android Bench’in geleceğini iyileştirmeye yardımcı olacak geri bildirimler sağlayabiliyorlar. Bu güncellemenin amacı, yapay zekâ modellerinin yüz farklı Android programlama görevini tamamlama performansını netleştirmek ve geliştiricilerin en uygun aracı seçmelerine yardımcı olmaktır.

