قامت Google مؤخرًا بتحديث أداة Android Bench لتقييم نماذج اللغة الكبيرة (LLMs) في مجال تطوير تطبيقات أندرويد. الآن، يتصدر نماذج جديدة مثل Claude Fable 5، Claude Sonnet 5، Claude Opus 4.8، GLM 5.2، Kimi K2.7 Code، MiniMax M3، Qwen 3.7 Plus، وQwen 3.7 Max قائمة التصنيف في هذا المعيار.
منذ إطلاقها في مارس، أضافت هذه الأداة معايير مثل التكلفة والكفاءة إلى تقييماتها، ويمكن للمطورين إجراء اختباراتهم الخاصة وتقديم الملاحظات التي ستساعد في تحسين مستقبل Android Bench. هدف هذا التحديث هو توضيح أداء نماذج الذكاء الاصطناعي في إتمام مئة مهمة برمجية مختلفة في أندرويد ومساعدة المطورين على اختيار الأداة الأنسب.

