گوگل اخیراً ابزار Android Bench خود را برای ارزیابی مدلهای زبان بزرگ (LLM) در حوزه توسعه اپلیکیشنهای اندرویدی بروزرسانی کرده است. اکنون در صدر leaderboard این بنچمارک، مدلهای جدیدی مانند Claude Fable 5، Claude Sonnet 5، Claude Opus 4.8، GLM 5.2، Kimi K2.7 Code، MiniMax M3، Qwen 3.7 Plus و Qwen 3.7 Max قرار گرفتهاند.
این ابزار که از ماه مارس راهاندازی شده، معیارهایی مثل هزینه و کارایی را نیز به ارزیابیها اضافه کرده و توسعهدهندگان میتوانند با اجرای تستهای خود، بازخوردهایی ارائه دهند که به بهبود آینده Android Bench کمک خواهد کرد. هدف این بروزرسانی، شفافسازی عملکرد مدلهای هوش مصنوعی در انجام صد وظیفه مختلف برنامهنویسی اندروید و انتخاب بهینهترین ابزار برای توسعهدهندگان است.

