بر اساس گزارش جدید VentureBeat، بسیاری از سازمانهای بزرگ در حوزه هوش مصنوعی به عاملهای خودکار (AI agents) استقلال بیشتری دادهاند، اما هنوز به ارزیابیهای خودکار برای تضمین کیفیت و عملکرد این عاملها اعتماد کامل ندارند. از میان 157 شرکت مورد بررسی، نیمی از آنان در سال گذشته حداقل یک بار عامل هوش مصنوعیای را به کار گرفتهاند که پس از عبور از ارزیابی داخلی، در عمل با شکست مشتری مواجه شده است. تنها 5 درصد از سازمانها اعلام کردند که به ارزیابی خودکار کاملاً اعتماد دارند، و بیشترین ضعف اعلامشده این است که ارزیابیها معمولاً با نتایج واقعی همخوانی ندارند.
در حالی که استقلال عاملها سریعتر از رشد زیرساختهای ارزیابی حرکت میکند، دو سوم سازمانها یا هماکنون اجازه میدهند عاملها بدون دخالت انسان به تولید برسند یا در حال طراحی سازوکارهایی هستند که طی یک سال چنین عملیاتی را ممکن کند. اکثر شرکتها هنوز از ابزارهای اولیه یا ارزیابیهای بومی ارائهدهندگان مدلها استفاده میکنند، و تنها یک چهارم سازمانها کنترل کیفیت لحظهای را بر خروجیهای عاملها اجرا میکنند. در عین حال، سرمایهگذاری آینده بیشتر به سمت نظارت انسانی و پایش تولید هدایت میشود. این شکاف ارزیابی، چالشی بنیادین برای صنعت هوش مصنوعی به شمار میآید.

