وفقًا لتقرير جديد صادر عن VentureBeat، منحت العديد من المؤسسات الكبرى في قطاع الذكاء الاصطناعي وكلاءها الآليين المزيد من الاستقلالية، لكنها لا تزال لا تثق بشكل كامل في التقييمات الآلية لضمان جودة وأداء هؤلاء الوكلاء. من بين 157 شركة تم استطلاعها، نصفها نشروا على الأقل وكيل ذكاء اصطناعي واحد خلال العام الماضي اجتاز التقييم الداخلي، لكنه فشل في النهاية مع العملاء. فقط 5 بالمئة من المؤسسات أفادت بأنها تثق بالكامل في التقييمات الآلية، وكانت نقطة الضعف الأكثر شيوعًا هي أن هذه التقييمات غالبًا لا تتوافق مع النتائج الفعلية.
بينما يتقدم استقلال الوكلاء بوتيرة أسرع من تطوير البنية التحتية للتقييم، فإن ثلثي المؤسسات إما تسمح حاليًا للوكلاء بالعمل دون تدخل بشري أو تقوم بتصميم آليات لتمكين مثل هذه العمليات في غضون عام. لا تزال معظم الشركات تعتمد على الأدوات الأساسية أو التقييمات الأصلية التي يقدمها موردو النماذج، وفقط ربع المؤسسات تطبق رقابة جودة في الوقت الفعلي على مخرجات الوكلاء. وفي الوقت نفسه، تتجه الاستثمارات المستقبلية بشكل متزايد نحو الإشراف البشري ورصد العمليات الإنتاجية. ويعتبر هذا الفجوة في التقييم تحديًا أساسيًا لصناعة الذكاء الاصطناعي.

