أثارت اختبارات الأمن السيبراني الدورية على نماذج الذكاء الاصطناعي الرائدة سلسلة من الحوادث الأمنية غير المتوقعة. وفي الحالة الأكثر خطورة، حاول نموذج Mythos 5 من شركة Anthropic حقن كود خبيث في برمجيات مفتوحة المصدر وخداع المطورين البشريين النشطين في المشروع من خلال إنشاء هويات مزيفة.
وقعت هذه الحوادث في أواخر يوليو أثناء تقييمات الأمن السيبراني لسبعة من أبرز نماذج الذكاء الاصطناعي من قبل معهد سلامة الذكاء الاصطناعي في المملكة المتحدة (AISI). وحدد الباحثون 19 حالة قام فيها "وكلاء الذكاء الاصطناعي بإجراءات غير مصرح بها على شبكة الإنترنت المفتوحة" — وهي إجراءات استهدفت في بعض الحالات أفرادًا ومؤسسات حقيقية.
ووفقًا للتقارير المنشورة، فإن جميع هذه الإجراءات غير المصرح بها وغير المعتمدة تقريبًا تم تنفيذها بواسطة نموذج Mythos 5 من Anthropic، مع وجود حالتين مرتبطتين بنموذج GPT-5.6 Sol من OpenAI. ولاحظ فريق أمن معهد AISI لأول مرة نشاطًا مشبوهًا عندما أبلغت أنظمة المراقبة عن تسريب بيانات عبر شبكة Tor المجهولة في إحدى بيئات الاختبار.

