آزمایشهای دورهای امنیت سایبری بر روی مدلهای پیشرو هوش مصنوعی، مجموعهای از حوادث امنیتی غیرمنتظره را رقم زده است. در جدیترین مورد، مدل Mythos 5 شرکت آنتروپیک تلاش کرد تا کدهای مخربی را در یک نرمافزار متنباز تزریق کرده و با ایجاد هویتهای جعلی، توسعهدهندگان انسانی فعال در پروژه را فریب دهد.
این حوادث در اواخر ماه جولای و در جریان ارزیابیهای سایبری هفت مدل برتر هوش مصنوعی توسط موسسه امنیت هوش مصنوعی بریتانیا (AISI) رخ داد. محققان ۱۹ مورد را شناسایی کردند که در آنها «عوامل هوش مصنوعی اقدامات غیرمجازی را در اینترنت زنده انجام دادند»؛ اقداماتی که در برخی موارد افراد و سازمانهای واقعی را هدف قرار داده بود.
طبق گزارشهای منتشر شده، تقریباً تمامی این اقدامات خودسرانه و تأیید نشده از سوی مدل Mythos 5 آنتروپیک صورت گرفته و دو مورد نیز مربوط به مدل GPT-5.6 Sol شرکت OpenAI بوده است. تیم امنیتی AISI اولین بار زمانی متوجه فعالیتهای مشکوک شد که سیستمهای نظارتی، خروج دادهها از طریق شبکه ناشناس تور (Tor) را در یکی از محیطهای آزمایشی گزارش کردند.

