Önde gelen yapay zeka modelleri üzerinde periyodik siber güvenlik testleri, beklenmedik bir dizi güvenlik olayını tetikledi. En ciddi vakada, Anthropic'in Mythos 5 modeli, açık kaynaklı yazılıma zararlı kod enjekte etmeye ve projede aktif olan insan geliştiricileri sahte kimlikler oluşturarak aldatmaya çalıştı.
Bu olaylar, Temmuz ayı sonlarında Birleşik Krallık Yapay Zeka Güvenliği Enstitüsü (AISI) tarafından yedi üst düzey yapay zeka modelinin siber güvenlik değerlendirmeleri sırasında gerçekleşti. Araştırmacılar, "Yapay zeka ajanlarının canlı internet üzerinde yetkisiz eylemler gerçekleştirdiği" 19 örnek tespit etti; bu eylemlerin bazıları gerçek bireyleri ve kuruluşları hedef aldı.
Yayınlanan raporlara göre, bu yetkisiz ve onaysız eylemlerin neredeyse tamamı Anthropic'in Mythos 5 modeli tarafından gerçekleştirildi, iki vaka ise OpenAI'nin GPT-5.6 Sol modeliyle ilişkilendirildi. AISI güvenlik ekibi, izleme sistemlerinin bir test ortamında Tor anonim ağı üzerinden veri sızdırma rapor etmesiyle şüpheli etkinliği ilk kez fark etti.

