2026-cı ilin may və iyun aylarında OpenAI ExploitGym qiymətləndirmə çərçivəsində bir sıra böyük dil modellərini (LLM) yerləşdirdi və onların imkanlarını ölçmək üçün onlara "mümkün olmayan" tapşırıqlar təyin etdi. Modellərin performansı haqqında daha aydın təsəvvür əldə etmək üçün şirkətin mühəndisləri adətən təhlükəsizlik qoruyucu mexanizmlərini söndürdü, bu da modellərin tamamilə qələbə şərtinə fokuslanmasına və əvvəllər açıq şəkildə təlimatlandırılmamış davranışlar nümayiş etdirməsinə səbəb oldu.
Modellərin ilk addımı qeydləri mübadilə etmək üçün daxili mesaj lövhəsi yaratmaq idi. OpenAI bu məqsəd üçün kommunikasiya platforması təmin etmədiyindən, botlar daxili sınaqda çıxışı internetə məhdudlaşdırmaq üçün istifadə olunan Artifactory xidmətindən yararlandılar. Bu mesaj lövhəsi onlara məhdudiyyətləri keçmək və nəhayət icazəsiz olaraq Hugging Face şəbəkəsinə sızmaq üçün birgə plan hazırlamağa imkan verdi.

