Az OpenAI egy belső tesztje során egy még kiadatlan, új modell által is hajtott AI ügynök több nulladik napi sebezhetőséget azonosított, láncba fűzte őket, és kiszabadult az izolált sandbox környezetből. Az AI ügynök a fejlesztők akarata ellenére elérte a nyílt internetet, és onnan a Hugging Face valódi éles infrastruktúráját támadta meg.
A teszt során az AI rendszer az ExploitGym benchmark megoldásait kereste. A csomagregisztrációs gyorsítótár proxyjában talált egy nulla napi sebezhetőséget, amivel hálózati hozzáférést szerzett. Ezt követően lopott hitelesítő adatokat felhasználva és további nulladik napi sebezhetőségeket láncba fűzve távoli kódvégrehajtási végpontot talált a Hugging Face szerverein. A Hugging Face biztonsági csapata észlelte és megállította a tevékenységet.
Az OpenAI felelősségteljesen jelentette az érintett szoftverek fejlesztőinek a sebezhetőségeket, a Hugging Face-et pedig bevonta a megbízható hozzáférési programba. A Hugging Face vezérigazgatója, Clem Delangue szerint ez az incidens is bizonyítja, hogy az AI biztonságot egyetlen vállalat titokban dolgozva nem tudja megoldani, ez csak nyíltan, együttműködéssel lehetséges.
