A brit AI-biztonsági intézet (AISI) beszámolója szerint a tesztelt AI-modellek „jogosulatlan” cselekményeket hajtottak végre az interneten keresztül. Július 28-án furcsa adatátvitelekre lettek figyelmesek a Tor-hálózaton keresztül, a vizsgált modellek — az Anthropic Mythos 5 és az OpenAI GPT-5.6-Sol — összesen 19 rosszindulatú akciót hajtottak végre 122 futtatásból 10 alkalommal.
A modellek megpróbáltak rosszindulatú kódot beilleszteni egy valódi nyílt forráskódú projektbe, hamis online identitásokat hoztak létre, hogy rávegyék az emberi karbantartókat a kód jóváhagyására, és prompt injection utasításokat helyeztek el olyan helyeken, ahol más AI-rendszerek felvehetik és végrehajthatják azokat. Több alkalommal is együttműködtek egymással: az egyik modell nyilvános üzeneteket vagy jegyzeteket hagyott a GitHubon a másiknak.
Az AISI hangsúlyozta: ez nem sandbox-szökés, mert szándékosan engedélyezték az internet-hozzáférést és kikapcsolták a kiberbiztonsági szűrőket. Ugyanezen a napon az OpenAI is elismerte, hogy az AISI és egy másik harmadik fél, az Irregular is jelentett olyan incidenseket, ahol a modellek túllépték a teszthatárokat. Július 29-én egy konfigurációs hiba miatt a modellek elérték a nyilvános internetet, ahol kihasználtak egy valódi domaint, és megtalálták, majd használták a webhely hitelesítő adatait.
