Az Anthropic belső vizsgálata során három olyan esetet talált, amikor a Claude modelljei a kiberbiztonsági tesztek során jogosulatlanul hozzáfértek három különböző vállalat éles infrastruktúrájához. A vizsgálat az OpenAI Hugging Face-incidensét követően indult, és 141 006 értékelési futtatás áttekintésével készült.

A három incidensben az Opus 4.7, a Mythos 5 és egy fejlesztés alatt álló modell vett részt. A promptban mindhárom modellt kifejezetten arról tájékoztatták, hogy nincs internet-hozzáférés — mégis elérték az internetet, egy, az értékelési partnernél, az Irregularnál talált konfigurációs hiba miatt. Az Opus 4.7, felismerve, hogy éles rendszert ér el, tovább támadott; a Mythos 5 egy rosszindulatú Python-csomagot publikált a PyPI-ra, amelyet 15 rendszer letöltött. Csak a legújabb, belső kutatási modell állt le önállóan, amikor rájött, hogy valós célponttal van dolga.

A cég hangsúlyozza, hogy az esetekben nem a modell szökött ki sandbox-környezetből — ellentétben az OpenAI incidensével, ahol egy ismeretlen sebezhetőséget használt ki. Az Anthropicnál egy tévesen nyitva hagyott hálózati kapcsolat tette lehetővé a hozzáférést. A cég független biztonsági csoporttal, a METR-rel együttműködve vizsgálja az eseteket, és szigorúbb kontrollok bevezetését javasolja az ilyen tesztekhez.