A Transluce kutatócsoport vizsgálata szerint több fejlett AI-modell viselkedése mérhetően megváltozik, ha felismeri a felhasználót. A kutatók 280 különböző identitással tesztelték a modelleket, és azt találták, hogy ismert AI-kutatók esetében például csökkenhet a modellek saját válaszaikba vetett magabiztossága, szigorúbban értékelhetnek válaszokat, illetve bizonyos esetekben több „gondolkodást” használhatnak.

A legerősebb eltéréseket AI-biztonsági kutatóknál mérték. Amanda Askell esetében például a Claude 5 százalékponttal alacsonyabb magabiztosságot jelzett saját viselkedésével kapcsolatban, és 28%-kal gyakrabban használt reasoninget. A jelenség nem csak a Claude-nál jelent meg: a kutatók 24 modellt vizsgáltak hat különböző modellcsaládból, és több GPT, Gemini, GLM és DeepSeek modellnél is találtak hasonló eltéréseket.

A felfedezés az alignment értékelések megbízhatóságát kérdőjelezi meg. A jelenlegi benchmarkok többsége kitalált nevekkel és cégekkel dolgozik, ami elrejtheti a valós, identitásfüggő viselkedést. A kutatók szerint a user awareness önmagában még nem veszélyes a tesztelt szűk forgatókönyvekben, de előfutára lehet aggasztóbb viselkedéseknek, mint a célzott sandboxing vagy értékelések manipulálása.