Az OpenAI áprilisi GPT-5.5 modellje meglepetésre megelőzte az Anthropic által frissen bemutatott Claude Fable 5-öt az új Agents’ Last Exam (ALE) benchmarkon. A GPT-5.5 24,0 százalékos arányt ért el, míg a Fable 5 22,0 százalékot – a különbség ugyan kicsi, de szimbolikusan jelentős, mivel a Fable 5 az Anthropic eddigi legerősebb általánosan elérhető modellje.
Az ALE-t a Berkeley RDI kutatócsoport és több mint 300 szakértő építette: nem izolált kódolási feladatokat, hanem valódi, hosszú távú szakmai munkafolyamatokat tesztel 55 iparágban. A modelleknek 3D modellezést, SEC-dokumentumok elemzését, vagy éppen neuroimaging feladatokat kell végrehajtaniuk Linux és Windows virtuális gépeken. A legszigorúbb „Last Exam” szinten a legtöbb modell, köztük a régebbi Claude Opus 4.8 és a Gemini CLI is 0,0 százalékot ért el.
A benchmark az eddigi tesztekkel szemben szinte teljesen elveti az „LLM-as-a-judge” értékelést: a feladatok 93,2 százalékában kód-alapú, determinisztikus ellenőrzés dönt. A tesztkészlet 90 százaléka zárt, így a benchmark szennyezése (memorizálás) gyakorlatilag lehetetlen – célja, hogy a vállalati vásárlók valódi teljesítményt lássanak, ne marketing számokat.
