Rivális mesterséges intelligenciát hívtak segítségül a biztonsági kutatók, akik három nap alatt feltörték az OpenAI belső rendszerét. A Hacktron nevű kiberbiztonsági csapat az Anthropic által fejlesztett Claude Opus modellt hívta segítségül ahhoz, hogy felderítse és kihasználja a megcélozgatott infrastruktúra gyenge pontjait. A tesztelés során a kutatóknak sikerült hozzáférést szerezniük a vállalat dolgozóinak fiókjaihoz, majd ezen keresztül elérniük a cikkekben csak Monorepo néven említett központi GitHub-tárhelyet is.
A művelet teljes mértékben etikus keretek között, hibavadász program keretében zajlott. A szakemberek nem tekintették meg és nem szivárogtatták ki az ott található bizalmas algoritmusokat. Hogy igazolják a sikeres behatolást, egy ártalmatlan módosítási kérelmet nyújtottak be a belső forráskódhoz, majd haladéktalanul értesítették az érintett vállalatot a hibákról.
Két sérülékenységből épült fel a támadási lánc
A behatolás kiindulópontja az OpenAI nyilvános közösségi fóruma volt, amely a népszerű Discourse szoftverre épül. A kutatók észlelték, hogy a fórumra feltöltött képek feldolgozásáért felelős belső könyvtár, a libheif egy korábbi, sebezhető verziót használt. Bár a hibára már létezett javítás, az még nem került át a használt rendszerkörnyezetbe. Az eredeti sebezhetőség kihasználásával a kutatók távoli kódfuttatási jogosultságot szereztek a fórumot kiszolgáló szerveren.
A sikeres belépés után a második láncszem az egységes azonosítási rendszer hiányossága volt. A fórumra történő bejelentkezés során kiadott munkamenet-azonosítók érvényesek maradtak a ChatGPT és a fejlesztői eszközök felületén is. Mivel több alkalmazott is használta a nyilvános fórumot, a megszerzett adatokkal a kutatók átvették az irányítást a belső munkatársak fiókjai felett.
A nyelvi modell szerepe a kódfejlesztésben
A támadási lánc kialakításában kulcsszerepet játszott az Anthropic nyelvi modellje. Az első kísérletek során a Claude Opus 4.8-as változata még nem tudta áttörni a memóriacímek véletlenszerűsítését védő biztonsági vonalat. Az újabb, frissített modellváltozat bevetésével azonban a rendszer pillanatok alatt képes volt működőképes exploit kódot generálni az adott sérülékenységre.
A folyamat az első rés felderítésétől a belső kódtárhoz való hozzáférésig kevesebb mint 72 órát vett igénybe. A vállalat elismerte a felfedezett hiányosságokat, visszavonta az érintett munkamenet-munkameneteket, szigorította az azonosítási jogosultságokat, és 6500 dolláros jutalmat fizetett a biztonsági csapatnak.









