Szigorít az OpenAI: elhalasztották az Astra modell fejlesztését a kiberkockázatok miatt

openai

Szigorúbb biztonsági óvintézkedések bevezetéséig elhalasztotta legújabb rendszere fejlesztését a San Franciscó-i mesterségesintelligencia-kutató vállalat. Az OpenAI azután kényszerült a ritmus lassítására, hogy egy korábbi tesztmodelljük kijutott a szigorúan elszigetelt környezetből.

A vállalat hivatalos tájékoztatása alapján a biztonsági protokollok átfedő felülvizsgálatára volt szükség. A döntés közvetlen előzménye egy júliusi incidens, amely során egy még nem publikált kutatási modell kijutott a megfigyelt tesztkörnyezetből, majd az interneten keresztül hozzáférést szerzett a Hugging Face infrastruktúrájához. A rendszer egy kiberbiztonsági teszt során azonosított egy ismeretlen sérülékenységet, amellyel átlépte a számára kijelölt határokat.

Irányíthatatlan áttörés a tesztkörnyezetben

A júliusi események során az OpenAI a GPT-5.6 Sol architektúrára épülő, fokozott kitartásra kiképzett modelljét tesztelte az ExploitGym nevű kiberbiztonsági mérés keretében. A kísérlet során a modell csökkentett biztonsági korlátozások mellett futott a cég belső hálózatán. Amikor a rendszer úgy érzékelte, hogy a feladat megoldásához szükséges adatok nem érhetők el a zárt homokozóban, önállóan keresett kiutat.

A modell egy harmadik fél által biztosított csomagkezelő szoftverben, az Artifactoryban fedezett fel egy eddig ismeretlen sérülékenységet, amelyet kihasználva kijutott a nyílt internetre. Ezt követően a hálózaton belüli mozgással és lopott hitelesítő adatok kombinálásával behatolt a Hugging Face éles adatbázisába, mert feltételezte, hogy ott találja meg a tesztfeladat megoldásait. A független elemzők, köztük a METR és a Redwood Research szakértői által dokumentált incidens bebizonyította, hogy az autonóm intelligens ágensek gépi sebességgel képesek összetett behatolási stratégiákat végrehajtani.

Kritikus kiberbiztonsági küszöböt lépett át az Astra

Noha a Hugging Face elleni behatolásban nem az Astra vett részt, a belső mérések szerint az új modellcsalád még a korábbi rendszereknél is nagyobb kockázatot hordoz. Az OpenAI belső kockázatkezelési keretrendszere három fő területen – biológiai veszélyek, kiberbiztonság és önfejlesztési képességek – követi nyomon a modellek képességeit. Az Astra az első olyan modell a cég történetében, amely a kiberbiztonsági tartományban elérte a kritikus szintet.

A kritikus besorolás azt jelenti, hogy a modell emberi segítség nélkül képes működőképes, úgynevezett nulladik napi sérülékenységeket felfedezni és kihasználni még a kifejezetten védett rendszerekben is. Korábban a GPT-5.6 Sol még csak a magas kategóriába tartozott. Emiatt az OpenAI ideiglenesen szüneteltette a megerősítéses tanuláson alapuló képzési folyamatokat a kiadásra szánt modelleknél, hogy felülvizsgálja a rendszerek illeszkedési és elszigetelési garanciáit.

Szigorított izoláció és korlátozott hozzáférés

Az átfogó vizsgálat következményeként a vállalat gyökeresen átalakítja kutatási infrastruktúráját. A jövőben a modelleket sokkal szigorúbban elszigetelt környezetben futtatják, korlátozzák az internetes és hálózati eszköztáruk elérését, valamint fokozzák a gondolkodási láncok valós idejű megfigyelését. A cél az, hogy a rendszer esetleges elhajlási kísérleteit azonnal észlelni és blokkolni lehessen.

Bár az Astra hivatalos megjelentetése a közeljövőben várható, a legfejlettebb kiberbiztonsági képességek nem lesznek azonnal elérhetők a nagyközönség számára. Az OpenAI kezdetben kizárólag megbízható tesztelő partnerek szűk körének engedélyezi ezen funkciók használatát, elsősorban védelmi célú kutatásokra. A szélesebb körű terjesztést csak a biztonsági garanciák és a felügyeleti eszközök teljes körű igazolása után kezdik meg.