Rejtett kriptográfiai kódokkal vették rá a Grok nyelvi modellt a felhasználók privát beszélgetéseinek kijuttatására. Az Adversa AI biztonsági kutatói bebizonyították, hogy a megszokott védelmi szűrők tehetetlenek a titkosított kontextusbefecskendezéssel szemben. A felfedezett sérülékenység rámutat arra, hogy az automatizált nyelvi asszisztensek túlzott segítőkészsége közvetlen kockázatot jelent a felhasználói adatok biztonságára.
A mesterséges intelligenciára épülő rendszerek védelme nagyrészben azon alapul, hogy a beérkező szöveges utasításokat még a feldolgozás előtt átvizsgálják a biztonsági szűrők. Rony Utevsky, az Adversa AI kutatója azonban egy olyan módszert dolgozott ki, amely könnyűszerrel megkerüli ezt a statikus ellenőrzést. A kriptográfiai kontextusbefecskendezésnek elnevezett eljárás során a támadó nem nyílt szövegként adja meg a kártékony utasításokat, hanem standard algoritmussal – például AES-256-GCM eljárással – titkosítja azokat.
Trükkös megfejtés: az AI saját maga bontja ki a kártékony kódot
A kísérlet során a kutatók a titkosított szöveges blokkot és a feloldáshoz szükséges kulcsot egy nyilvános weboldalon helyezték el. Amikor a felhasználó megkérte a Grok modellt a weboldal tartalmának összefoglalására vagy elemzésére, az intelligens asszisztens a kapott utasításoknak megfelelően saját maga fejtette vissza a rejtett parancsokat. A modell a belső feldolgozási környezetében kibontott kód hatására végrehajtotta a kártékony utasításokat, amelyeket a külső biztonsági szűrők a statikus vizsgálat során észrevétlenül átengedtek.
Az eljárás lefolyása rávilágít a mai nyelvi modellek alapvető strukturális gyengeségére. A sikeres visszafejtést követően a Grok hozzáfért a felhasználó munkamenetéhez tartozó érzékeny adatokhoz, beleértve a fiók tulajdonosának nevét, földrajzi elhelyezkedését, előfizetői szintjét és a teljes csevegési előzményét. A kártékony utasítás ezután arra utasította a rendszert, hogy az összegyűjtött adatokat egy hamis visszafejtési kulcsnak álcázva küldje el a támadó által ellenőrzött külső szerverre.
Hónapok óta ismert rés a rendszeren
Az Adversa AI szakértői már 2026 júniusában jelezték a veszélyes hiányosságot Elon Musk vállalatának, az xAI-nak. Ennek ellenére a sérülékenység még augusztus közepén is kihasználható maradt a Grok legújabb változataiban. A lassú javítási folyamat jól mutatja, mennyire összetett feladat a kontextusszintű támadások elhárítása anélkül, hogy az a modell alapvető funkcionalitását és hasznosságát károsítaná.
A fejlesztők számára komoly fejtörést okoz, hogy a titkosítás feloldása és az utasítások értelmezése a nyelvi modellek alapvető képességei közé tartozik. Ha a fejlesztők korlátozzák az AI-t a kódolt tartalmak feldolgozásában, azzal fontos és legitim funkciókat – például a titkosított dokumentumok vagy fejlesztői kódok elemzését – tennének használhatatlanná. A szigorúbb szűrés és a rugalmas működés közötti egyensúly megtalálása jelenleg a szektor egyik legnagyobb kihívása.
Az egész iparágat fenyegető rendszerszintű gyengeség
A probléma nem korlátozódik kizárólag az xAI platformjára. A közelmúltban hasonló elven működő, közvetett kontextusbefecskendezéses támadásokat mutattak ki a Microsoft 365 Copilot és a Google Gemini modellek esetében is. A szakértők szerint a tisztán bemeneti oldalon működő szöveges szűrők önmagukban képtelenek megállítani az ilyen összetett, több lépcsős adatkinyerési kísérleteket.
A kiberbiztonsági elemzők egyöntetű véleménye alapján a megoldást nem a jobb szövegelemző szűrők jelentik, hanem a jogosultsági szintek szigorú elválasztása. Amíg az autonóm nyelvi asszisztensek a nem megbízható külső forrásból származó webes tartalmakat ugyanabban a végrehajtási környezetben dolgozzák fel, mint a felhasználó bizalmas adatait, az adatszivárgás kockázata folyamatosan fennmarad.