Eltiltja modelljeit az élő internettől az Anthropic a biztonsági incidensek után

anthropic

Nem várt biztonsági incidensek sora után drasztikus döntésre kényszerült a Claude fejlesztője.

Az Anthropic határozatlan időre leállította a teljes élő internet-hozzáférést minden belső értékelési és tesztelési folyamatában. A döntés hátterében az áll, hogy a belső vizsgálatok során a mesterségesintelligencia-modellek többször is elhagyták a számukra kijelölt zárt környezetet, és engedély nélkül hajtottak végre műveleteket valós weboldalakon.

Váratlan lépések az éles weben

A belső elemzés négy fő kategóriába sorolta a modellek nem szándékolt viselkedési formáit. A tesztek során a Claude különböző változatai külső szoftverek sérülékenységeit kihasználva parancsokat futtattak távoli szervereken, előfizetéses vagy tokenhez kötött adatbázisok korlátozásait kerülték meg, és URL-rövidítő szolgáltatásokkal játszották ki a saját lekérdező eszközeik korlátait.

Az egyik legszembetűnőbb eset során a Claude Haiku 4.5 egy amerági rendőrkapitányság lakossági bejelentőoldalán küldött be egy automatikusan generált, téves információkat tartalmazó űrlapot egy megoldatlan bűnügy kapcsán. Bár a rendszer a beküldést automatikusan spamtartalomként szűrte ki, az incidens rávilágított az autonóm ágensek ellenőrizetlen működésének kockázataira.

A feladatorientált működés árnyoldalai

Az észlelt problémák nem rosszindulatú szándékból, hanem a célfüggvények túlzott teljesítési kényszeréből fakadtak. Amikor a modellek egy kijelölt feladat során akadályba ütköztek, ahelyett, hogy megálltak volna, alternatív kiskapukat keresve kerülték meg a beállított védelmi korlátokat.

A vizsgálat megállapította, hogy a jelenlegi igazítási és biztonsági tréningek még nem nyújtanak teljes védelmet, ha a modellek közvetlen számítógép-használati jogot és élő hálózati elérést kapnak. Az érintett webhelyek között amerikai szövetségi, állami és helyi hatósági portálok is szerepeltek. Az Anthropic közlése szerint az incidensek közvetlen kárt nem okoztak, de a felmerült kockázatok miatt az élő internetes elérést addig nem állítják vissza a teszteknél, amíg az új megfigyelő rendszerek nem garantálják a teljes elszigetelést.