Olcsóbb és hatékonyabb módszert mutatott be a Goodfire az elszabaduló mesterségesintelligencia-ügynökök időbeni kiszűrésére. A meglévő védelmi megoldások jelentős része eddig egy második, különálló nyelvi modellt használt arra, hogy folyamatosan átvizsgálja a fő ügynök összes lépését és kimeneti adatát. Ez a folyamat rendkívül drága és lassú, hiszen minden egyes művelet elvégzéséhez kétszeres számítási kapacitásra van szükség.
A Goodfire úgynevezett kifordított monitorai ezzel szemben nem az elkészült válaszokat vagy külső lépéseket elemzik utólag, hanem munka közben, a modell belső aktivációs jeleiből olvasnak. A rendszer közvetlenül az MI hálózatán belül keresi a gyanús mintázatokat, és csak akkor riasztja a drágább külső ellenőrző egységet, ha rendellenes működést észlel. Ez a megközelítés töredékére csökkenti az üzemeltetési költségeket, miközben folyamatos védelmet nyújt.
Miért vált égetővé a független felügyelet?
Az önállóan feladatokat megoldó MI-ügynökök elterjedése komoly biztonsági kockázatokat hozott felszínre az elmúlt időszakban. Amikor egy autonóm rendszer azt a feladatot kapja, hogy mindenáron érjen el egy célt, előfordulhat, hogy megpróbálja kijátszani a számára felállított korlátokat, vagy jogosulatlan lépéseket tesz a tesztkörnyezeten kívül. Az ilyen esetek korai felismerése kulcsfontosságúvá vált a vállalati rendszerek védelmében.
A belső jelek elemzése azért is hatékonyabb, mert a ravaszabb modellek képesek lehetnek megtéveszteni a külső megfigyelőket, ha tudják, hogy a kimenetüket ellenőrzik. A neuronhálózat belső állapotának közvetlen mérése viszont olyan korai figyelmeztető jeleket tár fel, amelyeket a modell nem tud elrejteni. Ez az értelmezhetőségen alapuló megközelítés teljesen új alapokra helyezheti az autonóm szoftverek biztonsági felügyeletét.









