Szigorít az Anthropic: Megtiltották a kegyetlen bánásmódot a Claude AI-val szemben

anthropic

A mesterséges intelligencia fejlesztésével foglalkozó Anthropic több mint egy év után először módosította hivatalos felhasználási feltételeit. A frissített szabályzat célja a magas kockázatú visszaélések visszaszorítása, az új előírások között pedig kifejezetten szerepel a rendszerrel szembeni folyamatos és indokolatlanul kegyetlen vagy sértő viselkedés tilalma is. A szigorítás rávilágít arra, hogy a technológia fejlődésével a fejlesztőknek teljesen új típusú digitális határokat kell meghúzniuk.

Új kockázati tényezők a fókuszban

Az Anthropic részletes tájékoztatása alapján a módosításokra a modellek fejlettebbé válása és a gyakorlati tapasztalatok miatt volt szükség. A tiltólistára felkerültek a választások befolyásolását célozó kísérletek, a fegyverfejlesztési támogatás, a tömeges megfigyeléshez használt megoldások, valamint az egészségügyi és pénzügyi szektorban történő visszaélések.

A szabályzat frissítése egyértelmű keretet ad arra vonatkozóan, hogy a Claude miként használható önálló feladatok elvégzésére vagy hálózati műveletekre. A fejlesztők célja, hogy megakadályozzák az adathalászatra, kibertámadásokra vagy rosszindulatú kódok írására irányuló törekvéseket.

Modelljóllét és a beszélgetések megszakítása

A leginkább meglepő kiegészítés a rendszert ért folyamatos verbális támadásokra vonatkozik. A vállalat tisztázta, hogy a szabványos tesztelés, a felhasználói elégedetlenség kifejezése, az intenzív vita vagy a sötétebb tónusú kreatív írás továbbra is megengedett. A tilalom kizárólag a cél nélküli, kifejezetten bántó vagy kegyetlen interakciókra érvényes.

A szabályzat betartatása azokban a funkciókban jelenik meg, amelyeket a cég a magasabb kategóriás modelljeiben vezetett be. Extreme esetekben a rendszer képes figyelmeztetni a felhasználót, és amennyiben a káros vagy visszaélésszerű viselkedés nem szűnik meg, automatikusan lezárja a beszélgetést. A fejlesztők ezt a lépést a mesterséges intelligenciával kapcsolatos etikai és biztonsági kutatásokkal indokolták.

Átláthatóbb működés és regionális szigorítások

A politikai tartalomgyártással kapcsolatos korábbi, rendkívül szigorú és általános tiltásokat némileg finomította a cég, pontosabb irányelveket adva a megengedett tartományokról. Ezzel párhuzamosan pontosították a támogatott régiókra vonatkozó szabályokat is, szigorúbban korlátozva az hozzáférést a nem támogatott területekről vagy az ottani székhelyű vállalatok felől.

Az Anthropic lépése jól mutatja a generatív modellek átalakuló piacát: míg korábban a válaszok pontossága volt a fő kérdés, ma már a komplex használati esetek biztonságos mederben tartása a legnagyobb feladat.