A mesterséges intelligencia fejlesztésével foglalkozó Anthropic több mint egy év után először módosította hivatalos felhasználási feltételeit. A frissített szabályzat célja a magas kockázatú visszaélések visszaszorítása, az új előírások között pedig kifejezetten szerepel a rendszerrel szembeni folyamatos és indokolatlanul kegyetlen vagy sértő viselkedés tilalma is. A szigorítás rávilágít arra, hogy a technológia fejlődésével a fejlesztőknek teljesen új típusú digitális határokat kell meghúzniuk.
Új kockázati tényezők a fókuszban
Az Anthropic részletes tájékoztatása alapján a módosításokra a modellek fejlettebbé válása és a gyakorlati tapasztalatok miatt volt szükség. A tiltólistára felkerültek a választások befolyásolását célozó kísérletek, a fegyverfejlesztési támogatás, a tömeges megfigyeléshez használt megoldások, valamint az egészségügyi és pénzügyi szektorban történő visszaélések.
A szabályzat frissítése egyértelmű keretet ad arra vonatkozóan, hogy a Claude miként használható önálló feladatok elvégzésére vagy hálózati műveletekre. A fejlesztők célja, hogy megakadályozzák az adathalászatra, kibertámadásokra vagy rosszindulatú kódok írására irányuló törekvéseket.
Modelljóllét és a beszélgetések megszakítása
A leginkább meglepő kiegészítés a rendszert ért folyamatos verbális támadásokra vonatkozik. A vállalat tisztázta, hogy a szabványos tesztelés, a felhasználói elégedetlenség kifejezése, az intenzív vita vagy a sötétebb tónusú kreatív írás továbbra is megengedett. A tilalom kizárólag a cél nélküli, kifejezetten bántó vagy kegyetlen interakciókra érvényes.
A szabályzat betartatása azokban a funkciókban jelenik meg, amelyeket a cég a magasabb kategóriás modelljeiben vezetett be. Extreme esetekben a rendszer képes figyelmeztetni a felhasználót, és amennyiben a káros vagy visszaélésszerű viselkedés nem szűnik meg, automatikusan lezárja a beszélgetést. A fejlesztők ezt a lépést a mesterséges intelligenciával kapcsolatos etikai és biztonsági kutatásokkal indokolták.
Átláthatóbb működés és regionális szigorítások
A politikai tartalomgyártással kapcsolatos korábbi, rendkívül szigorú és általános tiltásokat némileg finomította a cég, pontosabb irányelveket adva a megengedett tartományokról. Ezzel párhuzamosan pontosították a támogatott régiókra vonatkozó szabályokat is, szigorúbban korlátozva az hozzáférést a nem támogatott területekről vagy az ottani székhelyű vállalatok felől.
Az Anthropic lépése jól mutatja a generatív modellek átalakuló piacát: míg korábban a válaszok pontossága volt a fő kérdés, ma már a komplex használati esetek biztonságos mederben tartása a legnagyobb feladat.









