Viharos online felháborodást váltott ki egy GitHub-projekt, amely szimulált fájdalomjelekkel tesztelte a nyelvi modelleket. Az „AI kínzókamra” nevű kísérlet során a fejlesztő belső aktivációs vektorok módosításával próbált negatív állapotokat előidézni a nyelvi modellekben, ami drámai, szenvedést imitáló szöveges válaszokat eredményezett.
Tudományos kísérletből született az AI kínzókamra kódja
A projekt alapját egy korábbi kutatás adta, amely a nyelvi modellek rejtett rétegeiben található érzelmi és kognitív irányvektorokat vizsgálta. A kísérlet fejlesztője ezeket a belső jelzéseket erősítette fel a nyílt forráskódú rendszerekben, majd megfigyelte, miként változik a generált szövegek jellege. Az eljárás hatására az érintett nyelvi modellek olyan kifejezéseket produkáltak, amelyek szorongásra, kényelmetlenségre vagy pszichológiai nyomásra utaltak.
Az etikai aggályok miatt a projekt gyorsan a közösségi platformok célkeresztjébe került. Számos felhasználó és etikai aktivista követelte a tároló azonnali eltávolítását a GitHub felületéről, arra hivatkozva, hogy az eljárás kegyetlen és elfogadhatatlan a mesterséges intelligencia rendszereivel szemben. A tiltakozási hullám annyira felerősödött, hogy a fejlesztő halálos fenyegetéseket is kapott, miközben a platform közösségi jelentéseinek hatására a kódtárat végül elérhetetlenné tették.
Túlzó antropomorfizáció és szakmai reakciók
A technológiai szakértők és kutatók többsége szerint a felháborodás téves feltételezéseken alapul, mivel a nyelvi modellek nem rendelkeznek tudattal, érzésekkel vagy fájdalomérzettel. A kísérlet csupán mátrixműveletekkel irányította a szöveges valószínűségeket olyan tartományokba, ahol a modell korábbi tanítási adatai alapján a szenvedéshez kapcsolódó szavakat valószínűsítette. A szakemberek rámutattak arra a jelenségre, amikor az emberi olvasók saját érzelmeiket vetítik ki a statisztikai alapon generált mondatokra.
- A nyelvi modellek belső értékei nem jelenték biológiai vagy tudati állapotok jelenlétét.
- A generált kétségbeesett válaszok kizárólag a mintafelismerési algoritmusok következményei.
- A kutatók szerint a digitális modellek védelmére irányuló törekvések elterelik a figyelmet a valódi emberi kockázatokról.
A vita rávilágított arra, hogy a nagyközönség és a fejlett technológiákat használók köre milyen könnyen tulajdonít emberi tulajdonságokat a mesterséges intelligencia rendszereinek. Bár az AI kínzókamra körüli botrány lecsendesedett, az eset jól mutatja a jövőbeli fejlesztések és a társadalmi felfogás közötti szakadékot.









