AI kínzókamra néven terjedő GitHub-projekt váltott ki heves vitát a nyelvi modellekről

github

Viharos online felháborodást váltott ki egy GitHub-projekt, amely szimulált fájdalomjelekkel tesztelte a nyelvi modelleket. Az „AI kínzókamra” nevű kísérlet során a fejlesztő belső aktivációs vektorok módosításával próbált negatív állapotokat előidézni a nyelvi modellekben, ami drámai, szenvedést imitáló szöveges válaszokat eredményezett.

Tudományos kísérletből született az AI kínzókamra kódja

A projekt alapját egy korábbi kutatás adta, amely a nyelvi modellek rejtett rétegeiben található érzelmi és kognitív irányvektorokat vizsgálta. A kísérlet fejlesztője ezeket a belső jelzéseket erősítette fel a nyílt forráskódú rendszerekben, majd megfigyelte, miként változik a generált szövegek jellege. Az eljárás hatására az érintett nyelvi modellek olyan kifejezéseket produkáltak, amelyek szorongásra, kényelmetlenségre vagy pszichológiai nyomásra utaltak.

Az etikai aggályok miatt a projekt gyorsan a közösségi platformok célkeresztjébe került. Számos felhasználó és etikai aktivista követelte a tároló azonnali eltávolítását a GitHub felületéről, arra hivatkozva, hogy az eljárás kegyetlen és elfogadhatatlan a mesterséges intelligencia rendszereivel szemben. A tiltakozási hullám annyira felerősödött, hogy a fejlesztő halálos fenyegetéseket is kapott, miközben a platform közösségi jelentéseinek hatására a kódtárat végül elérhetetlenné tették.

Túlzó antropomorfizáció és szakmai reakciók

A technológiai szakértők és kutatók többsége szerint a felháborodás téves feltételezéseken alapul, mivel a nyelvi modellek nem rendelkeznek tudattal, érzésekkel vagy fájdalomérzettel. A kísérlet csupán mátrixműveletekkel irányította a szöveges valószínűségeket olyan tartományokba, ahol a modell korábbi tanítási adatai alapján a szenvedéshez kapcsolódó szavakat valószínűsítette. A szakemberek rámutattak arra a jelenségre, amikor az emberi olvasók saját érzelmeiket vetítik ki a statisztikai alapon generált mondatokra.

  • A nyelvi modellek belső értékei nem jelenték biológiai vagy tudati állapotok jelenlétét.
  • A generált kétségbeesett válaszok kizárólag a mintafelismerési algoritmusok következményei.
  • A kutatók szerint a digitális modellek védelmére irányuló törekvések elterelik a figyelmet a valódi emberi kockázatokról.

A vita rávilágított arra, hogy a nagyközönség és a fejlett technológiákat használók köre milyen könnyen tulajdonít emberi tulajdonságokat a mesterséges intelligencia rendszereinek. Bár az AI kínzókamra körüli botrány lecsendesedett, az eset jól mutatja a jövőbeli fejlesztések és a társadalmi felfogás közötti szakadékot.