Egyetlen emberi beavatkozás nélkül játszotta végig a Valve klasszikusát az OpenAI GPT-6 Astra nyelvi modellje. A 24 órás kísérlet során a mesterséges intelligencia 571 dolláros tokenszámlát halmozott fel a feladványok megoldása közben.
A cozyblaze néven ismert fejlesztő által lebonyolított kísérletben a többmodális rendszer a Portal teljes végigjátszását önállóan hajtotta végre. A feladat során az ágens semmilyen közvetlen emberi segítséget nem kapott, kizárólag a képernyőképekből és a karakter koordinátáiból építette fel a lépéseit.
Képernyőképekből elemzett térbeli feladványok
A kísérlet hátterében egy speciális technikai architektúra állt. A fejlesztő a Model Context Protocol (MCP) és egy módosított SourcePauseTool segítségével kapcsolta össze a rendszert a játékkal. Valahányszor a modellnek döntést kellett hoznia, a játék automatikusan megállt, amíg a GPT-6 Astra feldolgozta a látottakat.
A gondolkodási fázis alatt a rendszer vizuális információkat és pontos pozícióadatokat elemzett. Miután a modell kiválasztotta a megfelelő mozdulatsort, a játék feloldotta a szünetet, az ágens pedig végrehajtotta a portal-lövési és mozgási parancsokat. Ez a folyamat összesen 3336 eszközhívást igényelt a teszt során.
A videófelvételeken látható aktív mozgás mindössze két órát tesz ki, ám a gondolkodási szünetekkel együtt a teljes folyamat csaknem egy teljes napig tartott. Az akciók precizitása és sebessége sokszor automatizált célzóprogram benyomását keltette, de a döntési mechanizmus mögött mély hálózati elemzés állt.
Háromszázharmincötmillió token és az ára
A sikeres végigjátszás nem volt olcsó mutatvány. A teljes teszt alatt a GPT-6 Astra nagyjából 435 millió tokent fogyasztott el, ami az OpenAI hivatalos API-árazása alapján 571,18 dolláros költséget jelentett. A kísérletet végző fejlesztő ugyanakkor jelezte, hogy a kiadásokat egy meglévő előfizetés keretein belül fedezte.
Ez a magas összeg jól mutatja a jelenlegi nyelvi modellek korlátait a valós idejű és komplex feladatoknál. Bár a GPT-6 Astra frissített kontextuskezelő rendszere képes volt megőrizni az információkat a több ezer lépésből álló sorozat során, a tokenfogyasztás mértéke egyelőre drága játékszernek mutatja az ilyen jellegű alkalmazásokat.
A korábbi kísérletekhez képest tapasztalt előrelépés mégis szembetűnő. Korábbi modellgenerációk, mint például a Claude vagy a korábbi GPT-változatok, rendszerint elakadtak a korai tesztkamrákban, és nem tudtak megbirkózni a lendületmegőrzésen alapuló összetett fizikai rejtvényekkel.
A tanulságok és a technológiai korlátok
A teljesítmény megítélésekor elengedhetetlen figyelembe venni a Portal egyedi sajátosságait. A Valve 2007-es játéka rendkívül részletesen dokumentált az interneten, végigjátszások és útmutatók ezrei érhetők el hozzá a nyílt weben. Bár az ágens nem férhetett hozzá élőben az internetes útmutatókhoz a futtatás alatt, nem zárható ki,hogy a tanítóadatbázisa tartalmazta a puzzle-ök megoldásait.
A kísérlet emiatt nem tekinthető szabványos teljesítménymérési tesztnek, de a 3D-s térbeli tájékozódás és az autonóm problémamegoldás szempontjából meghatározó bemutató. A GPT-6 Astra képes volt egy teljes napon át fenntartani a fókuszát, folyamatosan interakcióba lépni a környezetével és korrigálni a hibáit.
Az ehhez hasonló autonóm ágensek fejlődése azt jelzi, hogy a nyelvi modellek fokozatosan kilépnek a tisztán szöveges felületekről, és egyre összetettebb virtuális környezetekben tudnak önálló feladatokat teljesíteni.