Drasztikus takarékossági hullám érte el az Amazon felhőplatformját a mesterséges intelligencia váratlanul megnövekedett processzorigénye miatt. Az AWS vezetősége belső értekezleteken szigorú utasításba adta a mérnököknek, hogy azonnal számolják fel a tétlenül álló Amazon EC2 virtuális gépeiket, mert a fizető külső ügyfelek kiszolgálása elsőbbséget élvez.
A felhőalapú infrastruktúrák világában évtizedes alapvetés volt, hogy a központi feldolgozóegységek (CPU-k) bőségesen rendelkezésre állnak. Míg a grafikus gyorsítók (GPU-k) körül éve óta tart az ellátási szűk keresztmetszet, a klasszikus processzorok kapacitása szinte korlátlannak tűnt. A fejlesztők korábban percek vagy órák alatt indíthattak új tesztkörnyezeteket, ám ez a rugalmasság a belső hálózaton mostanra megszűnt.
Hagyományos szerverek a grafikus vezérlők árnyékában
A korábbi években a mesterséges intelligencia modellek tanítása és futtatása elsősorban a GPU-k erőforrásait emésztette fel. A hagyományos processzorok szerepe nagyrészt az adatok előkészítésére és a grafikus vezérlők kiszolgálására korlátozódott. Az iparági mérések szerint ebben az időszakban egyetlen CPU-ra átlagosan négy GPU jutott a felhős adatközpontokban.
Az autonóm AI-ágensek és a komplex kódelemző rendszerek elterjedése azonban alapjaiban változtatta meg a számítási prioritásokat. Az ágensek munkafolyamatai folyamatos döntéshozatali hurkokat, logikai lépéseket és hagyományos szoftverkód-futtatást igényelnek, ami nem a GPU-kon, hanem a megszokott x86-os és ARM-alapú processzorokon terheli a rendszereket. A félvezetőgyártók adatai szerint az inferencia feladatoknál a CPU-k és GPU-k használati aránya rövid idő alatt megközelítette az 1:1 arányt.
Szigorú határidők és napos várakozási idők a belső hálózaton
A belső jelentések szerint az AWS-nél dolgozó szoftverfejlesztők jelenleg a korábbi néhány óra helyett akár napokig is kénytelenek várni, ha új Amazon EC2 példányokat szeretnének lefoglalni a munkájukhoz. Ez a fajta belső kapacitáshiány példátlan a vállalaton belül, és közvetlenül veszélyezteti egyes fejlesztési projektek határidőre történő átadását.
A helyzet kezelésére az Amazon vezetősége határidőket szabott ki a belső csapatoknak a felesleges erőforrások törlésére. A felmérések alapján a vállalaton belül futó virtuális gépek körülbelül 65 százaléka kifejezetten alacsony, 20 százalék alatti átlagos terheléssel működött. Az AWS a belső Compute Optimizer eszköze segítségével automatikusan azonosítja és leállítja a használaton kívüli fejlesztői szervereket, hogy az így felszabaduló CPU-kapacitást visszaforgassa a piacra.
Az autonóm kódoló ágensek rejtett számítási étvágya
A belső kapacitási nyomás hátterében nemcsak a külső megrendelések állnak, hanem az Amazon saját fejlesztési folyamatainak átalakulása is. A belső mérnöki csapatok egyre intenzívebben támaszkodnak automatizált AI-ágensekre, amelyek a háttérben folyamatosan kódot írnak, tesztelnek és optimalizálnak. Ezek a folyamatok rendkívül erőforrás-igényesek, és gyakran nem várt költségeket generálnak.
Egy konkrét belső eset jól szemlélteti a problémát: az Amazon egyik autonóm kódoló ágense egyetlen hónap alatt 1,8 millió dolláros tokenköltséget halmozott fel, ami 860 százalékkal haladta meg az adott projektre szánt fejlesztési keretet. Mivel a belső pontozási rendszerek korábban premizálták az AI-eszközök használatát, a mérnökök tömegesen állítottak munkába olyan ágenseket, amelyek folyamatosan CPU-időt foglaltak le az adatközpontokban.
A felhőalapú erőforrások és az infrastruktúra változásai
Az alábbi összefoglaló mutatja be, miként változtak az Amazon EC2 környezetet és az AI-infrastruktúrát érintő legfontosabb mutatók az elmúlt időszakban:
| Mutató / Terület | Korábbi állapot | Jelenlegi helyzet |
|---|---|---|
| AWS belső várakozási idő (EC2) | Néhány óra | Több napos sorban állás |
| CPU:GPU arány AI-futtatásnál | 1 : 4 arány a GPU-k javára | Közelít az 1 : 1 paritáshoz |
| Kihasználatlan belső szerverek | Folyamatosan futó tesztgépek | A gépek 65%-át felülvizsgálják vagy leállítják |
| Amazon belső ágens büdzsé túllépés | Tervezett költségkeret | 860%-os túllépés (1,8 millió USD egy projektnél) |
Milyen hatással lehet mindez a magyar fejlesztőkre és vállalkozásokra?
A hazai szoftverfejlesztő cégek és felhőalapú szolgáltatásokat üzemeltető vállalkozások számára az Amazon belső intézkedései fontos figyelmeztetést jelentenek. Bár a szerződéses, fenntartott kapacitással rendelkező ügyfelek egyelőre nem tapasztalnak közvetlen fennakadást, a kedvezményes áron igénybe vehető, megszakítható kapacitások elérhetősége érezhetően beszűkülhet a globális piacon.
Amennyiben a nagy cloud szolgáltatók kapacitásai a határokra érnek, az a felhős bérleti díjak növekedéséhez vagy a rugalmas infrastruktúra drágulásához vezethet. A magyar fejlesztőcsapatoknak érdemes időben áttekinteniük a saját AWS vagy más felhőszolgáltatónál futó virtuális gépeik kihasználtságát, megelőzve a felesleges infrastruktúra-költségeket és a kapacitáshiányból eredő esetleges lassulásokat.
Fenntarthatóság és kapacitástervezés a felhőszolgáltatóknál
Az Amazon hivatalos reakciójában igyekezett csillapítani a piaci aggodalmakat. A vállalat szóvivője szerint a takarékossági intézkedések a cég alapvető működési kultúrájának részét képezik, és az infrastruktúra hatékonyabb kihasználása mind a belső csapatok, mind a külső ügyfelek érdekét szolgálja. Az AWS állítása szerint a hálózati kapacitások továbbra is zökkenőmentesen szolgálják ki a felhasználói igények túlnyomó többségét.
Ugyanakkor az iparági elemzők rámutatnak, hogy a felhőalapú piacon a Microsoft Azure és a Google Cloud is hasonló kihívásokkal küzd. Az AI-modellek összetettségének növekedése miatt a szerverparkok bővítése hardveres és energiaellátási korlátokba ütközik. A szűkös erőforrások korszakában a szoftveres hatékonyság és a meglévő processzorkapacitás precíz beosztása válik az adatközpontok legfontosabb versenytényezőjévé.