Google TPU és AMD: hibrid AI-chippel erősítene a keresőóriás

google-tpu-datacenter

Csendben formálódik a mesterséges intelligencia hardveres piacának eddigi legváratlanabb szövetsége a színfalak mögött. Elemzői értesülések szerint a Google az AMD szakértelmét veszi igénybe a következő generációs TPU gyorsítók megtervezéséhez. A SemiAnalysis iparági elemzőcég legfrissebb jelentése alapján a két technológiai óriás a 10. generációs TPU-család egyik kifejezett hibrid változatán dolgozik együtt. A projekt célja olyan egyedi mikarchitektúra létrehozása, amely a mátrixszorzásra optimalizált céláramkörök (ASIC) mellé közvetlenül a lapkatokozáson belül integrál általános célú CPU-magokat. Ez a felépítés gyökeresen eltér a korábbi megközelítésektől, ahol a processzorok és a célgyorsítók különálló komponensként, az alaplapi buszrendszeren keresztül kommunikáltak egymással.

Közös chiplet-architektúra a klasszikus gyorsítók korlátainak áttörésére

A Google kilenc generáción keresztül formálta a saját fejlesztésű TPU-k architektúráját, a szilícium fizikai megtervezésében és gyártásba illesztésében pedig hagyományosan a Broadcom volt az elsődleges partnere. Mivel a keresőóriás belső mérnöki csapata évtizedes tapasztalattal rendelkezik a mátrixműveleteket végző feldolgozóegységek tervezésében, a megszokott gyorsítóstruktúrák finomhangolásához nem lenne szüksége az AMD segítségére. Az együttműködés valódi mozgatórugója az AMD birtokában lévő szellemi tulajdon, különösen a nagy teljesítményű x86-os CPU-magok, a fejlett chiplet-összeköttetési technológiák és a 3D-s lapkatokozási eljárások. Az AMD az adatközponti termékeinél már bizonyította, hogy képes egyetlen fizikai tokon belül egyesíteni a CPU- és gyorsító-chipleteket a közös memóriatérben. A Google most ezt a tapasztalatot ültetheti át a saját specifikus AI-architektúrájára, megszüntetve a komponensek közötti adatátviteli szűk keresztmetszeteket.

Miért van szükség általános célú CPU-magokra a mesterséges intelligenciában?

A mesterséges intelligencia modellek fejlődési iránya az utóbbi időben drasztikusan eltolódott a puszta nyelvi mintázatfelismeréstől a komplex logikai következtetés és az autonóm ágensi működés felé. Míg a hagyományos nagy nyelvi modellek betanítása szinte kizárólag a nagy átviteli sebességű mátrixszorzásra épül, a megerősítéses tanulás és az összetett ágensi munkafolyamatok növelik a soros jellegű, általános számítási feladatok arányát. A környezettel való interakció, a lépések szabályalapú kiértékelése és a döntési fák bejárása olyan számítási műveleteket igényel, amelyekre a TPU-k szisztolés tömbjei kevésbé hatékonyak. Amennyiben ezeket a műveleteket külső host processzornak kell elvégeznie, a chip-chip közötti adatmozgatás késleltetést okoz. A CPU-magok közvetlen tokon belüli integrálása közvetlen hozzáférést biztosít a közös memóriatárhoz, ami érdemben csökkenti a válaszidőt.

A számítási kapacitás átrendeződése az ágensi modellek érájában

A Google hardveres stratégiája már az előző generációk során is mutatta a processzoros kapacitások felértékelődését. A korábbi TPU-szerverekben még négy célgyorsítóra jutott egyetlen Intel Xeon processzor. Ezzel szemben a kifejezetten inferenciára és megerősítéses tanulásra tervezett TPU 8i rendszereknél az arány már két TPU-ra és egy saját fejlesztésű, Arm-alapú Axion CPU-ra módosult. Ipari elemzők rámutatnak, hogy az összetettebb gondolkodási láncokat futtató modellek esetében az egyenlő arányú CPU-TPU párosítás válhat az optimális konfigurációvá. A 10. generációs hibrid TPU-val a Google elhagyhatja a különálló host processzorok alkalmazását a speciális szervercsomópontokban, és közvetlenül a gyorsítócsipbe építve biztosíthatja a szükséges általános számítási teljesítményt.

A Broadcom szerepe és az AMD belépése a megacégek egyedi chippiacára

Amennyiben az iparági hírek beigazolódnak, ez lehet az AMD első valódi szerepvállalása egy hyperscale vállalati AI ASIC projektben. Bár az AMD korábban is rendelkezett egyedi szilíciumfejlesztő részleggel, a piacot ezen a területen eddig a Broadcom és a Marvell dominálta. A beszámolók szerint a Broadcom továbbra is kulcsszereplő marad a Google TPU-flottájának jelentős részénél, például a tiszta betanításra optimalizált variánsoknál, de az AMD belépése jelzi, hogy a Google több lábon kíván állni a gyártási kapacitások és a technológiai kompetenciák biztosításában. A lépés mögött a fejlett tokozási kapacitások globális szűkössége is állhat, amely arra kényszeríti a technológiai óriásokat, hogy alternatív csomagolási és chiplet-megoldásokat keressenek.

A piaci egyensúly és a szoftveres ökoszisztéma jövője

Bár az Nvidia továbbra is uralja az AI-hardverek globális piacának jelentős részét, az egyedi ASIC-megoldások részesedése folyamatosan növekszik az adatközponti szervermegrendelésekben. A Google előnye a piacon nem kizárólag a chipek nyers teljesítményében rejlik, hanem abban a vertikális integrációban, amely a saját fejlesztésű modellektől a szoftverkeretrendszereken át az adatközponti infrastruktúráig mindent felölel. Az AMD x86-os és tokozási IP-jének beemelése a TPU v10 platformba tovább erősítheti ezt az ökoszisztémát, miközben az iparág egésze számára rávilágít arra, hogy a jövő mesterséges intelligenciája nem tisztán egyféle gyorsítón, hanem hibrid, feladatspecifikus architektúrákon fog futni.