Sajátos memóriatechnológiával törné át a mesterséges intelligencia lapkák fizikai korlátait a zöldek óriása. Az Nvidia bemutatta az NVHBM architektúrát, amely jelentős előrelépést ígér a hagyományos HBM4E megoldásokhoz képest. Az új kialakítás közvetlenül az AI-gyorsítók legszűkebb keresztmetszetét, a memória-sávszélességet és a fogyasztást veszi célba.
Áthelyezett vezérlő és megspórolt szilíciumterület
A hagyományos HBM memóriáknál a memóriavezérlőt a központi számítási lapkán (az XPU-n) helyezik el, ami értékes szilíciumterületet foglal el a processzormagok elől. Az NVHBM esetében az Nvidia gyökeresen megváltoztatta ezt a megközelítést: az egyedi memóriavezérlőt és a fizikai interfészt áthelyezte közvetlenül a háromdimenziós HBM memóriastack alaplapkájára.
Ez a szerkezeti módosítás komoly előnyökkel jár a chiptervezők számára:
- Akár 30 százalékkal nagyobb memória-sávszélességet biztosít stackenként a HBM4E szabványhoz képest.
- Akár 15 százalékkal csökkenti a memóriarendszer energiafogyasztását, ami alacsonyabb hőtermelést eredményez.
- Akár 25 százalékkal több szilíciumterületet szabadít fel a fő számítási lapkán, amit további AI-mátrixegységekre vagy gyorsítótárra lehet fordítani.
- A fizikai interfész alapterületét akár 67 százalékkal zsugorítja, leegyszerűsítve az interposer huzalozását.
Nemcsak saját chipekhez: az NVLink Fusion szerepe
Az NVHBM az Nvidia saját, jövőbeli grafikus processzorai mellett az NVLink Fusion platform kiterjesztéseként külső felek számára is elérhetővé válik. A hyperscale adatközpont-üzemeltetők és egyedi AI-gyorsítókat fejlesztő vállalkozások így közvetlenül integrálhatják az Nvidia memóriatechnológiáját saját tervezésű chipeikbe.
A technológia első hivatalos partnere az Amazon kötelékébe tartozó Annapurna Labs lett. A cég a következő generációs Trainium AI-gyorsítóiban alkalmazza majd az NVHBM megoldást, összekapcsolva azt az NVLink Fusion architektúrával. Ez lehetővé teszi a felhőszolgáltató számára, hogy az egyedi chipeket és az Nvidia hardvereit egyetlen, közös keretrendszerben skálázza a gigawattos léptékű adatközpontokban.
A trillió paraméteres modellek korának elvárásai
A szuperszámítógépes és AI-munkaterhelések fejlődésével az ágensalapú rendszerek és a trillió paraméteres nyelvi modellek futtatása során már nem maga a számítási teljesítmény, hanem az adatok mozgatási sebessége jelenti a szűk keresztmetszetet. A modellsúlyok és az úgynevezett KV-cache állandó beolvasása folyamatos, nagykapacitású adatfolyamot igényel a memória és a feldolgozóegység között.
Az NVHBM által elért 15 százalékos fogyasztáscsökkenés nem csupán elméleti eredmény: adatközponti szinten komoly hűtési és áramellátási mozgásteret teremt. Egy ezer megawattos adatközpontban a felszabaduló energiakeret révén több ezer további gyorsítóegység állítható munkába. A memóriamodulok fizikai gyártását a nagy memóriagyártók – mint a Samsung, az SK Hynix és a Micron – végzik majd az Nvidia és partnerei specifikációi alapján.