Nvidia NVHBM: áttörést hozó memóriatechnológia az AI gyorsítók piacán

NVHBM

Sajátos memóriatechnológiával törné át a mesterséges intelligencia lapkák fizikai korlátait a zöldek óriása. Az Nvidia bemutatta az NVHBM architektúrát, amely jelentős előrelépést ígér a hagyományos HBM4E megoldásokhoz képest. Az új kialakítás közvetlenül az AI-gyorsítók legszűkebb keresztmetszetét, a memória-sávszélességet és a fogyasztást veszi célba.

Áthelyezett vezérlő és megspórolt szilíciumterület

A hagyományos HBM memóriáknál a memóriavezérlőt a központi számítási lapkán (az XPU-n) helyezik el, ami értékes szilíciumterületet foglal el a processzormagok elől. Az NVHBM esetében az Nvidia gyökeresen megváltoztatta ezt a megközelítést: az egyedi memóriavezérlőt és a fizikai interfészt áthelyezte közvetlenül a háromdimenziós HBM memóriastack alaplapkájára.

Ez a szerkezeti módosítás komoly előnyökkel jár a chiptervezők számára:

  • Akár 30 százalékkal nagyobb memória-sávszélességet biztosít stackenként a HBM4E szabványhoz képest.
  • Akár 15 százalékkal csökkenti a memóriarendszer energiafogyasztását, ami alacsonyabb hőtermelést eredményez.
  • Akár 25 százalékkal több szilíciumterületet szabadít fel a fő számítási lapkán, amit további AI-mátrixegységekre vagy gyorsítótárra lehet fordítani.
  • A fizikai interfész alapterületét akár 67 százalékkal zsugorítja, leegyszerűsítve az interposer huzalozását.

Nemcsak saját chipekhez: az NVLink Fusion szerepe

Az NVHBM az Nvidia saját, jövőbeli grafikus processzorai mellett az NVLink Fusion platform kiterjesztéseként külső felek számára is elérhetővé válik. A hyperscale adatközpont-üzemeltetők és egyedi AI-gyorsítókat fejlesztő vállalkozások így közvetlenül integrálhatják az Nvidia memóriatechnológiáját saját tervezésű chipeikbe.

A technológia első hivatalos partnere az Amazon kötelékébe tartozó Annapurna Labs lett. A cég a következő generációs Trainium AI-gyorsítóiban alkalmazza majd az NVHBM megoldást, összekapcsolva azt az NVLink Fusion architektúrával. Ez lehetővé teszi a felhőszolgáltató számára, hogy az egyedi chipeket és az Nvidia hardvereit egyetlen, közös keretrendszerben skálázza a gigawattos léptékű adatközpontokban.

A trillió paraméteres modellek korának elvárásai

A szuperszámítógépes és AI-munkaterhelések fejlődésével az ágensalapú rendszerek és a trillió paraméteres nyelvi modellek futtatása során már nem maga a számítási teljesítmény, hanem az adatok mozgatási sebessége jelenti a szűk keresztmetszetet. A modellsúlyok és az úgynevezett KV-cache állandó beolvasása folyamatos, nagykapacitású adatfolyamot igényel a memória és a feldolgozóegység között.

Az NVHBM által elért 15 százalékos fogyasztáscsökkenés nem csupán elméleti eredmény: adatközponti szinten komoly hűtési és áramellátási mozgásteret teremt. Egy ezer megawattos adatközpontban a felszabaduló energiakeret révén több ezer további gyorsítóegység állítható munkába. A memóriamodulok fizikai gyártását a nagy memóriagyártók – mint a Samsung, az SK Hynix és a Micron – végzik majd az Nvidia és partnerei specifikációi alapján.