Rendkívüli tempóra kapcsolt az AI-generálás, amióta az Nvidia munkába állította a Groq 3 LPX architektúrát. A Hot Chips 2026 szimpóziumon leleplezett szerverállvány az első független mérések alapján négyszer gyorsabb válaszadásra képes a legközelebbi versenytársánál.
Igor Arsovski, az Nvidia hardverért felelős alelnöke – aki korábban a Groq vezető architektje volt – személyesen ismertette a szilícium felépítését. A prezentáció során elhangzott, hogy a Samsung Foundry 4 nanométeres eljárásával gyártott LP30 chipekre épülő rendszer tömeggyártása már elindult, és az első megrendelők hamarosan rendszerbe állíthatják az egységeket.
A tisztán SRAM memóriára épülő LP30 chipek működése
A hagyományos grafikus processzorokkal szemben a Groq 3 LPX teljesen szakít a nagy sávszélességű HBM memóriákkal. Minden egyes LP30 chip 500 megabájtnyi chipen belüli SRAM memóriát hordoz, így a 256 chipet tartalmazó teljes szerverállvány összességében 128 gigabájtnyi ultra-gyors tárhelyet biztosít. Ez a kialakítás megszünteti a memória-hozzáférési szűk keresztmetszeteket, amelyek a tokenek egymás utáni generálásakor lelassítják a nyelvi modelleket.
A determinisztikus architektúra kiküszöböli a gyorsítótárak és a fiókbecslések bizonytalanságát. A fordítóprogram órajel-ciklus pontossággal előre ütemezi az adatok útját, így a válaszidő ingadozása nullára csökken. A folyadékhűtéses szerverállvány 315 PFLOPS FP8 számítási kapacitást és másodpercenként 40 petabájtos aggregált SRAM sávszélességet tesz elérhetővé.
Független tesztek igazolják a Groq 3 LPX fölényét
A rendezvényen nyilvánosságra hozták az Artificial Analysis első, független méréseken alapuló teszteredményeit is. A mérések során a nyílt forráskódú Gemma 4 31B modellt futtatták 100 ezer tokenes kontextusablak mellett. A Groq 3 LPX elképesztő, másodpercenkénti 3431 tokenes kimeneti sebességet ért el egymás utáni kérések feldolgozása során.
Összehasonlításképpen a jelenleg elérhető leggyorsabb nyilvános felhős végpont ugyanezen a teszten 870 tokent tudott generálni másodpercenként. A különbség rámutat arra, hogy a speciális következtetési célhardverek mennyivel hatékonyabban szolgálják ki az autonóm AI-ágensek folyamatos és azonnali válaszadást igénylő feladatait.
Párhuzamos feladatmegosztás a Vera Rubin platformmal
Az Nvidia nem a hagyományos GPU-k kiváltására, hanem azok kiegészítésére tervezte a rendszert. A Vera Rubin NVL72 architektúrával együttműködve a Rubin GPU-k végzik a bemeneti adatok tömeges feldolgozását, míg a Groq 3 LPX társprocesszorként veszi át a rendkívül alacsony késleltetést igénylő válaszgenerálási szakaszt.
Ez a kétkomponensű felépítés drasztikusan csökkenti az adatközpontok energiafogyasztását és az egy válaszra jutó költségeket. A nagy komplexitású kódolási és elemzési feladatoknál az eddigi órák helyett percekre rövidül a végrehajtási idő, ami alapjaiban alakítja át az elosztott AI-rendszerek skálázhatóságát.