NVIDIA Vera Rubin NVL72: MLPerf-debüt 3,7x teljesítménnyel

Az NVIDIA Vera Rubin NVL72 platform első alkalommal szerepelt az MLPerf Inference v6.1 tesztsorozatban, és már debütálásakor kiemelkedő eredményeket produkált: a Qwen3-VL modellen akár 3,7-szeres, a DeepSeek-R1 modellen pedig akár 2,5-szeres áteresztőképességet mutatott a korábbi GB300 NVL72 rendszerhez képest. A 2026. szeptember 16-án publikált eredmények egyben azt is megmutatják, hogyan épül fel az NVIDIA teljes AI-infrastruktúra-stratégiája a hardveres, szoftveres és hálózati optimalizáció egységes rendszerébe.

A Vera Rubin NVL72 MLPerf-debütje: mit mutatnak a számok?

Az NVIDIA a v6.1-es MLPerf Inference tesztsorozat Closed Division kategóriájában két különösen igényes benchmarkon indította el a Vera Rubin NVL72 előzetes (preview) eredményeit: a DeepSeek-R1 és a Qwen3-VL modelleken. Az eredmények az mlcommons.org oldalon 2026. szeptember 16-án kerültek közzétételre (bejegyzések: 6.1-0106 és 6.1-0074).

  • Qwen3-VL: a Vera Rubin NVL72 akár 3,7-szeres áteresztőképességet ért el a GB300 NVL72-höz képest offline, szerver és interaktív forgatókönyvekben egyaránt, a vLLM keretrendszert és az NVIDIA Dynamo nyílt forráskódú inferencia-keretrendszert használva.
  • DeepSeek-R1: az NVIDIA TensorRT-LLM könyvtárral a Vera Rubin NVL72 akár 2,5-szeres áteresztőképességet produkált a GB300 NVL72-höz képest.
  • Agentic AI benchmark (SemiAnalysis AgentX): előzetes tesztelésben a Vera Rubin NVL72 30-szoros teljesítményt nyújtott a GB300 NVL72-höz képest az ágenstípusú AI-feladatokon.

A magasabb áteresztőképesség közvetlen üzleti következménnyel jár: egyetlen Vera Rubin NVL72 rack több tokent generál, több felhasználót képes kiszolgálni, és alacsonyabb az egy tokenre jutó költség, mint egy GB300 NVL72 rack esetén. Ez az NVIDIA AI-infrastruktúra hatékonyságnövelési törekvéseibe is illeszkedik, amelynek keretében a vállalat folyamatosan optimalizálja a teljesítmény és az energiafelhasználás arányát.

Vera Rubin NVL72: a teljes hardver-szoftver kodesign mögött

A kiemelkedő eredmények hátterében az NVIDIA által „full-stack codesign”-nak nevezett megközelítés áll, amely a hardver és a szoftver együttes tervezését jelenti. A Vera Rubin platform főbb műszaki jellemzői:

  • Fejlesztett Tensor Core-ok és Transformer Engine: mind az inferencia prefill (előkészítő), mind a decode (dekódoló) fázisát gyorsítják.
  • NVFP4 precizitás: csökkenti a memóriaigényt a modellsúlyok, az attention mechanizmus és a KV cache esetében, miközben az eredmény minősége minimálisan romlik, az áteresztőképesség viszont nő.
  • Disaggregated serving (szétválasztott kiszolgálás): a prefill és decode fázisok elkülönített kezelése, nagy léptékű expert párhuzamossággal a mixture-of-experts rétegekhez – ez különösen hatékony olyan modellekben, mint a DeepSeek-R1 és a Qwen3-VL.
  • Hatodik generációs NVIDIA NVLink és NVLink Switch: a NVL72 skálázási tartományában 10-szeres csomagátviteli sebességet és 3-szoros kisebb késleltetést biztosít a sima Ethernethez képest.

A NVLink-alapú rack-szintű összeköttetés lehetővé teszi, hogy ezek a technikák rack-szinten is hatékonyan működjenek. A Nebius is benyújtott Vera Rubin NVL72 előzetes eredményeket, és szintén kiváló teljesítményt mutatott.

GB300 NVL72: 99%-os skálázási hatékonyság négy rack felett

A Vera Rubin mellett az NVIDIA a GB300 NVL72 rendszer skálázási hatékonyságát is demonstrálta. A DeepSeek-R1 benchmarkon egyetlen GB300 NVL72 rack (72 GPU) eredményét hasonlították össze négy összefűzött rack (288 GPU) teljesítményével.

  • A négy rack konfigurációja 99%-os skálázási hatékonyságot ért el az offline forgatókönyvben: az áteresztőképesség majdnem arányosan nőtt a hozzáadott hardverrel (bejegyzések: 6.1-0073 és 6.1-0074).
  • A WAN 2.2 szöveg-videó benchmarkon a GB300 NVL72 egyetlen csomóponthoz képest 9-szeres áteresztőképességet és 7,5-szeres kisebb késleltetést ért el rack-szinten, 0,65 darab 720p videót generálva másodpercenként, videónként 5,7 másodperc alatt.

A skálázási hatékonyság azért kulcsfontosságú, mert a GPU-szám növelése önmagában nem garantálja az arányos teljesítménynövekedést. Ha kétszer annyi GPU csupán egyszámjegyű százalékos javulást hozna, az infrastruktúra-költség messze meghaladná a teljesítmény-hozamot.

Szoftveroptimalizáció és ökoszisztéma: folyamatos fejlődés

Az NVIDIA hangsúlyozza, hogy a platform értékét nem csak a hardver, hanem a folyamatos szoftverfejlesztés is növeli. A v6.1-es eredmények a v6.0-hoz képest akár 1,6-szoros teljesítményjavulást mutatnak a GB300 NVL72 Qwen3-VL benchmarkján. Az elért nyereség forrásai:

  • Alacsonyabb KV cache precizitás
  • További kernel fúzió
  • Fejlettebb kernelek
  • Szétválasztott kiszolgálás vLLM-mel és NVIDIA Dynamo-val

A v6.1-es benyújtási határidő után is folytatódtak az optimalizációk. A GPT-OSS-120B és DLRMv3 modelleken elért post-submission eredmények – amelyeket az MLCommons még nem hitelesített – további teljesítménynyereséget mutatnak.

Az NVIDIA ökoszisztéma-partnerei széleskörűen részt vettek a tesztsorozatban: összesen 19 partner nyújtott be eredményeket, köztük nyolc multi-node Blackwell NVL72 rendszereken. A résztvevők között szerepel az ASUS, az Azure, a Cisco, a CoreWeave, a Crusoe, a Dell Technologies, a Fujitsu, a Giga Computing, a HPE, az Inventec, a Lambda, a MiTAC Computing, a Nebius, az Oracle Cloud Infrastructure, a Quanta Cloud Technology, a Red Hat, a ScitiX, a Supermicro és a Wiwynn.

Az edge-eszközök oldalán az NVIDIA a Jetson AGX Thor platformon is benyújtott eredményeket az újonnan bevezetett Edge-Agentic benchmarkon, NVIDIA TensorRT Edge-LLM-et alkalmazva a Qwen3.6-27B modellel. Az NVIDIA célja tehát, hogy a kompakt peremhálózati eszközöktől a legnagyobb AI-gyárakig egyaránt vezető teljesítményt kínáljon – amit az ipari és közlekedési alkalmazások területén is egyre inkább kamatoztatni kívánnak.

Gyakori kérdések

Melyik modelleken tesztelte az NVIDIA a Vera Rubin NVL72-t az MLPerf v6.1-ben?

Az NVIDIA két benchmark-on indított előzetes (preview) eredményeket: a DeepSeek-R1 és a Qwen3-VL modelleken, mindkettő az MLPerf Inference v6.1 Closed Division kategóriájában szerepel.

Mit jelent a 99%-os skálázási hatékonyság a GB300 NVL72 esetén?

Azt jelenti, hogy négy GB300 NVL72 rack (288 GPU) összekapcsolásakor az áteresztőképesség majdnem pontosan arányosan nőtt a hozzáadott hardverhez képest – vagyis a GPU-kapacitás bővítése szinte teljesen hasznosul, nem vész el a koordinációs veszteségekben.

Miért releváns az agentic AI teljesítménye az MLPerf összefüggésében?

Az AI ágensek több lépésen át gondolkodnak, terveznek és cselekednek, ami eltérő mérési módszertant igényel a hagyományos áteresztőképességi benchmarkoktól. Az MLCommons hamarosan bevezeti az MLPerf Endpoints benchmarkot, amely már standardizált mérést kínál az agentic inferencia-terhelésekre.

Milyen szoftvereszközöket használt az NVIDIA a Vera Rubin teszteléséhez?

A Qwen3-VL benchmarkon a vLLM keretrendszert és az NVIDIA Dynamo nyílt forráskódú inferencia-keretrendszert alkalmazták, míg a DeepSeek-R1 teszteléséhez az NVIDIA TensorRT-LLM könyvtárat használták.

Forrás: NVIDIA Blog

Ha tetszett a cikk, kérlek oszd meg mással is:

Kategóriák

További cikkeink

2025.03.24.
Brutális sebesség jön az SSD-knél – a PCIe 7.0 hozza el a 512 GB/s korszakát
A technológia folyamatosan gyorsul, de a PCI Express 7.0 szabvány bevezetésével…
2025.02.27.
Kibertámadás áldozatai lettek népszerű Chrome-bővítmények – 3,2 millió felhasználó érintett
Egy nagyszabású kibertámadás során hackerek feltörtek 16 népszerű Chrome-bővítményt, köztük az…
2025.02.19.
90%-os kedvezmény: Népszerű lopakodós játék mindössze 2 dollárért a Steamen
A játékosok most hatalmas kedvezménnyel szerezhetik be az egyik legnépszerűbb ’stealth’…
HP ZBook Ultra G3a: Gorgon Halo mobil munkaállomás
Kép: Guru3D
2026.09.17.
HP ZBook Ultra G3a: Gorgon Halo mobil munkaállomás
A HP októberben dobja piacra a ZBook Ultra G3a mobil munkaállomást,…
NVIDIA Vera Rubin és DSX: AI-gyár-hatékonyság a csúcson
Kép: NVIDIA Blog
2026.09.17.
NVIDIA Vera Rubin és DSX: AI-gyár-hatékonyság a csúcson
Az AI Infra Summit 2026 legfontosabb NVIDIA-újdonságai: Vera Rubin NVL72, DSX…
NVIDIA B200 GPU: 58%-kal drágább, mint volt
Kép: Wccftech
2026.09.17.
NVIDIA B200 GPU: 58%-kal drágább, mint volt
Az NVIDIA B200 GPU-k jelenlegi másodpiaci értéke 58%-kal meghaladja az eredeti…
2026.09.17.
AI Energy Management Alliance: NVIDIA, Google és Emerald AI
Az NVIDIA, a Google és az Emerald AI megalapította az AI…
Lenovo modernizálja a virtualizációs infrastruktúrát
Kép: Lenovo StoryHub
2026.09.17.
Lenovo modernizálja a virtualizációs infrastruktúrát
A Lenovo három új megoldással bővíti vállalati portfólióját: ThinkAgile VX850 V4…
Patriot Viper Steel 5 DDR5: 7600 MT/s ASUS ROG kiadás
Kép: Guru3D
2026.09.16.
Patriot Viper Steel 5 DDR5: 7600 MT/s ASUS ROG kiadás
A Patriot Memory bemutatta a Viper Steel 5 Infinite RGB DDR5…
NVIDIA DSX: 24%-kal több AI teljesítmény ugyanannyi áramból
Kép: NVIDIA Blog
2026.09.16.
NVIDIA DSX: 24%-kal több AI teljesítmény ugyanannyi áramból
Az NVIDIA DSX platform bebizonyította: intelligens energiagazdálkodással 24%-kal több token-átbocsátás érhető…
RTX 5090 ára $9000 felett, RTX 6000 2027-ben?
Kép: TechRadar
2026.09.16.
RTX 5090 ára $9000 felett, RTX 6000 2027-ben?
Az RTX 5090 egyes modelljei már $9 659-ért kaphatók, miközben egy…