Mit der NVIDIA Vera Rubin NVL72 setzt das Unternehmen neue Maßstäbe für KI-Inference-Systeme. Die aktuellen MLPerf Inference v6.1 Ergebnisse zeigen bis zu 3,7 Mal höheren Durchsatz gegenüber der Vorgängergeneration. Unternehmen profitieren so von deutlich höherer Effizienz und niedrigeren Kosten pro generiertem Token. Im Folgenden erfahren Sie alle Details zu den Benchmark-Ergebnissen.
NVIDIA Vera Rubin NVL72 feiert Premiere bei MLPerf Inference
Das neue Vera Rubin NVL72 System hat bei seiner ersten MLPerf Inference Teilnahme sofort die Spitzenposition eingenommen. In den anspruchsvollen Benchmarks DeepSeek-R1 und Qwen3-VL liefert die Plattform beeindruckende Ergebnisse. Der Durchsatz liegt bei Qwen3-VL bis zu 3,7 Mal höher als bei der GB300 NVL72.
Bei DeepSeek-R1 beträgt der Vorsprung immerhin das 2,5-Fache. Diese Performance wurde unter anderem mit vLLM und dem Open-Source Framework NVIDIA Dynamo erzielt. Für Unternehmen bedeutet dies mehr generierte Tokens, höhere Nutzerzahlen und bessere Umsatzchancen pro Rack.
Full-Stack-Design als Erfolgsfaktor
Die Ergebnisse basieren auf einer durchgängigen Codesign-Strategie über Hard- und Software. Vera Rubins verbesserte Tensor Cores und die Transformer Engine beschleunigen sowohl die Prefill- als auch die Decode-Phase der Inference. Das NVFP4-Format reduziert zusätzlich den Speicherbedarf für Modellgewichte, Attention und KV Cache bei minimaler Qualitätseinbuße.
Disaggregated Serving und NVLink der sechsten Generation
Ein zentraler Bestandteil der Architektur ist das Disaggregated Serving. Prefill und Decode werden dabei getrennt, während großangelegtes Expert Parallelism die Mixture-of-Experts Layer optimal ausnutzt. Die sixth-generation NVLink und NVLink Switch liefern die dafür nötige Infrastruktur mit zehn Mal höheren Paketraten und dreimal niedrigerer Latenz als Standard-Ethernet.
GB300 NVL72 überzeugt mit branchenführender Skalierungseffizienz
Neben dem neuen Flaggschiff zeigen auch die GB300 NVL72 Ergebnisse eindrucksvolle Werte. Eine Konfiguration mit vier Racks und 288 GPUs erreichte im Offline-Szenario eine Skalierungseffizienz von 99 Prozent. Der Durchsatz wächst damit nahezu linear mit der hinzugefügten Hardware.
Diese Effizienz ist entscheidend für die Wirtschaftlichkeit. Würde die Leistung nicht proportional steigen, entstünden schnell unverhältnismäßig hohe Infrastrukturkosten. Die Architektur, Interconnects und Software müssen also im Einklang skalieren.
Auch beim WAN 2.2 Text-to-Video Benchmark überzeugt die GB300 NVL72. Ein Rack erzeugt 0,65 720p-Videos pro Sekunde bei 5,7 Sekunden Länge pro Video. Das entspricht einer neunfachen Durchsatzsteigerung bei 7,5 Mal niedrigerer Latenz gegenüber einem Einzelnode.
Kontinuierliche Software-Optimierung als Wachstumsmotor
Die NVIDIA Plattform profitiert massiv von kontinuierlicher Softwareentwicklung. Im direkten Vergleich zwischen MLPerf Inference v6.0 und v6.1 steigerte sich die Performance der GB300 NVL72 beim Qwen3-VL Benchmark um bis zu das 1,6-Fache. Die Optimierungen umfassen präziseren KV Cache, zusätzliche Kernel Fusion und verbesserte Kernel.
Auch nach der offiziellen Einreichung der v6.1 Ergebnisse arbeitete NVIDIA weiter. Erste nicht verifizierte Post-Submission Tests bei GPT-OSS-120B und DLRMv3 zeigen weitere Leistungszuwächse.
Ökosystem und Inference in jeder Skalierungsstufe
Das breite Partner-Ökosystem unterstreicht die Plattformreife. Insgesamt 19 Partner reichten Ergebnisse ein, darunter ASUS, Azure, Cisco, Dell Technologies, HPE, Oracle Cloud Infrastructure und weitere. Auch Nebius zeigte mit Vera Rubin NVL72 Preview-Ergebnissen exzellente Performance.
Zusätzlich zu den Datacenter-Ergebnissen präsentierte NVIDIA mit dem Jetson AGX Thor Ergebnisse im Edge-Bereich. Gemeinsam zeigt die Plattform, dass NVIDIA die Inference-Performance über das gesamte Technologie-Stack hinweg kontinuierlich vorantreibt.
Fazit
Die MLPerf Inference v6.1 Ergebnisse belegen eindrucksvoll die Leistungsfähigkeit der NVIDIA Vera Rubin NVL72 und GB300 NVL72. Mit branchenführender Performance, nahezu linearer Skalierung und kontinuierlichen Software-Verbesserungen bietet die Plattform Unternehmen eine erstklassige Grundlage für ihre KI-Infrastruktur.
Quelle: NVIDIA Blog