Die nächste Generation künstlicher Intelligenz entsteht nicht auf einzelnen Chips, sondern in riesigen, rund um die Uhr laufenden AI Factories. Doch wer eigene XPUs entwickelt, steht vor einer gewaltigen Herausforderung: Neben dem Chip muss die gesamte Infrastruktur samt Netzwerk, Rack-Architektur und Software integriert werden. Mit NVLink Fusion schlägt NVIDIA nun eine Brücke zwischen maßgeschneiderten Prozessoren und seiner bewährten Weltklasse-Plattform.
Performance auf Factory-Niveau: Die Bedeutung von Scale-Up
Für moderne Workloads wie Billionen-Parameter-Modelle, Mixture-of-Experts-Architekturen und agentische KI ist das Netzwerk der entscheidende Hebel. Wenn das Scale-Up-Fabric nicht mithält, sinkt die Auslastung und die Kosten pro Token steigen. Eine leistungsfähige Scale-Up-Verbindung muss drei Dimensionen gleichzeitig erfüllen: durchgängige Netzwerkperformance, Resilienz für maximale Betriebszeiten sowie eine reife, bewährte Plattform.
Mit NVLink Fusion integriert NVIDIA maßgeschneiderte XPUs direkt in die NVLink-Domäne. Die sechste Generation von NVLink bietet führende Bandbreite bei minimaler Latenz für bis zu 72 XPUs. Die Ende-zu-Ende-Latenz für XPU-zu-XPU-Transfers liegt laut NVIDIA um den Faktor drei unter der von Standard-Ethernet-Lösungen, während die Paketrate zehnmal höher ausfällt. Diese Leistungsvorteile zeigen sich besonders im GB300 NVL72-System, das deutlich höheren Durchsatz pro GPU erzielt als Konfigurationen ohne NVL72.
NVLink-C2C optimiert die CPU-Anbindung
Ein weiterer Baustein ist NVLink-C2C. Diese Schnittstelle verbindet XPUs mit NVIDIAs Vera-CPUs oder anderen Ökosystem-Prozessoren und liefert laut Hersteller bis zu sechsmal höhere Energieeffizienz als PCIe. Damit entfallen klassische Engpässe zwischen Steuer- und Recheneinheiten, was besonders für agentische Systeme von Vorteil ist.
Bewährtes Ökosystem beschleunigt Markteinführung
Die Entwicklung eigener XPUs ist nur die halbe Miete. Teams unterschätzen häufig den Aufwand, einen Chip in die reale Rechenzentrumslandschaft zu überführen. Dazu zählen die Integration hochgeschwindigkeitsfähiger Schnittstellen, die Beschaffung valider Netzwerklösungen, das Design von Compute- und Switch-Trays sowie die Planung von Kühlung und Stromversorgung auf Rack-Ebene.
NVLink Fusion adressiert diese Komplexität durch ein umfassendes Partner-Ökosystem. Es umfasst Spezialisten für ASIC-Design, CPU-Integration sowie optische Verbindungen. Entwickler können sich so auf ihre Kerninnovation konzentrieren und greifen für den Rest auf erprobte Lösungen zurück.
MGX und die Vorteile automatisierter Fertigung
Adoptoren von NVLink Fusion profitieren zudem von der NVIDIA MGX Rack-Skala-Architektur und denselben Lieferketten, die bereits für Systeme wie Vera Rubin NVL72 genutzt werden. Herstellungspartner übernehmen Design und Integration, während MGX-Zulieferer die Bausteine für Gehäuse, Kühlung und die kommende 800-VDC-Stromversorgung bereitstellen. Jack Luoh von QCT betont, dass sich nahezu 100 Prozent der Automatisierung aus der Vera-Rubin-Fertigungslinie übertragen lassen, wenn die XPU NVLink Fusion nutzt.
Risikominimierung durch standardisierte Infrastruktur
Die Planung einer AI Factory beginnt lange vor der Verfügbarkeit des finalen Siliziums. Strombeschaffung, Gebäudedesign, Kühlkonzepte und Netzwerkarchitektur werden fixiert, noch bevor die genaue Beschleuniger-Mixtur steht. Ein Rechenzentrum, das auf einen einzigen Chiptyp festgelegt ist, wird zum Zeitplan-Risiko.
Denn unterschiedliche Workloads bevorzugen unterschiedliche Prozessoren: XPUs, GPUs, CPUs oder LPUs können je nach Anwendungsfall für Training, Post-Training, Reasoning oder Serving eingesetzt werden.
Einheitliche Architektur für GPU und XPU
Mit NVLink Fusion teilen sich XPU- und GPU-basierte Systeme wie Vera Rubin NVL72 identische Rack-Footprints, Netzwerke, Kühlung und Stromversorgung. Betreiber können den Ausbau vorantreiben und den genauen Silizium-Mix verschieben, sobald Workload-Nachfrage und Lieferlage es erfordern. So wird die Infrastruktur flexibel und zukunftssicher.
Die AI Factory als durchdesigntes Gesamtsystem
Factory-Ausbau ist teuer und Fehler führen zu kostspieligen Nacharbeiten. Deshalb muss die Infrastruktur vor dem Bau validiert werden. NVLink Fusion orientiert sich an der NVIDIA DSX Referenzarchitektur für AI Factories, die Gebäude, Strom, Kühlung, Compute und Netzwerk gemeinsam entwirft. Das NVIDIA Omniverse DSX AI Factory Blueprint bietet einen digitalen Zwilling und offenen Referenzentwurf für Gigawatt-große KI-Fabriken. Partner können Anlagen und Technologie vor dem Deployment gemeinsam modellieren.
Auf Rack-Ebene ist Wartbarkeit Teil der Performance. Referenz-Compute-Trays arbeiten zu 100 Prozent mit Flüssigkeitskühlung ohne Lüfter, Kabel oder Schläuche und lassen sich entnehmen, während der Rest des Racks weiterläuft. Auch NVLink Switch Trays sind flüssigkeitsgekühlt und unterstützen den laufenden Betrieb während Service-Einsätzen.
Software definiert den Fertigungsprozess
Die Software rundet das Fabrik-Konzept ab. NVIDIA NCCL für verteilte Workloads, NVIDIA Dynamo und NIXL für Disaggregation sowie NVIDIA Mission Control für Cluster-Management, Telemetrie und Debugging ermöglichen es, gemischte KI-Infrastruktur als koordiniertes Gesamtsystem zu betreiben.
Mit NVLink Fusion erhalten maßgeschneiderte XPUs Zugang zu einer Weltklasse-AI-Plattform. Hyperscaler und KI-native Unternehmen können so einheitliche, semi-individuelle AI Factories errichten, die die Stärken vieler Entwickler in eine Infrastruktur bündeln, die keine Einzelfirma allein aufbauen könnte.
Quelle: https://blogs.nvidia.com/blog/nvlink-fusion-xpu-ai-factory/