Die Zukunft der Künstlichen Intelligenz findet zunehmend direkt auf unseren Geräten statt. Auf der IFA 2026 präsentiert NVIDIA gemeinsam mit Microsoft und Partnern eine neue Generation an Tools und Hardware, die lokale KI-Agenten einfacher, schneller und leistungsfähiger denn je machen. Mit dem kommenden RTX Spark Windows PC sowie innovativen Softwarelösungen wie NVIDIA PAIR rückt die Agentic AI direkt in den heimischen Arbeitsplatz.
Vereinfachter Einstieg in lokale KI-Agenten
Bislang erforderte die Einrichtung lokaler KI-Agenten erheblichen Konfigurationsaufwand. Die Auswahl passender Modelle, die Optimierung von Quantisierungseinstellungen und die manuelle Aktualisierung gehören jedoch bald der Vergangenheit an. Drei der populärsten Agenten-Anwendungen ermöglichen nun eine vereinfachte Einrichtung auf Windows-Systemen mit NVIDIA GPUs.
Perplexity Portable Computer
Perplexity hat mit dem Portable Computer einen Agenten vorgestellt, der komplette Workflows lokal auf Linux-Systemen wie dem NVIDIA DGX Spark ausführt. Die Anwendung ist für NVIDIA RTX GPUs mit mindestens 24 GB VRAM verfügbar und ermöglicht die Nutzung lokaler Modelle ohne Verbrauch von Cloud-Credits. Nutzer können bei Bedarf selektiv auf Cloud-Modelle zugreifen, wobei sensible Daten stets auf dem eigenen Gerät bleiben.
Hermes Agent
Hermes Agent von Nous Research ist ein universeller Agent mit Fokus auf Zuverlässigkeit und Selbstverbesserung. Die Software erkennt automatisch die verbaute NVIDIA GPU, wählt ein passendes Modell aus und integriert llama.cpp mit NVIDIA-Optimierungen. Damit entfällt das manuelle Herunterladen und Feintuning der Modelle.
OpenClaw
Als größtes KI-Projekt auf GitHub setzt OpenClaw Maßstäbe in der Open-Source-Agentenbewegung. NVIDIA und Microsoft haben zusammengearbeitet, um die Windows-App zu optimieren. Nutzer mit RTX GPUs ab 24 GB VRAM können so lokal optimierte Modelle mit deutlich reduziertem Einrichtungsaufwand betreiben.
Bis zu 1,9x schnellere lokale Inferenz
Die Reaktionsgeschwindigkeit lokaler Agenten ist entscheidend für die Nutzererfahrung. Neue Optimierungen in llama.cpp und vLLM liefern hier erhebliche Fortschritte. Durch Kernel-Optimierungen und verbesserte speculative decoding Techniken erreicht llama.cpp auf einer GeForce RTX 5090 bis zu 1,9x höheren Durchsatz. vLLM steigert die Leistung auf der RTX PRO 6000 Blackwell Workstation Edition um das 1,2-fache und auf zwei gekoppelten DGX Spark Systemen sogar um das 1,4-fache.
NVIDIA PAIR: Intelligente Verteilung im Heimnetzwerk
Da viele Haushalte über mehrere PCs verfügen, deren Rechenleistung häufig brachliegt, bietet NVIDIA mit PAIR (Personal AI Router) eine clevere Lösung. Die kostenlose Open-Source-Software verteilt KI-Inferenz-Anfragen automatisch auf alle kompatiblen PCs im lokalen Netzwerk. PAIR erkennt verfügbare Systeme dynamisch und routet Aufgaben an freie Ressourcen. So lassen sich Agenten-Aufgaben parallelisieren, während der Hauptrechner weiterhin für Gaming oder andere Anwendungen genutzt werden kann.
Kreative KI direkt auf dem Gerät
Neben Agenten profitieren auch Kreativanwendungen von der lokalen KI-Leistung. CyberLinks PhotoDirector AI PC Mode integriert Diffusionsmodelle direkt in die Bildbearbeitungssoftware. Nutzer können Objekte entfernen, Hintergründe ersetzen und neue Bildinhalte generieren, wobei die Verarbeitung lokal auf dem RTX Spark unter Nutzung von TensorRT-RTX und FP8 beschleunigt wird.
NVIDIA RTX Spark ab Oktober 2026 verfügbar
Im Oktober 2026 startet die neue Ära der Windows PCs mit NVIDIA RTX Spark. Die Systeme vereinen eine 1-Petaflop RTX Blackwell GPU, bis zu 128 GB unified Memory und einen effizienten 20-Kern Grace CPU. Neben kompakten Desktop-Rechnern von Acer und Laptops wie dem Lenovo Yoga Pro 9n ermöglicht die Plattform dünnere Geräte mit ganztägiger Akkulaufzeit. Zudem wurden Blockbuster-Titel von Electronic Arts, Embark Studios und Ubisoft für RTX Spark angekündigt.
Weitere Modelle für lokale KI
Außerdem stellte NVIDIA im August mehrere neue Modelle vor, die lokal auf RTX PCs, DGX Spark und DGX Station laufen. Dazu zählen Nemotron 3.5 Lightning mit 30 Milliarden Parametern, Meta Muse Glimmer für Coding-Workloads, DeepSeek v4 Flash mit 284 Milliarden Parametern sowie verschiedene Multimodal-Modelle wie GLM-5.3-Flash und Qwen3.8-Flash-Next. Auch für die lokale Videogeneration mit LTX 2.5 und MiniMax-H3 stehen nun spezialisierte Werkzeuge bereit.
Quelle: NVIDIA Blog