Mit NVIDIA Nemotron 3.5 Lightning startet ein neues Kapitel für lokal betriebene KI-Agenten. Das 30-Milliarden-Parameter-Modell ist ab sofort über Ollama verfügbar und arbeitet komplett auf Ihrem eigenen Gerät. Dank einer effizienten Mixture-of-Experts-Architektur bleiben pro Token nur drei Milliarden Parameter aktiv. Erfahren Sie hier, welche Anwendungen sich damit direkt auf Ihrem Rechner umsetzen lassen.
Agentische KI direkt auf Ihrem Rechner
Nemotron 3.5 Lightning wurde gezielt für Agenten entwickelt, die über längere Zeit aktiv bleiben. Das Modell übernimmt Aufgaben wie das Lesen von Dateien, das Aufrufen von Werkzeugen, das Sortieren von Ergebnissen und das wiederholte Ausführen fehlgeschlagener Schritte. Da der Großteil dieser Prozesse kein großes Modell benötigt, profitiert die Architektur mit drei Milliarden aktiven Parametern pro Token von einem effizienten Ressourceneinsatz.
Der lokale Betrieb bringt einen entscheidenden Vorteil mit sich: Ihre Daten verlassen das Gerät nicht. Das ist besonders für sensible Workflows in Unternehmen und bei persönlichen Assistenten relevant.
Das können Sie mit Nemotron 3.5 Lightning aufbauen
Langlebige persönliche Assistenten
Egal ob E-Mails, Kalender, Projekte oder Buchungen: Ein lokaler Agent greift auf Kontextdaten vor Ort zu und sendet keine Informationen in die Cloud. Das schafft Vertrauen und Sicherheit im Alltag.
Coding Sub-Agenten
Entwickler können das Modell für wiederkehrende Aufgaben im Code nutzen. Dazu gehören das Ausführen von Tests, das Durchsuchen der Codebasis und automatisierte Refactorings direkt in den gewohnten Werkzeugen.
Security Operations
Im Sicherheitsbereich bereichert Nemotron 3.5 Lightning Alarme, klassifiziert Vorfälle, durchsucht Logs und korreliert Indikatoren. Die Ergebnisse werden strukturiert für Analysten aufbereitet.
Lokale Ebene ergänzt die Cloud
Das Modell eignet sich hervorragend als lokale Schicht neben cloudbasierten Großmodellen. Hohe Schrittanzahlen übernimmt Nemotron 3.5 Lightning vor Ort, während komplexe Einzelschritte an ein gehostetes Modell übergeben werden. CLI und API bleiben dabei identisch.
Individuelle Spezialisten trainieren
Da Gewichte und Trainingsdaten offen liegen, können Entwickler das Modell für spezifische Aufgaben nachtrainieren und das Ergebnis lokal oder im Datacenter betreiben.
Technische Highlights im Überblick
Effiziente Architektur für lokale Hardware
Insgesamt verfügt das Modell über 30 Milliarden Parameter, von denen pro Token nur drei Milliarden aktiv sind. Das macht den Betrieb auf NVIDIA RTX PCs, RTX PRO Workstations, NVIDIA DGX Spark und DGX Station ebenso möglich wie in Cloud- und Datacenter-Umgebungen.
Riesiger Kontext und optimierte Inferenz
Mit einer Kontextlänge von bis zu einer Million Token bleibt selbst der Verlauf langer Tool-Historien über mehrere Arbeitsschritte hinweg verfügbar. Zusätzlich beschleunigt spekulatives Decoding mit Multi-Token-Prediction die Inferenz und liefert bis zu vier Mal höheren Durchsatz als vergleichbare offene Modelle.
Offene Gewichte für maximale Flexibilität
Nemotron 3.5 Lightning ist ein offenes Modell, das auf offenen Datensätzen trainiert wurde. Entwickler können es frei anpassen und von der Edge bis zum Datacenter überall einsetzen.
So starten Sie mit Ollama
Der Einstieg gelingt über die Ollama-Plattform. Nach dem Download steht das Modell für verschiedene Anwendungen bereit.
Allgemeiner Chat:
ollama run nemotron-3.5-lightning
Claude Code:
ollama launch claude --model nemotron-3.5-lightning
OpenClaw:
ollama launch openclaw --model nemotron-3.5-lightning
Hermes Agent:
ollama launch hermes --model nemotron-3.5-lightning
OpenCode:
ollama launch opencode --model nemotron-3.5-lightning
Nutzer mit Apple-Silicon-Hardware erhalten das Modell unter der Bezeichnung nemotron-3.5-lightning:30b-mlx mit modernster Performance. Auch der Betrieb in der Ollama-Cloud ist möglich, sodass einzelne Agentenschritte bei Bedarf nahtlos an ein größeres Modell übergeben werden können.
Benchmarks und Fazit
Laut NVIDIA bietet Nemotron 3.5 Lightning einen viermal höheren Durchsatz und eine um 30 Prozent schnellere Aufgabenbearbeitung als andere führende offene Modelle vergleichbarer Größe. Für laufende Agenten ist Durchsatz die entscheidende Kennzahl: Je mehr Schritte pro Minute erledigt werden, desto schneller kommen komplexe Aufgaben zum Abschluss.