NVIDIA Nemotron 3.5 Lightning: KI-Agenten lokal mit Ollama betreiben

AI generated

Mit NVIDIA Nemotron 3.5 Lightning startet ein neues Kapitel für lokal betriebene KI-Agenten. Das 30-Milliarden-Parameter-Modell ist ab sofort über Ollama verfügbar und arbeitet komplett auf Ihrem eigenen Gerät. Dank einer effizienten Mixture-of-Experts-Architektur bleiben pro Token nur drei Milliarden Parameter aktiv. Erfahren Sie hier, welche Anwendungen sich damit direkt auf Ihrem Rechner umsetzen lassen.

Agentische KI direkt auf Ihrem Rechner

Nemotron 3.5 Lightning wurde gezielt für Agenten entwickelt, die über längere Zeit aktiv bleiben. Das Modell übernimmt Aufgaben wie das Lesen von Dateien, das Aufrufen von Werkzeugen, das Sortieren von Ergebnissen und das wiederholte Ausführen fehlgeschlagener Schritte. Da der Großteil dieser Prozesse kein großes Modell benötigt, profitiert die Architektur mit drei Milliarden aktiven Parametern pro Token von einem effizienten Ressourceneinsatz.

Der lokale Betrieb bringt einen entscheidenden Vorteil mit sich: Ihre Daten verlassen das Gerät nicht. Das ist besonders für sensible Workflows in Unternehmen und bei persönlichen Assistenten relevant.

Das können Sie mit Nemotron 3.5 Lightning aufbauen

Langlebige persönliche Assistenten

Egal ob E-Mails, Kalender, Projekte oder Buchungen: Ein lokaler Agent greift auf Kontextdaten vor Ort zu und sendet keine Informationen in die Cloud. Das schafft Vertrauen und Sicherheit im Alltag.

Coding Sub-Agenten

Entwickler können das Modell für wiederkehrende Aufgaben im Code nutzen. Dazu gehören das Ausführen von Tests, das Durchsuchen der Codebasis und automatisierte Refactorings direkt in den gewohnten Werkzeugen.

Security Operations

Im Sicherheitsbereich bereichert Nemotron 3.5 Lightning Alarme, klassifiziert Vorfälle, durchsucht Logs und korreliert Indikatoren. Die Ergebnisse werden strukturiert für Analysten aufbereitet.

Lokale Ebene ergänzt die Cloud

Das Modell eignet sich hervorragend als lokale Schicht neben cloudbasierten Großmodellen. Hohe Schrittanzahlen übernimmt Nemotron 3.5 Lightning vor Ort, während komplexe Einzelschritte an ein gehostetes Modell übergeben werden. CLI und API bleiben dabei identisch.

Individuelle Spezialisten trainieren

Da Gewichte und Trainingsdaten offen liegen, können Entwickler das Modell für spezifische Aufgaben nachtrainieren und das Ergebnis lokal oder im Datacenter betreiben.

Technische Highlights im Überblick

Effiziente Architektur für lokale Hardware

Insgesamt verfügt das Modell über 30 Milliarden Parameter, von denen pro Token nur drei Milliarden aktiv sind. Das macht den Betrieb auf NVIDIA RTX PCs, RTX PRO Workstations, NVIDIA DGX Spark und DGX Station ebenso möglich wie in Cloud- und Datacenter-Umgebungen.

Riesiger Kontext und optimierte Inferenz

Mit einer Kontextlänge von bis zu einer Million Token bleibt selbst der Verlauf langer Tool-Historien über mehrere Arbeitsschritte hinweg verfügbar. Zusätzlich beschleunigt spekulatives Decoding mit Multi-Token-Prediction die Inferenz und liefert bis zu vier Mal höheren Durchsatz als vergleichbare offene Modelle.

Offene Gewichte für maximale Flexibilität

Nemotron 3.5 Lightning ist ein offenes Modell, das auf offenen Datensätzen trainiert wurde. Entwickler können es frei anpassen und von der Edge bis zum Datacenter überall einsetzen.

So starten Sie mit Ollama

Der Einstieg gelingt über die Ollama-Plattform. Nach dem Download steht das Modell für verschiedene Anwendungen bereit.

Allgemeiner Chat:

ollama run nemotron-3.5-lightning

Claude Code:

ollama launch claude --model nemotron-3.5-lightning

OpenClaw:

ollama launch openclaw --model nemotron-3.5-lightning

Hermes Agent:

ollama launch hermes --model nemotron-3.5-lightning

OpenCode:

ollama launch opencode --model nemotron-3.5-lightning

Nutzer mit Apple-Silicon-Hardware erhalten das Modell unter der Bezeichnung nemotron-3.5-lightning:30b-mlx mit modernster Performance. Auch der Betrieb in der Ollama-Cloud ist möglich, sodass einzelne Agentenschritte bei Bedarf nahtlos an ein größeres Modell übergeben werden können.

Benchmarks und Fazit

Laut NVIDIA bietet Nemotron 3.5 Lightning einen viermal höheren Durchsatz und eine um 30 Prozent schnellere Aufgabenbearbeitung als andere führende offene Modelle vergleichbarer Größe. Für laufende Agenten ist Durchsatz die entscheidende Kennzahl: Je mehr Schritte pro Minute erledigt werden, desto schneller kommen komplexe Aufgaben zum Abschluss.

Quelle: https://ollama.com/blog/nemotron-3-5-lightning

Dieser Inhalt wurde mithilfe künstlicher Intelligenz erstellt.
Becker Julian