Skild AI hat mit S1 ein bahnbrechendes Robotik-Foundation-Modell vorgestellt, das Industrieroboter mithilfe von NVIDIA Physical AI aus einem einzigen Video lernen lässt. Das Besondere: Keine aufwendige Neuprogrammierung oder zeitintensives Retraining ist nötig. Stattdessen versteht das Modell die demonstrierte Absicht und setzt die Aufgabe selbstständig in der realen Umgebung um. Wie diese Technik die Fertigung verändern könnte und welche Rolle NVIDIA dabei spielt, erfahren Sie im folgenden Beitrag.
So lernt Skild AI S1 aus einem einzigen Video
Herkömmliche Industrieroboter sind auf feste Abläufe programmiert. Jede neue Aufgabe, ein geändertes Layout oder ein neues Produkt erforderte bisher umfangreiche Daten, neues Training und aufwändige Validierung. Skild AI setzt mit seinem Modell S1 auf einen radikal anderen Ansatz.
Ein Bediener nimmt einfach ein Video der gewünschten Tätigkeit auf und übergibt es dem Modell als Eingabeaufforderung. Das System interpretiert die demonstrierte Absicht, die beteiligten Objekte und die Sequenz selbstständig. Anschließend übersetzt es diese Informationen in konkrete Aktionen für den Roboter vor Ort – und das ohne jegliche Aktualisierung seiner Gewichte oder aufgabenspezifisches Nachtraining. Diese Methode wird als In-Context Learning bezeichnet.
Beeindruckend ist vor allem die Geschwindigkeit: In einem Test zur Umpflanzung von Zimmerpflanzen benötigte das Team lediglich elf Minuten, um vom aufgezeichneten Demonstrationsvideo zur autonomen Ausführung auf der Hardware zu gelangen. Das Modell passt sich zudem dynamisch an, wenn sich Objekte bewegen, und kann aus Fehlern eigenständig wieder aussteigen.
Deutlich höhere Erfolgsraten im Praxistest
Bei der Erprobung neuer, mehrstufiger Aufgaben erreichte S1 bei jedem Einzelschritt eine Erfolgsquote von rund 66 Prozent. Ein vergleichbares KI-System kam lediglich auf 9 Prozent. Das bedeutet eine Verbesserung um das mehr als Siebenfache.
Skild AI schätzt zudem, dass ein einziges kurzes Video-Beispiel für den Roboter so informativ ist wie etwa 380 praktische Trainingsbeispiele. Ein Mensch würde für die manuelle Sammlung solcher Daten zwischen 50 und 100 Stunden benötigen.
Zu den erfolgreich demonstrierten Aufgaben gehören unter anderem das Umtopfen von Pflanzen, das Zubereiten von Pfannkuchen, das Brühen von Filterkaffee und komplexe Kit-Montagen. Diese Tätigkeiten erstrekken sich über Dutzende von Manipulationsschritten und verlangen vom Roboter die Kombination verschiedener Fähigkeiten in bisher nicht erprobten Abfolgen – teilweise über einen Zeitraum von bis zu zehn Minuten.
Vom Labor auf die Fabrikebene
Die Technologie wird bereits jenseits von Labortests eingesetzt. Skild AI, NVIDIA und Foxconn arbeiten gemeinsam daran, das Skild Brain auf zweiarmigen Manipulatoren für hochpräzise Montageaufgaben zu implementieren. Konkret geht es um den Zusammenbau von NVIDIA-Blackwell-Systemen.
Präzisionsmontage für NVIDIA Blackwell
In einem demonstrierten Workflow installiert der Roboter einen Busbar und einen Limit Block, zieht 16 Schrauben fest und reagiert flexibel auf Störungen innerhalb einer mehrstufigen Aufgabe. Dafür sind präzise Bewegungen, kontaktbewusste Steuerung, Sequenzverfolgung und die Fähigkeit zur Selbstkorrektur nötig, wenn die Situation von der ursprünglichen Planung abweicht.
Kontinuierliches Lernen aus dem Betrieb
Wo Kundenverträge es erlauben, können Erkenntnisse aus kommerziellen Einsätzen zurück in das übergeordnete Modell fließen und so künftige Implementierungen beschleunigen. Das bricht den bisherigen Zyklus ständiger Neutrainings für jede Variante.
NVIDIA Physical AI entlang der gesamten Entwicklungskette
Die Entwicklung und Skalierung von S1 basiert auf umfassender NVIDIA-Infrastruktur. NVIDIA Isaac Lab, ein offenes modulares Framework für robotisches Lernen, ermöglicht es Skild AI, Fähigkeiten durch Reinforcement Learning zu festigen. Die zugrunde liegende Newton-Physik-Engine modelliert dabei Kräfte, Kontakt, Kollision und Druck präzise und verkleinert die Lücke zwischen Simulation und Realität.
Für die Datenvorbereitung kommt NVIDIA Cosmos zum Einsatz. Die offenen Welt-Foundation-Modelle diversifizieren Trainingsdaten und wandeln Videoaufnahmen in strukturierte Beschreibungen um. Cosmos Curator hilft, große Datenmengen zu annotieren, zu filtern und zu organisieren.
Physisch fundierte virtuelle Umgebungen für Datengenerierung und das Testen von Grenzfällen liefert NVIDIA Omniverse beziehungsweise das Isaac-Sim-Framework. Außerdem entwickeln Skild und NVIDIA gemeinsam neue GPU-beschleunigte Simulations-Solver, die modellieren, wie Roboter feste Objekte berühren, greifen und manipulieren. Diese sollen bald allen Entwicklern als Teil von Newton zur Verfügung stehen.
Für die Produktionsreife unterstützen NVIDIA Nsight-Tools die Identifikation von Performance-Engpässen während des Trainings. Das NVIDIA TensorRT-SDK optimiert die Inferenz, damit Roboter in der physischen Welt schnell reagieren können. So verschmelzen Datengewinnung, Simulation, Training und Bereitstellung zu einem durchgängigen Ökosystem statt isolierter Schritte.
Rekordwachstum nach nur zehn Monaten
Neben dem technischen Fortschritt verzeichnet Skild AI auch wirtschaftlich beeindruckende Zahlen. Zehn Monate nach erster kommerzieller Einführung erreichte das Unternehmen eine jährliche Umsatzrate von 100 Millionen US-Dollar.
In dieser Zeit konnten über 60 Deployment-Partnerschaften aufgebaut werden. Die Anwendungsfelder reichen von Fertigung und Logistik über Inspektion und Sicherheit bis hin zur Essenszubereitung. Dieses breite Spektrum unterstreicht die vielseitige Einsatzfähigkeit der adaptiven Robotik.
„Das Lernen durch Erfahrung statt durch Vorprogrammierung ist der Quantensprung, der in der Robotik stattgefunden hat“, sagte Deepak Pathak, Mitbegründer und CEO von Skild AI. „NVIDIA Isaac Lab und NVIDIA Cosmos helfen Skild, die skalierbare und vielfältige Erfahrung zu schaffen, die Roboter brauchen, um in vielen Szenarien und Ausprägungen zu lernen.“
Quelle: https://blogs.nvidia.com/blog/skild-ai-s1-physical-ai/