ROBOTNESS
Produkt4 Min. LesezeitROBOTNESS-RedaktionVereinigte Staaten

NVIDIA zeigt GR00T N2 und setzt auf Roboter, die erst Video vorhersagen und dann handeln

NVIDIA hat auf der GTC am 16. März 2026 GR00T N2 vorgestellt, ein Robotik-Basismodell auf Grundlage der DreamZero-Forschung, das neue Aufgaben in neuen Umgebungen mehr als doppelt so oft lösen soll wie führende VLA-Modelle. GR00T N1.7 mit 3 Milliarden Parametern ging mit kommerzieller Lizenz in den Early Access, NEURA Robotics gehört zu den Anwendern. N2 soll bis Ende 2026 erscheinen.

NVIDIA zeigt GR00T N2 und setzt auf Roboter, die erst Video vorhersagen und dann handeln (Illustration: ROBOTNESS)
Zusammenfassung

NVIDIA hat am 16. März 2026 auf seiner Entwicklerkonferenz GTC eine Vorschau auf Isaac GR00T N2 gezeigt, die nächste Generation seines Basismodells für Roboter. Konzernchef Jensen Huang stellte das Modell in seiner Keynote vor. Nach Angaben von NVIDIA beruht es auf einer neuen Architektur für sogenannte World-Action-Modelle aus dem Forschungsprojekt DreamZero und löst neue Aufgaben in neuen Umgebungen mehr als doppelt so oft wie führende Vision-Language-Action-Modelle (VLA). Verfügbar sein soll GR00T N2 bis Ende 2026.

Die Vorschau war Teil eines größeren Pakets. NVIDIA gab GR00T N1.7, ein offenes VLA-Modell mit 3 Milliarden Parametern für humanoide Roboter, im Early Access mit kommerzieller Lizenz frei. Zu den Anwendern zählen nach Unternehmensangaben Humanoid, LG Electronics, NEURA Robotics aus Metzingen und Noble Machines. Hinzu kamen Cosmos 3, laut NVIDIA das erste Weltmodell, das synthetische Weltgenerierung, visuelles Schlussfolgern und Aktionssimulation vereint, sowie Isaac Lab 3.0 im Early Access auf Basis der neuen Physik-Engine Newton 1.0 und des PhysX SDK. GR00T N2 belege bereits Platz eins in den Ranglisten MolmoSpaces und RoboArena für universelle Roboterstrategien, erklärte NVIDIA.

Die Forschung dahinter erschien am 17. Februar 2026 als Preprint auf arXiv unter dem Titel "World Action Models are Zero-shot Policies". Zu den Autoren gehören die NVIDIA-Forscher Seonghyeon Ye und Joel Jang sowie die Leiter der Robotikforschung Linxi Fan und Yuke Zhu. DreamZero ist ein autoregressives Video-Diffusionsmodell mit 14 Milliarden Parametern. Laut einem NVIDIA-Entwicklerblog setzt es auf dem offenen Bild-zu-Video-Modell Wan 2.1 mit 14 Milliarden Parametern auf. Ein einziger Transformer erzeugt Video- und Aktionstoken gemeinsam, der Roboter plant seine nächste Bewegung also im selben Rechenschritt, in dem er das nächste Kamerabild vorhersagt.

Die Zahlen im Preprint sind deutlich. Auf dem mobilen zweiarmigen Roboter G1 des chinesischen Herstellers AgiBot, trainiert mit rund 500 Stunden Daten aus 22 Umgebungen, erreichte DreamZero bei bekannten Aufgaben einen durchschnittlichen Fortschritt von 62,2 Prozent gegenüber 27,4 Prozent bei vortrainierten VLA-Modellen, bei unbekannten Aufgaben 39,5 gegenüber 16,3 Prozent. Verglichen wurde mit NVIDIAs eigenem GR00T N1.6 und pi0.5 von Physical Intelligence. Durch GPU-Parallelisierung, Caching, CUDA Graphs, NVFP4-Quantisierung und eine schnellere Flash-Variante senkten die Autoren die Latenz auf GB200-Hardware von 5,7 Sekunden auf 150 Millisekunden, das 38-Fache, und erreichten eine Regelung mit 7 Hertz. Gewichte und Inferenzcode liegen auf GitHub.

DreamZero gegen vortrainierte VLA-Modelle auf dem AgiBot G1
  • Durchschnittlicher Aufgabenfortschritt, bekannte Aufgaben (%)
    DreamZero (World-Action-Modell, 14 Mrd. Parameter)
    62,2
    Vortrainierte VLA-Vergleichsmodelle (GR00T N1.6, pi0.5)
    27,4
    Faktor (DreamZero / Vergleich)
    2,27
  • Durchschnittlicher Aufgabenfortschritt, unbekannte Aufgaben (%)
    DreamZero (World-Action-Modell, 14 Mrd. Parameter)
    39,5
    Vortrainierte VLA-Vergleichsmodelle (GR00T N1.6, pi0.5)
    16,3
    Faktor (DreamZero / Vergleich)
    2,42

Werte aus dem DreamZero-Preprint (arXiv 2602.15922, 17. Februar 2026). Faktor = Fortschritt DreamZero / Fortschritt Vergleichsmodelle, berechnet von ROBOTNESS. Offengelegte Werte, keine Schätzungen.

Stand: 1. Okt. 2026

Auch der Transfer zwischen Robotern fällt auf. Laut dem Paper verbesserten 12 Minuten Egoperspektiv-Video von Menschen oder 20 Minuten Video eines YAM-Arms die Leistung bei unbekannten Aufgaben relativ um mehr als 42 Prozent. Das auf AgiBot-Daten trainierte Modell passte sich mit 30 Minuten freier Spieldaten an den YAM-Roboter an, ohne seine Zero-Shot-Fähigkeit zu verlieren.

Die GTC setzte fort, was NVIDIA am 5. Januar 2026 auf der CES begonnen hatte. Damals veröffentlichte der Konzern GR00T N1.6 als offenes VLA mit Ganzkörpersteuerung für Humanoide und brachte das Jetson-T4000-Modul auf Blackwell-Basis auf den Markt, mit 1.200 FP4-Teraflops und 64 GB Speicher für 1.999 Dollar bei Abnahme von 1.000 Stück. Auf der CES nutzte auch Franka Robotics GR00T-basierte Trainingsabläufe. Nach eigenen Angaben arbeiten 2 Millionen Entwickler mit NVIDIAs Robotikplattform. Das Geschäftsmodell bleibt gleich: Modelle offen oder günstig lizenziert, Training, Simulation und Inferenz auf NVIDIA-Chips.

Für Europas Industrie ist die Partnerliste aufschlussreich. NVIDIA zufolge integrieren FANUC, ABB Robotics, YASKAWA und KUKA, zusammen mit mehr als 2 Millionen installierten Robotern, Omniverse-Bibliotheken und Isaac-Simulation in ihre Werkzeuge für die virtuelle Inbetriebnahme. Agile Robots aus München und Hexagon Robotics entwickeln Humanoide mit NVIDIA-Werkzeugen, NEURA setzt auf GR00T N1.7. Für den Mittelstand heißt das, dass Simulation und Robotersteuerung zunehmend auf einer amerikanischen Plattform zusammenlaufen.

Wettbewerber verfolgen andere Wege. VLA-Modelle wie pi0.5 von Physical Intelligence oder die Gemini-Robotics-Familie von Google DeepMind leiten Motorbefehle aus Sprach-Bild-Modellen ab. Ein World-Action-Modell startet dagegen von einem Videogenerator, der gelernt hat, wie Gegenstände sich bewegen. Skild AI sammelte am 14. Januar 1,4 Milliarden Dollar bei einer Bewertung von über 14 Milliarden Dollar ein und baut ein eigenes Robotergehirn, nutzt aber zugleich Cosmos 3.

Entwickler von Robotik-Basismodellen: zuletzt offengelegte Finanzierungsrunden
  • Skild AI
    Land
    US
    Gründung
    2023
    Letzte offengelegte Runde
    Series C
    Betrag (USD)
    1.400.000.000
    Post-Money (USD)
    14.000.000.000
    Bekanntgabe
    2026-01-14
  • Physical Intelligence
    Land
    US
    Gründung
    Keine Daten
    Letzte offengelegte Runde
    Series B
    Betrag (USD)
    Keine Daten
    Post-Money (USD)
    Keine Daten
    Bekanntgabe
    2025-11-20
  • Generalist AI
    Land
    US
    Gründung
    Keine Daten
    Letzte offengelegte Runde
    Growth
    Betrag (USD)
    400.000.000
    Post-Money (USD)
    Keine Daten
    Bekanntgabe
    2026-06-04
  • Dyna Robotics
    Land
    US
    Gründung
    2024
    Letzte offengelegte Runde
    Series A
    Betrag (USD)
    120.000.000
    Post-Money (USD)
    Keine Daten
    Bekanntgabe
    2025-09-15
  • Genesis AI
    Land
    FR
    Gründung
    Keine Daten
    Letzte offengelegte Runde
    Launch round
    Betrag (USD)
    105.000.000
    Post-Money (USD)
    Keine Daten
    Bekanntgabe
    2025-06-30

Jeweils letzte Runde laut Mitteilung des Unternehmens oder Investors (ROBOTNESS-Datenbank). null = nicht offengelegt. NVIDIA ist börsennotiert und nicht aufgeführt.

Stand: 1. Okt. 2026

Offen bleiben Kosten und Tempo. In einem späteren Entwicklerblog maß NVIDIA für World-Action-Modelle 590 und 800 Millisekunden je Aktionsblock gegenüber 190 Millisekunden für pi0.5, also eine drei- bis vierfache Verlangsamung. Die 7 Hertz im Paper wurden auf Rechenzentrums-Hardware erreicht. Die Ranglistenplätze sind Eigenangaben, das Preprint ist nicht begutachtet, und GR00T N2 war bis Quartalsende nicht erschienen.

ROBOTNESS-Analyse

NVIDIA lenkt die Robotik-Basismodelle von sprachzentrierten VLA hin zu videozentrierten World-Action-Modellen, und dieser Schwenk nützt dem eigenen Geschäft, weil jede Entscheidung ein Vielfaches an Rechenleistung braucht.

Belegt wird das durch NVIDIAs eigene Daten: Ein Modell mit 14 Milliarden Parametern verdoppelt den Fortschritt bei unbekannten Aufgaben gegenüber GR00T N1.6 und pi0.5 mehr als, braucht für 7 Hertz aber einen GB200 und eine 38-fache Optimierung. Derselbe Blog, der DreamZero in der RoboArena-Auswertung vom April 2026 mit 1.750 Elo vor pi0.5 mit 1.622 sieht, dokumentiert auch die Latenz.

Das stärkste Gegenargument lautet, dass Fabrikkunden für Taktzeit und Zuverlässigkeit zahlen, nicht für Benchmark-Werte. Müssen Roboter aus dem Rechenzentrum gesteuert werden oder deutlich größere Bordrechner tragen, könnten schlankere VLA auf einem Jetson die Einsätze gewinnen.

Bull-Szenario. Erscheint GR00T N2 pünktlich mit kommerzieller Lizenz und lässt sich auf Jetson-Thor-Hardware verkleinern, wird die installierte Basis von KUKA, ABB, FANUC und YASKAWA zum fertigen Vertriebskanal. Europäische Hersteller wie NEURA konkurrieren dann über Daten und Mechanik.

Bear-Szenario. Bleiben Latenz und Kosten hoch, bleibt N2 ein Laborergebnis, und Anbieter schlanker VLA behalten den kommerziellen Vorsprung. Dass NVIDIA eigene Modelle an selbst zitierten Ranglisten misst, könnte das Vertrauen der Integratoren belasten.

Drei datierte Signale sind zu beobachten.

  • Bis 31. Dezember 2026: ob GR00T N2 wie zugesagt mit Gewichten und kommerzieller Lizenz erscheint.
  • Monatliche RoboArena-Auswertungen 2026: ob DreamZero-basierte Modelle Platz eins halten.
  • GTC im Frühjahr 2027: ob NVIDIA ein World-Action-Modell auf einem Jetson-Modul in einem Serien-Humanoiden zeigt.
Eckdaten
Bekanntgabe
16. März 2026, GTC-Keynote
Status GR00T N2
Vorschau; verfügbar bis Ende 2026
Leistungsangabe N2
Mehr als doppelt so hohe Erfolgsquote wie führende VLA bei neuen Aufgaben in neuen Umgebungen
GR00T N1.7
3 Mrd. Parameter; Early Access mit kommerzieller Lizenz
Europäische Anwender
NEURA Robotics (N1.7); KUKA und ABB (Omniverse, Isaac)
DreamZero
14 Mrd. Parameter, Video-Diffusions-World-Action-Modell
Regelfrequenz
7 Hz nach Latenzsenkung von 5,7 s auf 150 ms (GB200)
Unbekannte Aufgaben
39,5 % gegenüber 16,3 % Fortschritt
Weitere Neuheiten
Cosmos 3, Isaac Lab 3.0, Newton 1.0
Quellen
ROBOTNESS Intelligence
  1. 01

    Warum das wichtig ist

    Mit GR00T N2 legt erstmals ein Plattformanbieter von NVIDIAs Reichweite einen kommerziellen Fahrplan für World-Action-Modelle vor, bei denen ein Modell Video und Motorbefehle gemeinsam vorhersagt. Bis zur GTC 2026 galt das VLA-Rezept als kommerzieller Standard, genutzt von Physical Intelligence, Google DeepMind und NVIDIA selbst in GR00T N1.6.

    Weil NVIDIA auch Simulation, synthetische Daten und Bordrechner liefert, setzt seine Modellwahl die Voreinstellung für tausende kleinere Entwickler. Ein Wechsel zu videozentrierten Modellen erhöht den Wert großer Videodatensätze und von GPU-Kapazität in jeder Phase des Roboterlebenszyklus.

  2. 02

    Wettbewerbsanalyse

    Physical Intelligence ist der Referenzwettbewerber im VLA-Lager: pi0.5 diente im DreamZero-Paper als externer Vergleich und kam laut NVIDIA in der RoboArena-Auswertung vom April 2026 auf 1.622 Elo, DreamZero auf 1.750. Skild AI, im Januar mit über 14 Milliarden Dollar bewertet, verkauft ein eigenes Robotergehirn und nutzt zugleich Cosmos 3.

    In Europa ist NEURA Robotics Anwender von GR00T N1.7 und konkurriert damit nicht auf Modellebene. Google DeepMinds Gemini Robotics bleibt geschlossen, NVIDIA veröffentlicht Gewichte. Diese Offenheit ist NVIDIAs Hebel bei Herstellern, die sich nicht von einem konkurrierenden Modellanbieter abhängig machen wollen.

  3. 03

    Bewertungskontext

    NVIDIA weist Robotikumsätze nicht gesondert aus, die GTC-Ankündigungen lassen sich daher keiner berichteten Zahl zuordnen. Das Bewertungssignal liegt bei den Modell-Start-ups: Skild AI mit 14 Milliarden Dollar Post-Money im Januar 2026 und Generalist AI mit 400 Millionen Dollar im Juni bepreisen universelle Robotergehirne als eigenständiges Geschäft.

    Erreicht NVIDIAs offenes N2 deren Niveau, gerät die Knappheitsprämie in diesen Bewertungen unter Druck, und die Start-ups müssen stärker mit eigenen Daten und Einsatzumsätzen argumentieren.

  4. 04

    Folgen für die Lieferkette

    Die 7 Hertz von DreamZero entstanden auf GB200-Rechenzentrumshardware, während NVIDIA Jetson-T4000-Module mit 1.200 FP4-Teraflops für 1.999 Dollar bei 1.000 Stück verkauft. Die Lücke zwischen beiden Hardwareklassen ist die praktische Lieferkettenfrage für N2.

    Für europäische Integratoren steigt die Bedeutung von Datenerhebung, Teleoperation und synthetischen Daten aus Cosmos und dem Physical-AI-Data-Factory-Blueprint, den Microsoft Azure und Nebius anbieten.

  5. 05

    Worauf jetzt zu achten ist

    Fester Termin ist NVIDIAs Zusage, N2 bis Ende 2026 bereitzustellen; eine Verschiebung oder reine Forschungslizenz wäre aussagekräftig. Die zitierten Ranglisten RoboArena und MolmoSpaces ändern sich mit jeder neuen Einreichung.

    Aus Europa sind Integrationsmeldungen von KUKA und ABB entscheidend: Wandern Weltmodelle von der virtuellen Inbetriebnahme in die Robotersteuerung, verschiebt sich die Wertschöpfung.

  6. 06

    Analystensicht

    These: NVIDIAs Schwenk zu World-Action-Modellen ist technisch glaubwürdig und kommerziell eigennützig; entscheidend ist, ob N2 auf Bordhardware verkleinert werden kann. Zuversicht: mittel.

    Gründe: Das Preprint liefert detaillierte, reproduzierbare Zahlen mit offenen Gewichten. Dagegen stehen selbst gemeldete Ranglistenplätze, der Vorschaustatus von N2 auf der GTC und eine von NVIDIA selbst dokumentierte drei- bis vierfache Latenz gegenüber pi0.5.

  7. 07

    Offene Fragen

    Welche Bordrechenleistung braucht GR00T N2 für geschlossene Regelkreise auf einem Humanoiden, und veröffentlicht NVIDIA Messwerte auf Jetson Thor?

    Gelten für N2 dieselben kommerziellen Lizenzbedingungen wie für N1.7, und wie wird die Lizenz des zugrunde liegenden Wan-2.1-Modells behandelt?

    Wie viel vom Vorsprung bei unbekannten Aufgaben bleibt in Fabriken mit strengen Taktzeiten erhalten?