RSS-Spitzenpapier FlashSAC mit TU Darmstadt und DFKI: Humanoiden lernen das Laufen auf einer GPU in 20 Minuten
Das Reinforcement-Learning-Verfahren FlashSAC, entwickelt unter anderem von Holiday Robotics, KAIST, KRAFTON, der TU Darmstadt, hessian.AI, dem DFKI und der KTH, hat auf der Robotics: Science and Systems 2026 in Sydney den Outstanding Paper Award gewonnen. Die Autoren berichten, dass ein Laufregler für den Unitree G1 auf einer einzigen RTX 5090 in etwa 20 Minuten trainiert war, gegenüber etwa drei Stunden mit dem Standardverfahren PPO.
Das Off-Policy-Lernverfahren FlashSAC hat auf der Konferenz Robotics: Science and Systems (RSS) 2026 den Outstanding Paper Award erhalten. Das geht aus der Preisseite der Konferenz hervor, die vom 13. bis 17. Juli 2026 in Sydney stattfand. Nach Angaben der Autoren trainiert das Verfahren Laufregler für Humanoide etwa zehnmal schneller als die in der Industrie verbreitete Methode, und zwar auf einer einzigen Grafikkarte aus dem Endkundensegment.
Die Beteiligten
Die 13 Autoren nennen als Institutionen Holiday Robotics, KAIST, KRAFTON, Turing Inc, die TU Darmstadt, hessian.AI, die KTH Royal Institute of Technology, das Deutsche Forschungszentrum für Künstliche Intelligenz (DFKI) und das Robotics Institute Germany (RIG). Zu den Seniorautoren zählen Jan Peters von der TU Darmstadt, Danica Kragic von der KTH, Jaegul Choo vom KAIST sowie Hojoon Lee. Die Arbeit erschien im April 2026 als arXiv-Vorabveröffentlichung (2604.04539). Der Code liegt auf GitHub unter der Organisation Holiday-Robot.
Die zentralen Zahlen
Auf dem Humanoiden Unitree G1 mit 29 Freiheitsgraden lernte FlashSAC nach Angaben der Autoren das Gehen auf ebenem Boden in etwa 20 Minuten. Das in der Lokomotion dominierende On-Policy-Verfahren PPO benötigte etwa drei Stunden. Für unebenes Gelände und Treppen brauchte FlashSAC etwa vier Stunden, PPO etwa 20 Stunden. Gemessen wurde jeweils auf einer NVIDIA RTX 5090. Die Regler wurden anschließend aus der Simulation auf den realen Roboter übertragen.
In 25 zustandsbasierten Aufgaben in vier GPU-Simulatoren (IsaacLab, MuJoCo Playground, ManiSkill und Genesis) lag FlashSAC bei 15 niedrigdimensionalen Aufgaben gleichauf mit PPO und bei zehn hochdimensionalen Aufgaben, darunter Feinmanipulation und humanoides Gehen, deutlich vorn. Dafür reichten 50 Millionen Simulationsschritte gegenüber 200 Millionen bei PPO. In 40 Aufgaben aus CPU-basierten Sammlungen wie der DeepMind Control Suite, MyoSuite und HumanoidBench übertraf das Verfahren laut den Autoren ohne aufgabenspezifische Abstimmung durchgehend PPO, XQC, SimbaV2, TD-MPC2 und MR.Q. Insgesamt nennt die Projektseite mehr als 60 Aufgaben in zehn Simulatoren.
Das Verfahren verständlich erklärt
Im Reinforcement Learning für Roboter gibt es zwei Lager. On-Policy-Verfahren wie PPO verwerfen Erfahrungen nach jeder Aktualisierung, das ist verschwenderisch, aber stabil. Off-Policy-Verfahren wie Soft Actor-Critic (SAC) speichern Erfahrungen und nutzen sie wieder. Das sollte effizienter sein, wird bei Robotern mit vielen Gelenken aber leicht instabil. FlashSAC behält die Wiederverwendung bei und beseitigt die Instabilität.
Dazu skaliert das Verfahren erstens wie ein Sprachmodell: 1.024 parallele Simulationsumgebungen, ein Erfahrungsspeicher mit zehn Millionen statt der üblichen einer Million Übergänge, ein Netz mit 2,5 Millionen Parametern in sechs Schichten, Stapel von 2.048 Beispielen und nur zwei Gradientenschritte je 1.024 Datenschritte. Zweitens begrenzen mehrere Normalisierungsschichten die Größe von Gewichten, Merkmalen und Gradienten, damit das Training nicht entgleist. Ein festes Explorationsziel und wiederholte Rauschmuster sorgen für längere, ruhigere Bewegungen.
Wettbewerbsumfeld
PPO gilt bei den meisten Humanoiden-Herstellern als Standard für den Transfer von der Simulation in die Realität, weil es berechenbar ist. Schnellere Alternativen wie TD-MPC2, SimbaV2 und MR.Q überzeugten bislang vor allem in Benchmarks. FlashSAC beansprucht, diese Lücke auf echter Hardware zu schließen. Mit NVIDIAs IsaacLab nutzt die Arbeit eine der verbreitetsten Trainingsumgebungen, das Verfahren lässt sich also in bestehende Abläufe einbauen.
Bedeutung für Europa
Die Auszeichnung ist auch ein Erfolg für den Forschungsstandort Deutschland. Mit TU Darmstadt, hessian.AI, DFKI und dem Robotics Institute Germany stammen vier der beteiligten Institutionen aus Deutschland, die KTH aus Schweden. Für Hersteller wie Neura Robotics oder Zulieferer der Automobilindustrie zählt vor allem der Zeitgewinn: Wenn ein Laufregler statt eines Arbeitstags 20 Minuten braucht, lassen sich pro Woche weit mehr Entwürfe, Belohnungsfunktionen und Hardwareänderungen testen. Dass eine einzelne RTX 5090 genügt, senkt zudem die Einstiegshürde für Ausgründungen und Mittelständler ohne eigenes Rechenzentrum.
Risiken und offene Fragen
Die Zahlen stammen von den Autoren und sind als Näherungswerte angegeben. Zeitvergleiche hängen davon ab, wie gut PPO abgestimmt war, und die Schrittbudgets beider Verfahren unterscheiden sich. Die Validierung am realen Roboter beschränkt sich auf den Unitree G1 und auf Fortbewegung. Ob der Vorteil auch bei kontaktreicher Manipulation in der Realität hält, ist offen.
ROBOTNESS-Analyse
FlashSAC ist der bislang stärkste Beleg dafür, dass Off-Policy-Lernen PPO als Industriestandard für das Training von Roboterkörpern ablösen kann, und es verlagert den Wettbewerbsvorteil von Rechenbudgets zur Iterationsgeschwindigkeit.
Dafür sprechen eine etwa neunfach kürzere Trainingszeit beim Gehen auf ebenem Boden und eine etwa fünffach kürzere im Gelände auf echter Hardware, Vorteile vor allem bei hochdimensionalen Aufgaben und eine breite Abdeckung von mehr als 60 Aufgaben ohne Einzelabstimmung, gewürdigt mit dem wichtigsten Preis der Konferenz.
Das stärkste Gegenargument: PPO überzeugt weniger durch Tempo als durch Berechenbarkeit. Ein Off-Policy-Verfahren mit vielen ineinandergreifenden Normalisierungen könnte empfindlich reagieren, wenn Roboter, Belohnung oder Simulator wechseln.
Optimistisches Szenario: Weil der Code offen ist, steigen Hersteller von Humanoiden und Roboterhänden binnen Monaten um, verkürzen Entwicklungszyklen und sparen GPU-Kosten. Off-Policy-Lernen wandert anschließend in das Feintuning am realen Roboter, wo Datenwiederverwendung am meisten bringt.
Pessimistisches Szenario: Nachprüfungen mit gut abgestimmtem PPO zeigen kleinere Vorteile, und die Industrie bleibt für Serienregler bei PPO. Ergebnisse bei realer Manipulation bleiben hinter der Simulation zurück.
Signale, auf die es ankommt:
- Unabhängige Reproduktionen auf anderen Humanoiden, etwa auf der CoRL 2026.
- Aufnahme von FlashSAC in offizielle Beispielbibliotheken von IsaacLab oder MuJoCo Playground.
- Erwähnung von FlashSAC in technischen Berichten europäischer Hersteller bis Anfang 2027.
- Gehen auf ebenem Boden
- 20
- 180
- 9
- Gelände und Treppen
- 240
- 1200
- 5
Näherungswerte der Autoren (etwa 20 Min. gegen etwa 3 Std., etwa 4 Std. gegen etwa 20 Std.). Faktor = PPO-Zeit / FlashSAC-Zeit. In GPU-Benchmarks nutzte FlashSAC 50 Mio. Schritte, PPO 200 Mio.
Stand: 1. Okt. 2026
- RSS 2026 Outstanding Paper Award
- 13. bis 17. Juli 2026, Sydney
- arXiv 2604.04539 (April 2026)
- Unitree G1, 29 Freiheitsgrade
- Etwa 20 Min. statt etwa 3 Std. (PPO)
- Etwa 4 Std. statt etwa 20 Std. (PPO)
- Eine NVIDIA RTX 5090
- TU Darmstadt, hessian.AI, DFKI, RIG
- Offen auf GitHub (Holiday-Robot/FlashSAC)
Warum das wichtig ist
Die meisten Laufregler heutiger Humanoide werden mit PPO in massiv paralleler Simulation trainiert. Diese Wahl fiel aus Gründen der Stabilität, nicht der Effizienz, und sie bestimmt, wie Unternehmen GPU-Budgets und Entwicklungszeit planen. FlashSAC stellt die Prämisse infrage, indem es ein datenwiederverwendendes Verfahren zeigt, das auf einem vollständigen Humanoiden schneller und stabil ist, mit offenem Code.
Auch die Auszeichnung selbst ist ein Signal. Die RSS kürte in diesem Jahr ein einziges Outstanding Paper und wählte dafür eine Arbeit über Trainingsalgorithmen statt über Hardware oder Systeme.
Wettbewerbsanalyse
Innerhalb des Reinforcement Learning konkurriert FlashSAC mit SimbaV2, XQC, TD-MPC2 und MR.Q sowie mit PPO in GPU-Simulatoren. Modellbasierte Verfahren wie TD-MPC2 erkaufen Dateneffizienz mit mehr Rechenaufwand pro Schritt, FlashSAC setzt auf günstige Aktualisierungen mit großen Stapeln.
Industriell ist die Alternative zum schnelleren Reinforcement Learning das Lernen aus Demonstrationen und große VLA-Modelle. Beide ergänzen sich: VLAs verstehen Aufgaben, per Reinforcement Learning trainierte Regler beherrschen Balance und Kontakt. Die starke Regelungstechnik-Tradition europäischer Hersteller passt gut zu dieser Kombination.
Bewertungskontext
FlashSAC hat keinen direkten Preis, sein Wert zeigt sich in den Kosten. Sinkt der GPU-Bedarf für Geländetraining von etwa 20 auf etwa vier Stunden, lassen sich mit derselben Hardware etwa fünfmal so viele Experimente fahren.
Für Investoren schwächt das den Burggraben von Firmen, deren Vorteil in Rechenkapazität für Lokomotionstraining liegt, und stärkt kleinere Teams mit guter Ingenieurskunst. Die Beteiligung des Spieleherstellers KRAFTON zeigt, dass branchenfremdes Kapital in Physical-AI-Forschung fließt.
Folgen für die Lieferkette
Das Verfahren läuft auf einer RTX 5090 und auf gängigen Simulatoren wie IsaacLab, MuJoCo Playground, ManiSkill und Genesis. Die Abhängigkeit von NVIDIA bleibt, die Nachfrage kann sich aber von Rechenzentren zu Workstations verschieben.
Auf der Roboterseite festigt die Validierung auf dem günstigen Unitree G1 dessen Rolle als Standardplattform der Forschung, auch in Europa. Schnelleres Training hochdimensionaler Hände könnte die Nachfrage nach Feinmanipulations-Hardware beleben, ein Feld, in dem deutsche Antriebs- und Sensorhersteller Zulieferchancen haben.
Worauf jetzt zu achten ist
Zu beobachten sind unabhängige Reproduktionen auf der CoRL 2026 und in arXiv-Vorabveröffentlichungen, vor allem mit realen Roboterhänden. Nimmt NVIDIA oder das MuJoCo-Team FlashSAC in offizielle Beispiele auf, wird es faktisch zur Standardoption.
Außerdem relevant: Produkt- oder Finanzierungsnachrichten von Holiday Robotics, dessen GitHub-Organisation den Code beherbergt, sowie Folgearbeiten aus Darmstadt, dem DFKI und dem Robotics Institute Germany.
Analystensicht
These: FlashSAC dürfte binnen eines Jahres zur Standard-Vergleichsbasis im Roboter-Reinforcement-Learning werden und PPO in einigen Produktionsabläufen für hochdimensionale Roboter ersetzen. Zuversicht: mittel.
Mittel, weil die Beschleunigung von den Autoren selbst als Näherung angegeben wird und die reale Validierung nur einen Humanoiden und nur die Fortbewegung umfasst. Gestützt wird die Einschätzung durch offenen Code, mehr als 60 Aufgaben und die Anerkennung durch das RSS-Preiskomitee.
Offene Fragen
Wie empfindlich reagiert FlashSAC auf seine vielen Normalisierungsentscheidungen beim Wechsel auf einen neuen Roboter? Hält der Vorsprung gegen ein sorgfältig abgestimmtes PPO mit gleichem Schrittbudget?
Taugt das Verfahren für Feintuning am realen Roboter, wo jede Probe teuer ist? Wie schneidet es an echten Roboterhänden ab, und wie lässt es sich in die Sicherheitsnachweise nach europäischer Maschinenverordnung einbinden?