ROBOTNESS
FortgeschrittenarXiv

RoboCoach: Weltmodelle als aktive Coaches für kompositionale Roboterfähigkeiten

Jiajun Liu, Yifan Chen, Yichao Liu, Jiayi Zhang, Ruoqu Chen, Shaoxuan Xie, Guocai Yao, Mengdi Xu, Sen Cui, Changshui Zhang
In 30 Sekunden

RoboCoach ist ein Preprint und beschreibt ein Framework, das mit dem aktionskonditionierten Weltmodell CoachWorld imaginierte Fehlschläge in langfristigen Manipulationsaufgaben lokalisiert und daraus gezielte Demonstrationsanfragen sowie LoRA-Updates für die zuständigen Skill-Experten ableitet. In Simulation und auf zwei echten Roboterplattformen steigt die Erfolgsrate mit 150 zusätzlichen Teilaufgaben-Demonstrationen von 13,3 % auf 75,0 % beim Franka und von 40,0 % auf 83,8 % beim AgileX, während eine gleichmäßige Datenerfassung mit gemeinsamem Adapter nur 30,0 % bzw. 47,5 % erreicht. Die Arbeit zeigt, dass Weltmodelle nicht nur simulieren, sondern als aktive Coaches entscheiden können, welche wiederverwendbare Fähigkeit als Nächstes gelernt werden soll.

Forschungsfrage

Wie kann ein lernendes Robotersystem selbst entscheiden, welche Teilaufgaben-Demonstrationen als Nächstes gesammelt und welche wiederverwendbaren Skill-Experten damit aktualisiert werden sollen, um langfristige Manipulationsaufgaben mit begrenztem Budget zu verbessern?

Problem

Langfristige Manipulationsaufgaben bestehen aus wiederverwendbaren Teilfähigkeiten, aber lokale Ausführungsfehler pflanzen sich fort und lassen die gesamte Aufgabe scheitern. Zusätzliche Ende-zu-Ende-Demonstrationen sind teuer, insbesondere auf physischen Robotern, und decken die Kombinationsvielfalt kaum ab. Bestehende Systeme sammeln Erfahrungen oft gleichmäßig oder aktualisieren alle Parameter gemeinsam, ohne den Engpass auf Ebene der Teilaufgabe zu identifizieren und die passende wiederverwendbare Fähigkeit gezielt zu verbessern.

Bisheriger Ansatz

Bisherige Ansätze reichen von generalistischen Vision-Language-Action-Modellen (VLA) und hierarchischen Systemen über aktives und korrektives Imitation Learning bis zu aktionskonditionierten Weltmodellen. Generalistische VLAs liefern starke Vortrainings, aber zusätzliche Supervision wird meist als gemeinsames Update oder gleichmäßig verteilte Daten verwendet, ohne die verantwortliche Teilfähigkeit zu isolieren. Aktionskonditionierte Weltmodelle wurden vor allem zur Simulations- und Politikbewertung genutzt, nicht als Entscheidungsinstanz für die Auswahl von Trainingsdaten auf Skill-Ebene. Modulare Ansätze mit LoRA-Adaptern erlauben zwar gezielte Anpassung, aber die Kopplung von Diagnose, Datenerfassung und Adapter-Update fehlt.

Neuer Ansatz

RoboCoach verbindet ein gemeinsames aktionskonditioniertes Weltmodell namens CoachWorld mit einer modularen Expertenbibliothek auf einem geteilten VLA-Backbone. Für LIBERO und Franka wird pi_0.5 als VLA-Backbone verwendet, für RoboTwin und AgileX MolmoAct2. Die Route-Imagine-Diagnose-Improve-Schleife (RIDI) wählt den nächsten unerledigten Subtask aus, rollt den zugehörigen Skill-Experten im Weltmodell geschlossen ab und nutzt den Fortschrittsrichter RoboMeter, um den ersten nicht abgeschlossenen Subtask-Experten-Paar zu erkennen. CoachWorld wird per konditionalem Flow Matching auf Demonstrationen, Politikfehlern, Spiel- und Nicht-Experten-Trajektorien trainiert und nutzt spärliche visuelle Historien, Kamerakalibrierung und Endeffektor-Trajektorien als Konditionierung. Aus aggregierten Timeout-Aufzeichnungen entsteht ein Scorecard-Ranking, das die nächsten Demonstrationsanfragen priorisiert; die erfassten Demonstrationen aktualisieren ausschließlich die LoRA-Adapter der ausgewählten Skill-Experten, während Backbone und übrige Adapter eingefroren bleiben.

Ergebnisse

CoachWorld erreicht auf DROID-180 die besten Werte mit LPIPS 0,0996, FVD 51,71 und Instruction-Following 0,880; auf Lab Franka-180 liegt LPIPS bei 0,1712. Imaginierte und reale Erfolgsraten korrelieren über 22 Task-Policy-Paare mit Spearman rho 0,840. Der Fortschrittsrichter RoboMeter erreicht unter Referenzvideo eine Switch MAE von 0,414 s, eine [email protected] von 82,73 % und ein Outcome F1 von 88,21 %; unter CoachWorld-Beobachtungen sinken diese Werte auf 0,815 s, 62,73 % und 83,84 %. Mit 150 zusätzlichen Teilaufgaben-Demonstrationen pro Plattform steigt die Erfolgsrate von 13,3 % auf 75,0 % beim Franka und von 40,0 % auf 83,8 % beim AgileX, gegenüber 30,0 % und 47,5 % für Single VLA + Uniform. Die normalisierte Budget-AUC beträgt 53,1 gegenüber 18,9 auf Franka und 72,7 gegenüber 46,3 auf AgileX. In Simulation erreicht RoboCoach 71,2 % auf LIBERO und 68,0 % auf RoboTwin; die gezielte Aktualisierung der korrespondierenden Experten statt eines gemeinsamen Adapters bringt 3,4 bzw. 13,2 Prozentpunkte. Bei vier gehaltenen Kompositionsrouten erreicht RoboCoach durchschnittlich 35,0 %, die Baseline 0 %; die Einzelwerte liegen bei 65 %, 15 %, 25 % und 35 %.

Grenzen

Die Autoren nennen Okklusion, Interaktionen außerhalb des Sichtfelds und mögliche systematische Verzerrungen des Weltmodells als Grenzen, weil die Vorhersage in solchen Regionen schwierig bleibt. Die Expertenbibliothek ist vordefiniert; das automatische Lernen ihrer Struktur und die Reduktion menschlicher Demonstrationen sind offene Punkte. Die realen Versuche umfassen 20 Trials pro Route auf zwei Plattformen, und die Simulation beschränkt sich auf LIBERO und RoboTwin. Ob Code oder trainierte Modelle veröffentlicht werden, ist im Paper nicht berichtet. Das Paper ist ein Preprint; eine Begutachtung ist im Paper nicht berichtet.

Bedeutung für die Branche

Für Hersteller manipulationsintensiver Roboter, etwa in der Montage, Intralogistik oder im Service, kann der Ansatz die Einarbeitung neuer Aufgaben mit wenigen gezielten Demonstrationen beschleunigen. In ein bis drei Jahren ist ein Einsatz in Entwicklungs- und Evaluierungsumgebungen denkbar, sofern Weltmodelle, Fortschrittsrichter und modulare Expertenbibliotheken in bestehende VLA-Stacks integriert werden. Für breite Produkte sind mehr als drei Jahre realistisch, weil zuerst robuste Weltmodelle unter Okklusion, Sicherheitsgarantien für reale Umgebungen und eine automatische Struktur der Skill-Bibliothek benötigt werden.

Der Volltext wird hier nicht wiedergegeben, weil die Lizenz der Studie das nicht erlaubt. Das Original steht auf arXiv.