ROBOTNESS
FortgeschrittenarXiv

T3DP: Feingranulare Sprach-Verhaltens-Ausrichtung für Text-to-3D-Policies

Xinhao Yang, Wenhao Wu, Ning Lv, Yanshen Ding, Zhenhong Sun, Daoyi Dong, Chunlin Chen, Zhi Wang
In 30 Sekunden

Der Preprint stellt T3DP vor, ein Framework, das feingranulare Sprach-Verhaltens-Ausrichtung nutzt, um textgesteuerte 3D-Diffusionsrichtlinien für ungesehene Verhaltensspezifikationen zu verbessern. In Simulationen (Meta-World, ManiSkill, RoboTwin) erreicht T3DP durchschnittlich 11,0 bis 14,2 Prozentpunkte mehr Erfolg als globale Ausrichtung; auf einem realen PiPer-X-Roboter steigt der Durchschnitt von 47,5 auf 65,0 Prozent. Die lokale Zuordnung von Instruktionstoken zu Verhaltenssegmenten erhält spezifikationsrelevante Unterschiede, die globale Verfahren oft verwischen.

Forschungsfrage

Wie können textgesteuerte 3D-Richtlinien feingranulare Verhaltensspezifikationen ausführen, die nicht in den Trainingsdemonstrationen enthalten sind?

Problem

Innerhalb einer Aufgabenfamilie teilen sich Instruktionen oft die grobe Semantik, verlangen aber unterschiedliche Verhaltensweisen wie Zielposition, Verschiebung oder Gelenkzustand. Demonstrationen decken den großen, kontinuierlichen oder kompositorischen Spezifikationsraum nur teilweise ab; globale Sprach-Verhaltens-Ausrichtung komprimiert gesamte Anweisung und Trajektorie in einzelne Embeddings und verwischt dadurch benachbarte Spezifikationen.

Bisheriger Ansatz

Bisherige Ansätze konditionieren 3D-Policies direkt auf vortrainierte Sprachrepräsentationen (z. B. 3DDA, 3D-LOTUS) oder nutzen globale Sprach-Verhaltens-Ausrichtung wie T2DA. Vortrainierte Repräsentationen sind ohne Roboterinteraktion gelernt und bilden subtile sprachliche Unterschiede nicht verhaltensrelevant ab; globale Ausrichtung betont Aufgabenkompatibilität und übersieht lokale, entscheidende Korrespondenzen.

Neuer Ansatz

T3DP lernt zunächst einen Behavior-Encoder, der aus Demonstrationsfenstern belohnungsprädiktiv spezifikationsabhängige Repräsentationen extrahiert. Danach wird ein Text-Encoder mit globaler und feingranularer bidirektionaler Token-Segment-Korrespondenz trainiert, die Late-Interaction mit LME nutzt. Die entstehende spezifikationssensitive Sprachrepräsentation konditioniert anschließend eine eingefrorene punktwolkenbasierte 3D-Diffusionsrichtlinie, ohne die Policy-Architektur zu ändern.

Ergebnisse

Auf Meta-World erreicht T3DP im Durchschnitt 50,3 % Erfolg gegenüber 36,1 % für T2DA und 16,2 % für DP3 (je fünf Aufgabenfamilien, drei Seeds). Auf ManiSkill sind es 54,2 % gegenüber 40,7 % T2DA und 20,4 % DP3. Auf RoboTwin verbessert T3DP die durchschnittliche Erfolgsrate um 11,0 Prozentpunkte. Auf dem realen PiPer-X-Arm steigt der Mittelwert über zwei Aufgaben und je 20 Spezifikationen von 47,5 % auf 65,0 % (plus 17,5 Prozentpunkte). Eine Aktionssonde auf Reach senkt den mittleren absoluten Fehler von 0,2567 auf 0,1238, besser als globales Alignment mit 0,1423. Bei 10, 20 und 40 Trainingsspezifikationen erzielt T3DP 32,4 %, 50,3 % und 76,4 % gegenüber 23,9 %, 36,1 % und 69,2 % für T2DA.

Grenzen

T3DP benötigt Experten-Trajektorien mit Belohnungssignalen; die Evaluation beschränkt sich auf gehaltene Spezifikationen innerhalb bekannter Aufgabenfamilien und auf vorlagenbasierte Instruktionen. Die Roboterergebnisse stammen von einem einzelnen PiPer-X-Arm mit fester Tiefenkamera und nur zwei Aufgabenfamilien. Eine Begutachtung oder Code-Veröffentlichung ist im Paper nicht berichtet.

Bedeutung für die Branche

Hersteller von Roboterarmen und Anbieter von 3D-Visuomotorik-Policies für Pick-and-Place, Montage oder Laborautomation könnten T3DP nutzen, um sprachgesteuerte Roboter ohne Nachdemonstration auf geänderte Zielpositionen oder Gelenkzustände umzustellen. Kurzfristig, innerhalb von 1 bis 3 Jahren, ist ein Einsatz in strukturierten Umgebungen denkbar, sofern belohnungsannotierte Expertendaten vorliegen und die Punktwolkenwahrnehmung zuverlässig ist. Für freie Sprachinstruktionen und neue Aufgabenfamilien ist weitere Forschung nötig.

Der Volltext wird hier nicht wiedergegeben, weil die Lizenz der Studie das nicht erlaubt. Das Original steht auf arXiv.