T3DP: Feingranulare Sprach-Verhaltens-Ausrichtung für Text-to-3D-Policies
Der Preprint stellt T3DP vor, ein Framework, das feingranulare Sprach-Verhaltens-Ausrichtung nutzt, um textgesteuerte 3D-Diffusionsrichtlinien für ungesehene Verhaltensspezifikationen zu verbessern. In Simulationen (Meta-World, ManiSkill, RoboTwin) erreicht T3DP durchschnittlich 11,0 bis 14,2 Prozentpunkte mehr Erfolg als globale Ausrichtung; auf einem realen PiPer-X-Roboter steigt der Durchschnitt von 47,5 auf 65,0 Prozent. Die lokale Zuordnung von Instruktionstoken zu Verhaltenssegmenten erhält spezifikationsrelevante Unterschiede, die globale Verfahren oft verwischen.