ROBOTNESS
中級arXiv

T3DPが未見仕様の汎化を改善、言語と3D行動の局所アライメントで成功率向上

Xinhao Yang, Wenhao Wu, Ning Lv, Yanshen Ding, Zhenhong Sun, Daoyi Dong, Chunlin Chen, Zhi Wang
30秒で読む

本プレプリントは、3Dビジオモータポリシーが学習時に見ていない細粒度な行動仕様を言語から実行する問題に取り組み、T3DPと呼ぶ枠組みを提案した。T3DPは指示のトークンと行動セグメントの局所的な対応関係を双方向に学習し、類似仕様を混同しない言語表現を獲得する。シミュレーション3ベンチマークで平均成功率をグローバルアライメント比11.0〜14.2ポイント、実機で47.5%から65.0%へ17.5ポイント改善した。

研究課題

言語で指定された未見の行動仕様、例えば目標位置や変位、関節状態を、3Dポリシーが正確に実行できるようにするには、言語と行動のどの粒度で対応付けを学習すべきか。

問題

既存のテキストから3Dポリシーは、同じタスク系列内でも目標位置や押す距離、開閉状態などが異なる未見仕様を実行できない。事前学習済み言語表現や大域的な言語行動アライメントはタスク意味の一致を捉えるが、類似仕様を区別する局所的な言語要素と行動成分の対応が平均化で失われ、同一観測から複数の正しい行動が存在する場合に誤った仕様を選ぶ。

従来の手法

従来は、事前学習済み言語モデルの埋め込みをそのままポリシー条件にする方法や、指示と軌跡全体をそれぞれ単一のベクトルに圧縮して対照学習する大域的アライメント(T2DAなど)が用いられた。また、DP3、3DDA、3D-LOTUSなど点群ベースの3D拡散ポリシーが言語条件付きで使われてきた。これらの弱点は、仕様を区別する局所的な言語要素や行動区間がプーリングで薄れ、近接する仕様の表現が崩壊しやすい点である。

新しい手法

T3DPは3段階で学習する。第1段階では、デモ軌跡の窓から報酬予測によって仕様依存の行動表現を獲得する行動エンコーダを学習する。第2段階では、行動エンコーダを凍結し、テキストエンコーダをLoRAで微調整しながら、指示トークンと状態行動隠れ状態との双方向の遅延相互作用スコアによる局所対照損失と、全体プーリング表現による大域対照損失を組み合わせて最適化する。第3段階では、整列済みテキストエンコーダを凍結し、そのプール表現を条件として点群観測と自己受容感覚から行動系列を生成する3D拡散ポリシーを学習する。ポリシーアーキテクチャ自体は変更しない。

結果

Meta-Worldでは平均成功率50.3%で、最強ベースラインT2DAの36.1%から14.2ポイント向上し、5タスク全てで改善した。ManiSkillでは平均54.2%でT2DAの40.7%から13.5ポイント向上し、全タスクで上回った。特にPush Cubeは47.3%対15.0%だった。RoboTwinを含む3ベンチマークでは大域的アライメント比で11.0〜14.2ポイントの改善となり、15タスク全てで上回った。実機のAgileX PiperXでは2タスク各20仕様の評価で平均成功率が47.5%から65.0%へ17.5ポイント向上した。行動プローブ解析ではReachの平均絶対誤差が0.2567から0.1238へ低下し、大域的アライメントの0.1423を上回った。評価はシミュレーション3ベンチマークと実機2タスクで、各結果は3シード平均(実機は20仕様)である。

限界

著者らは、T3DPが報酬信号付きの専門家軌跡を必要とすること、評価が既知タスク系列内の未見仕様かつテンプレート化された指示に限られることを限界として挙げている。加えて、実機評価は2タスクのみで、未見タスク系列や自由形式指示、多様なロボット身体への拡張は示されていない。コード公開や査読済み採録の有無は論文では報告されていない。

産業への影響

部品配置、ピックアンドプレース、ドア開閉などを言語で細かく指示する産業用マニピュレータやサービスロボットの基盤に使える可能性がある。特に、同一シーンで複数の動作が可能な作業や、目標位置や押す量を作業指示として与える用途に向く。ただし現状は既知タスク系列内のテンプレート指示と報酬付きデモが必要で、自由形式指示や未知タスク、複数ロボットへの展開には1〜3年程度の追加研究が必要である。まずはデモデータに報酬を付与できる企業内セットアップや、指示テンプレートが明確な工程からの実証が現実的である。

この論文はライセンス上、全文を転載できないため、要約と原文へのリンクのみを掲載しています。