ROBOTNESS
上級arXiv

局所全身VLAをシーン規模空中マニピュレーションへ拡張、MPARで実測進捗に整合

Weixiang Guo, Rui Jin, Haotian Jin, Xinhang Xu, Ruiyang Liu, Haoran Zhao, Yi Wang, Weiqi Gai, Kun Cao, Lihua Xie
30秒で読む

本研究は、多関節空中マニピュレータ向けに、合成データで学習した局所全身VLA行動をシーン規模ミッションに合成するフレームワークを提案した。主要な結果として、シミュレーションでのマルチサイト任務成功率42.0%、500ms遅延下でのMPARによるテイクオーバー位相誤差の中央値0.212秒削減、実機での多関節UAM検証を報告した。本論文は査読済み採録が明記されていないプレプリントである。

研究課題

自然言語で指定される複数サイトの空中操作を、多関節空中マニピュレータが実行するために、局所全身VLA行動をどのように学習し、物理実行時の進捗に整合させ、シーン規模で合成するか、という問いである。

問題

多関節UAMではベース、アーム、グリッパの連成運動が運動限界を満たす必要があり、実機での多様なタスク条件付きデモ収集が高コストかつ危険である。推論と実行が非同期に進むため、新しいアクションチャンク到着時に経過時間と実際の進捗がずれ、チャンクを連続かつ運動限界内で接続する必要がある。さらに自然言語の関係性目標を物体インスタンスと実行可能な全身ハンドオフ状態へ接地し、空間的に離れたサイト間を衝突回避しつつ移動する仕組みが不足している。

従来の手法

従来のVLAは、シミュレータ遠隔操作、生成航法軌道、手持ちクロスエンボディメントデモなどから教師データを取得しており、人間デモへの依存、航法中心、外観拡張のみ、エンドエフェクタ中心表現といった限界があった。実行時にはAirVLAがRTCで非同期実行を扱い、モデルベースプランナが動的実行可能軌道を生成するが、遅延整合と制約付き軌道実現は別々に扱われてきた。SayPlanやUSS-Navなどのシーングラフ手法は言語目標を意味インスタンスや領域に解決するが、全身技能を開始できる実行可能なインタラクション領域とトポロジー誘導転送までは統合していなかった。

新しい手法

本研究は、物理プラットフォームのデモを使わず、再構成可能な3DGSパイプラインでタスク条件付きの運動力学的に実行可能な全身専門家軌道と同期多視点画像を生成し、π0.5をLoRAでfine-tuningして局所VLAを学習した。実行時はMPARが推定ハンドオフ状態を新規VLA経路へ射影し、実測進捗に基づく位相整合と連続テイクオーバーを行い、MINCOで制約付き軌道に変換する。さらにリレーショナルScene Graphが言語目標を物体インスタンスと実行可能なインタラクション領域に接地し、多面体トポロジー誘導転送でサイト間を接続する。

結果

シミュレーションはMuJoCo、実機は多関節UAMで実施し、同一モデル、初期条件、タスク、乱数シードを用いたペア評価を行った。マルチサイト任務では、Monolithic Whole-Task VLAが0/50だったのに対し、提案システムは21/50の成功で成功率42.0%だった。ローカル技能は、oracle targetかつfeasible handoff条件で39/60成功し、内訳は物体取得14/30、取得後25/30だった。実行方式の比較では、各手法120試行のうちMPARが78/120で65.0%、nominal-time ablation 71/120で59.2%、RTC-Direct 54/120で45.0%となり、C3条件ではMPAR 23/30、nominal-time 16/30、RTC-Direct 12/30だった。500ms遅延を含むC2/C3の60ペアエピソードでは、MPARがテイクオーバー位相誤差のP50とP95を平均0.212秒と0.315秒削減し、スキップ経路と繰り返し経路を7.44cmと1.89cm削減、候補軌道拒否率を17.42%から12.81%へ低下させた。衝突発生件数はRTC-Direct 22/120、nominal-time 4/120、MPAR 1/120だった。実機では、ボトル把持2/5、直方体把持1/5、散水3/5、収納3/5、フルシステムのWater Plant任務2/5を達成した。

限界

著者は、事前構築済みのScene Graphをメトリック地図に位置合わせし、VLA推論を遠隔のNVIDIA RTX 5090に依存していること、ミッションレベルの性能が個々のローカル技能に制約されることを限界として挙げた。また、シミュレーションのマルチサイト成功率は42.0%にとどまり、失敗29件中28件がローカルVLAインタラクションで発生し、物体取得が主なボトルネックである。実機検証は各技能5試行、フルシステム5試行と少なく、単一の多関節UAM構成での結果である。他のプラットフォームや環境への一般化、コード公開については論文では報告されていない。

産業への影響

現在は研究開発段階であり、倉庫内ピック、植物管理、保守点検など、構造化環境での空中マニピュレータによる把持、配置、散水タスクの技術検証に利用できる可能性がある。1〜3年では、単一施設内で事前構築済みScene Graphと限られたスキルセットを前提としたパイロット導入が考えられる。3年以上では、オンラインScene Graph構築、オンボード推論、閉ループ失敗処理、多様な接触作業の拡張、安全認証が進めば、屋外点検や緊急対応などへ展開できる可能性がある。ただし、それにはローカル技能の成功率改善と実機での大規模検証が必要である。

この論文はライセンス上、全文を転載できないため、要約と原文へのリンクのみを掲載しています。