ROBOTNESS
上級arXiv

DiffWAM、動画基盤モデルの予測表現から直接UAV軌道を生成

Mo Zhu, Yuze Wu, Xijie Huang, Xiao Cui, Fei Gao, Xin Zhou
30秒で読む

DiffWAMは、凍結した動画基盤モデルの中間予測表現と初期フレームの幾何情報から、連続するカメラ軌道を直接復元するナビゲーション世界行動モデルである。本論文はプレプリントであり、DiffWAM-1000で軌道RMSE 0.3492 m、終点成功率74.40%を報告した。将来ビデオの生成と再構築をデプロイ時に省く経路として、UAVナビゲーションの低遅延化と実機展開可能性を示した。

研究課題

著者は、動画基盤モデルの早期予測表現にナビゲーション動作を復元できる情報が既に存在するか、どの層と段階が有効か、予測知識を距離スケールと幾何基準にどう接地するかを検証した。

問題

既存のVLNやVLAは離散的な目標選択に強く、周回やS字飛行など連続的で空間構造を持つ指示を実行可能な軌道へ変換することが苦手である。動画基盤モデルは運動の時間変化を学習しているが、従来は将来ビデオを完全生成し全フレームを再構築するため計算負荷が高く、直接行動を読む手法は表現の空間対応を壊し、距離スケールの基準も失う。

従来の手法

従来はNavDreamerやImagineUAVのように将来ビデオを生成してから軌道を再構築する方式、WorldVLNやFast-WAMのように動画モデルの潜在表現からウェイポイントや行動を復号する方式があった。前者はピクセル生成と複数フレーム再構築が重く、後者は多数の隠れ層を単純集約し空間対応や幾何基準が欠けていた。

新しい手法

DiffWAMは凍結したMiniMax H3動画バックボーンの早期スケジュール状態からDiTブロック15、25、35の特徴を選択的に抽出し、Grid-Motionで空間位置と時間にまたがる対応を保持し、初期画像からMoGe2で推定した幾何で条件付けた後、Latent2Poseが38個の将来姿勢を直接復号する。訓練では完全なビデオロールアウトとπ³再構築を使い、MoGe2深度で距離スケールを校正した教師軌道を蒸留する。FastDreamerは飛行中の推論を並列化し、観測時刻と将来のハンドオフ状態を考慮した非同期実行を行う。

結果

DiffWAMはIndoorUAV-VLAで56.77%、UAV-FLOW-Simで91.42%、DiffWAM-1000で74.40%の終点成功率を達成し、比較したWorldVLN、ImagineUAV、Fast-WAM-UAV、WorldFlyの中で最高だった。DiffWAM-1000のタスク系統別では基本動作92.00%、物体操作70.46%、空間ナビゲーション74.00%、場面理解84.00%だった。軌道精度はRMSE 0.3492 m、ADE 0.3151 m、FDE 0.4357 m、回転誤差2.9179°で、Faster-WAMの0.7011 m、0.5749 m、1.0792 m、4.5870°を上回った。実機では周回、S字、狭所通過、着陸、多段階ナビゲーションを示し、Jetson AGX Thor上のDiffWAM-FlashはモデルパイプラインP50遅延1.080秒、P95遅延1.101秒を記録した。

限界

著者は、終点成功率が軌道方向や周回範囲、着陸完了を検証しておらず、タスク特有の閉ループ完了率、物理的な距離精度、未知環境での完全なナビゲーション更新遅延を今後評価すべきと述べた。教師軌道は再構築に由来する推定メートル値であり、生成誤差や再構築ドリフト、単眼スケールバイアスを含む。DiffWAM-Flashの1.08秒は指示書き換えと外部通信を除いたモデルパイプライン遅延であり、完全な更新遅延ではない。また報告された実機実験は定性的であり、サンプル数や成功率の統計は示されていない。

産業への影響

ドローン点検、巡回、配送など自律UAVに動画基盤モデルを組み込む企業や、エッジAI搭載ドローンを開発する企業に有益である。現在は研究開発向けであり、実運用には1〜3年程度かかる見込み。障害物回避や動的実現性はプランナー側に分離されているため、安全認証や実環境での閉ループ成功率、完全更新遅延の改善が必要だ。NVIDIA Jetson AGX Thorでの1秒強のオンボード推論が可能な点は、クラウド非依存の機体設計を後押しする。

この論文はライセンス上、全文を転載できないため、要約と原文へのリンクのみを掲載しています。