ROBOTNESS
上級arXiv

RL誘導型PAC-NMPCが未知環境の視覚ベース航法で確率的安全を実現

Adam Polevoy, Dillon Capalongo, Katherine Tang, Mark Gonzales, Marin Kobilarov, Joseph Moore
30秒で読む

強化学習で訓練したアクタークリティックとセンサ予測モデルをPAC-NMPCに統合し、未知環境での知覚ベース航法に有限時間の確率的衝突回避保証を与える手法を提案した。固定翼機の実機実験では成功率80パーセントを達成し、RL単独方策や地図とA*を用いるPAC-NMPCの40パーセントを上回った。本論文はarXivプレプリントであり、査読済みではない。

研究課題

強化学習の長期的な性能と確率的MPCの安全保証を、未知環境の知覚ベース航法において両立できるか

問題

俊敏で劣駆動なロボットが未知環境をオンボードセンサのみで航行する場合、NMPCは短い計画ホライズンのため近視眼的になり、RLは分布外でハード制約を保証できないという課題がある。

従来の手法

従来はNMPCとRLのハイブリッド(PETS、POLO、LOOP、TD-MPC、Safe RL-MPC、PSFなど)が試みられたが、確率的価値関数と安全性保証を同時に備え、高次元の知覚入力と実機実証を満たす手法はなかった。また、学習によるNMPCのウォームスタートや学習ウェイポイントの手法は、未知環境での局所知覚を扱う例が少なかった。

新しい手法

確率的アクタークリティックをモンテカルロドロップアウトで近似し、将来のセンサ測定を予測する生成モデルを訓練する。PAC-NMPCの決定変数をRLアクターでウォームスタートし、価値関数分布を終端コストとして利用し、有限ホライズンの価値関数改善制約を加える。これにより、PAC-NMPCのサンプリングベース最適化が確率的コストと制約違反の上界を保証しつつ、RLの長期的挙動を利用する。

結果

固定翼機のシミュレーション100環境では、提案手法の成功率は90パーセント、成功試行の平均累積コストは513.3で、RLアクター単独(81パーセント、468.1)、地図とA*と未知空間コストを用いるPAC-NMPC(85パーセント、718.14)を上回った。分布外環境ではRLアクター46パーセント、PAC-NMPC 76パーセント、提案手法76パーセントで、コストは提案手法512.1に対しPAC-NMPC 732.6だった。アブレーションではウォームスタートと学習センサ予測の両方を欠くと成功率が3パーセントと11パーセントに低下した。固定翼実機10環境では成功率80パーセント、コスト252.2で、RLアクター40パーセント、PAC-NMPC 40パーセントを上回った。1/10スケールラリーカー実機20環境では、学習価値関数付きPAC-NMPCが成功率95パーセント、衝突違反0パーセント、アクター単独85パーセント、違反15パーセントだった。確率的Dubins車シミュレーションでは、制約ペナルティが小さい領域でアクター単独より高い成功率を示し、アクター軌道が実行不能な場合に事前方策へ切り替えることで安全性が向上した。

限界

著者らは、センサ予測とPAC-NMPCをループ内で統合する共同訓練、MCドロップアウトの不確実性の校正と上界付け、推定価値関数と真の価値関数のギャップ解析を今後の課題としている。固定翼実機は10環境、UGV実機は20環境と評価規模が限定的であり、シミュレーションでも分布外設定は単純な水平障害物の追加のみである。コード公開の有無は論文では報告されていない。

産業への影響

固定翼ドローンや自律移動ロボットを手掛ける企業、特に倉庫内搬送、インフラ点検、緊急対応用途に関係する。現在から1年から3年で、安全保証が求められる知覚ベースナビゲーションのプロトタイプに適用可能だが、計算負荷の低減と不確実性校正が前提となる。3年以上では、確率的保証の認証基準が整備されれば、航空機や自動運転など高リスク領域への展開も考えられる。

この論文はライセンス上、全文を転載できないため、要約と原文へのリンクのみを掲載しています。