ROBOTNESS
上級arXiv

検証ゲート付き継続学習で四脚ロボットの地形走破性を予測、履歴忘却を23.1%低減

Luca Bricarello, João Carlos Virgolino Soares, Alberto Sanchez-Delgado, Fulvio Mastrogiovanni, Claudio Semini
30秒で読む

本論文は、四脚ロボットが未踏地形で得た接触指標を、DINOv3の視覚特徴から不確実性付きで予測する継続学習パイプラインを提案したプレプリントである。逐次的な実機データストリームで、履歴検証ゲート付きリプレイはゲートなしリプレイに比べ最終アンカーNLL劣化を23.1%相対低減し、新地形への適応はほぼ同等だった。この手法は、地形の見た目ではなくロボット自身の接触応答に基づく走破性評価を可能にする点で重要である。

研究課題

履歴検証ゲートを加えたリプレイ型継続学習は、過去地形の保持を改善しつつ新地形への適応を損なわないか。

問題

四脚ロボットの安全なナビゲーションでは、地形の幾何形状や見た目だけでは滑り、荷重、エネルギー消費などの接触応答を予測できない。既存のオンライン適応システムは、逐次的な経験の蓄積に伴って過去の地形を忘却し、分布外の観測に対して過信する傾向があり、複数の接触指標を信頼度付きで扱う仕組みも欠けていた。

従来の手法

従来手法では、WVNやCOTRATEがオンラインの視覚走破性学習を、SALONやLeeらの手法が経験バッファや生成的リコールによる保持を、EVORAが証拠回帰による不確実性推定を扱ってきた。しかし、複数の足裏接触指標を個別の信頼度で重み付けして予測し、最近の履歴データと過去の履歴データの両方で候補モデルを検証するゲート付き継続学習を統合した手法は報告されていなかった。

新しい手法

新しい点は、事前学習済みのDINOv3 ViT-S/16を凍結した視覚特徴抽出器と、Normal Inverse Gamma分布を出力する小型の証拠回帰MLPを組み合わせ、平面足滑り、平均垂直床反力、トラクション指数、移動コスト、接地荷重速度の5指標を予測する点である。教師信号は接触前の画像と接触後に得られる固有受容指標を因果的に対応付け、指標ごとの測定信頼度で重み付けする。継続学習では、最近の学習データと最大150件のリプレイを組み合わせて候補モデルを訓練し、最近の検証データでのNLL改善と、履歴アンカーでの劣化を0.15%以内に制限する検証ゲートを通過した場合のみモデルを置き換える。推論時には、予測値と認識論的不確実性を0.1 m解像度のグリッドマップに投影し、プロパティ重みを再学習なしで変更できる走破性スコアに融合する。実装はUnitree Go2とRealSense D435でROS 2上に構築し、Isaac Simでも評価した。

結果

オフライン予測では、実機の平面足滑りMAEが0.0047 m、R^2が0.4110、トラクション指数MAEが0.0296、垂直床反力MAEが3.6191 N、移動コストMAEが0.235608、接地荷重速度MAEが321.605 N/sだった。シミュレーションでは平面足滑りMAE 0.0050 m、トラクション指数MAE 0.0711だった。逐次的な実機ストリームでは、CL-Pは新地形適応が平均1.658%、Replayは1.664%とほぼ同等で、独立した実験室床テストでの劣化はCL-Pが0.801%、Replayが0.924%、アンカーNLL劣化はCL-Pが0.608%、Replayが0.790%であり、ゲートにより23.1%の相対低減を達成した。最終マクロ標準化MAEはCL-Pが1.03711、Replayが1.03633だった。シミュレーションのナビゲーション試験では、OfflineとCL-Pが5回中5回成功し、不整地への曝露率はそれぞれ3.13%と2.76%、平均経路長は23.75 mと24.53 mだった。

限界

著者らは、逐次的な実機比較が1本の記録ストリームと5つの最適化シードのみで実施され、シミュレーションと実機でモデルを別々に訓練したことを限界として挙げている。また、ナビゲーション評価はシミュレーションのみで、ゲートの効果をナビゲーション性能から分離しておらず、変形地形や多様な歩容条件、長期的な地形シーケンスは未検証である。さらに、コード公開の有無は論文では報告されていない。単一ロボットプラットフォームでの評価であり、試行回数も限られている。

産業への影響

本手法は、Unitree、Boston Dynamics、ANYboticsなどの四脚ロボットメーカーが手掛ける点検、建設、農業、災害対応向けナビゲーションスタックに応用できる可能性がある。ROS 2実装が既に存在するため研究用プラットフォームでは現在でも試用可能だが、製品レベルの導入には1年から3年程度の検証が必要である。その前に、より多様で長期的な地形シーケンスでの実機評価、搭載計算機での実行可能性、変形地形や異なる歩容への一般化、安全基準への適合が満たされる必要がある。

この論文はライセンス上、全文を転載できないため、要約と原文へのリンクのみを掲載しています。