RoboCoach:世界モデルを能動的コーチに用い、再利用可能な技能専門家を選択的に改善
RoboCoachは、世界モデル内で長いタスクを模擬実行し、最初に失敗する部分作業と対応技能専門家を特定して追加実演を要求する枠組みである。このプレプリントでは、2つのシミュレーション環境と2台の実機で評価し、実機では150件の部分作業実演を追加するだけでFrankaの成功率を13.3%から75.0%に、AgileXを40.0%から83.8%に改善したと報告している。さらに、更新した専門家は未学習の4つの構成タスクで平均35.0%の成功率を示し、均一取得の共有方策ベースラインの0%を上回った。
追加実演をどこに集め、どの方策部品を更新すべきかを世界モデルの模擬実行から決めることで、長距離ロボット操作の自己改善を少ない教師データで進められるか、という問いである。
長距離操作では部品となる技能を組み合わせて多様なタスクを実行するが、局所的な実行誤りが後続の技能に伝播し、タスク全体の失敗につながる。全構成を網羅するエンドツーエンドの実演収集は物理ロボットでは収集コスト、ハードウェア時間、環境リセット、安全監視の面で非現実的であり、既存システムはどの技能に次の実演を割り当て、どの方策部品を更新するかを結びつけて判断できなかった。
一般化VLAや階層型システムは実行能力を高めるが、追加教師を再利用可能な技能単位で帰属させる仕組みがなかった。能動的および矯正的模倣学習は方策失敗を次の教師選択に使うが、長距離タスク内のどの技能が原因かを世界モデルで診断して対象を絞る経路が弱かった。世界モデルは方策評価や模擬経験生成に用いられてきたが、実世界の追加実演をどの専門家に要求するかを決める能動的コーチとしての役割は未確立だった。
RoboCoachはRoute、Imagine、Diagnose、ImproveのRIDIループを構成する。共有VLAバックボーン上に技能ごとのLoRA専門家を設け、部分作業と専門家の組を改善の基本単位とする。まずルータが未完了の部分作業を選択し、対応する専門家を起動する。次に共有の行動条件付き世界モデルCoachWorld内で閉ループ模擬実行し、進捗判定器RoboMeterが現在の部分作業の完了を判定する。時間制限まで未完了の場合、最初のタイムアウト部分作業と専門家を記録する。複数の模擬試行からタスク均衡な初回タイムアウト質量を計算し、優先度の高い組に追加実演を要求する。取得した実演は対応する専門家のLoRAだけを更新し、更新済み専門家を次のループに戻す。CoachWorldは単腕・双腕の身体を共通のエンドエフェクタ軌道表現とカメラ校正で扱い、実演、方策失敗、遊びデータなどを条件付きフローマッチングで学習する。
評価はLIBEROの10タスク、RoboTwin 2.0の5タスク、Franka Research 3とAgileX双腕の実機で実施し、シミュレーション各50試行、実機各20試行を用いた。凍結した22のタスクと方策の組で、模擬実行と実展開の成功率のSpearman相関は0.840だった。進捗判定器は参照動画でSwitch MAE 0.414秒、[email protected]秒82.73%、outcome F1 88.21%、CoachWorld生成観測でもF1 83.84%を達成した。固定予算の改善では、実機で150件の部分作業実演追加後、Frankaは13.3%から75.0%、AgileXは40.0%から83.8%に向上し、同じ予算の均一取得共有アダプタは30.0%と47.5%だった。Budget AUCはFrankaで53.1対18.9、AgileXで72.7対46.3だった。シミュレーションでは3ラウンド後、RoboCoachはLIBEROで71.2%、RoboTwinで68.0%に達し、4条件中最高だった。同じ対象実演を共有アダプタではなく対応する技能専門家に適用すると、LIBEROで3.4ポイント、RoboTwinで13.2ポイント最終成功率が向上した。未学習の4つの構成タスクでは、RoboCoachが平均35.0%で成功し、均一取得共有方策ベースラインは全ケース0%だった。内訳はAgileXの継続構成65%、Frankaの交差構成15%、AgileXの順序反転25%、Frankaの順序反転35%だった。
操作対象が遮蔽された場合や接触・衝突がカメラ視野外で起こる場合、該当領域の物理モデリングと予測が難しくなる。RoboCoachはタスク関連の証拠を保つ行動条件付き予測に依存しており、遮蔽や視野外相互作用の下では依然として難しい。生成シード間の合意は確率的変動への感度を下げるが、系統的な世界モデルバイアスを排除できない。専門家ライブラリは技能意味論で事前定義されており、構造を学習して人手の実演を減らすことは未解決である。また、コード公開や査読状況については論文で報告されていない。
産業用マニピュレータや物流ピッキング、卓上サービスロボットを開発する企業が、実機データ収集コストを抑えながら技能別の改善を回すために利用できる可能性がある。現在から1年程度は、既知の作業セルで技能ライブラリを定義でき、世界モデルの予測精度と進捗判定を検証できる環境での試験導入が考えられる。1〜3年後には、複数ロボットや多品種のピック・プレース工程への展開が期待されるが、その前に対象環境での世界モデルの較正、進捗判定閾値の設定、安全監視下のデータ収集手順の確立が必要である。3年以上先の汎用ロボットへの適用には、視野外接触や遮蔽に頑健な予測、技能構造の自動獲得、実演要求の自律実行が条件になる。
この論文はライセンス上、全文を転載できないため、要約と原文へのリンクのみを掲載しています。