Optimus-R、VLA適応をメモリ中心に再設計し少データ性能を大幅改善
Optimus-Rは、視覚言語行動モデル(VLA)のタスク適応をパラメータ更新ではなく明示的なメモリ操作として定式化するフレームワークである。インラインメモリインタフェースで制御に関連するクエリとスキル表現を抽出し、クエリスキルメモリバンクに外部化することで、限られたデモでの効率的なスキル学習と破滅的忘却の緩和を実現した。本論文はプレプリントであり、LIBEROの30%データで平均成功率を16.5ポイント改善したほか、実機20デモで33.3%の成功率を報告している。
VLAモデルが新しいタスクやドメインに限られたデモで適応する際、モデルパラメータを繰り返し更新せずに、明示的なメモリインタフェースを通じてスキルを獲得・保存・再利用できるか。
既存のVLA適応はパラメータ中心であり、新しいスキルを学ぶたびにモデル重みへ暗黙の変更が加わるため、適応コストが高く、既習タスクとの干渉による破滅的忘却が生じる。外部検索メモリはVLAの行動条件付け経路との結合が弱く、制御に関わる情報を十分に符号化できない。またドメインシフトによりクエリと保存スキルの不一致が起きる。
従来はfull fine-tuning、LoRA、OpenVLA-OFT、VLA-Adapterなどのパラメータ更新型適応が主流である。メモリ拡張手法でもデモや経験を外部コンテキストとして付与するものが多いが、スキルが制御経路と疎結合で、再利用や拡張が難しく、継続学習で干渉が生じる。
Optimus-Rは、学習可能なメモリトークンをVLAのプレフィックスストリームに挿入するInline Memory Interfaceを導入し、バックボーン内で制御を意識したクエリ表現とスキル表現を抽出する。クエリスキルメモリバンクにはクエリプロトタイプとスキル値を分離して格納し、クラスタリングや残差更新によって再利用・追加・修正を行う。Bridge-and-Adapt機構は軽量アダプタと残差メモリ更新でターゲットドメインのクエリとスキルを既存メモリ空間に整合させる。学習は3段階で、インタフェース事前学習、ブリッジ適応、メモリ適応を実施する。
シミュレーション評価では、LIBEROの4スイート各500ロールアウト、CALVINのABC→Dで500ロールアウト、RoboTwin 2.0 Hardでタスクあたり100ロールアウトを実施した。30%データでOptimus-RはLIBERO平均成功率88.6%を達成し、π0.5の72.1%から16.5ポイント改善した。CALVIN平均完了長は2.51でπ0.5の2.09を0.42上回り、RoboTwin 2.0 Hardは14.8%でπ0.5の9.8%を5.0ポイント上回った。100%データではLIBERO平均97.8%、RoboTwin 2.0 Hard 55.0%となり、比較手法中最高だった。実機9タスクのクロスドメイン適応では、タスクあたり20デモで平均成功率33.3%を記録し、π0.5の19.4%を13.9ポイント上回った。80デモでは72.2%で、RDT、OpenVLA、OpenVLA-OFT、π0、π0.5を上回った。実機の生涯学習では、20デモの新タスク成功率21.0%でπ0.5を11.0ポイント上回り、80デモ適応後の平均忘却率は10.0%で、OpenVLA-OFTとπ0.5の15.0%より低かった。計算コストではLIBERO100%データで86 GPU時間、推論14Hzであり、π0.5 LoRAの128 GPU時間、12Hzより優れた。アブレーションではStage-B Bridgeを除くと20デモ実機成功率が33.3%から12.8%に低下した。
著者は明示的な限界を述べていない。ただし、実機評価はGALAXEA R1 Liteの単一バイマニュアルロボットによる9タスクに限られ、シミュレーション評価も固定のベンチマークのみである。メモリバンクのサイズや検索数などのハイパーパラメータの影響、複数VLAバックボーンへの一般性、コード公開の有無は論文では報告されていない。
ロボットメーカーや倉庫・サービスロボット事業者は、VLA基盤モデルを現場タスクへ少ないデモで適応させるコストを削減できる可能性がある。特にパラメータ更新を抑えつつ継続的に新スキルを追加できる点は、マニピュレーションのライン変更や品種追加が多い現場に適する。ただし、本成果はプレプリントであり、複数環境での再現性や実ロボットの長期運用検証が前提となる。実用化は1〜3年程度を要する。
この論文はライセンス上、全文を転載できないため、要約と原文へのリンクのみを掲載しています。