音声と書き起こしを統合した人型ロボット向け発話動作生成「ECHO-G」を発表
ECHO-Gは、音声とタイムコード付き書き起こしの双方を条件として人型ロボットの全身発話動作を直接生成するフレームワークである。BEAT2由来のロボット動作データセットで比較評価し、従来の人間動作生成とリターゲティングの経路に比べFGDやビート同期などのコスピーチ指標と処理時間で優位を示し、Unitree G1での実機動作も確認した。本論文は査読前プレプリントである。
ロボティクスとフィジカルAIの最新論文と、それぞれが産業にもたらす意味。
ECHO-Gは、音声とタイムコード付き書き起こしの双方を条件として人型ロボットの全身発話動作を直接生成するフレームワークである。BEAT2由来のロボット動作データセットで比較評価し、従来の人間動作生成とリターゲティングの経路に比べFGDやビート同期などのコスピーチ指標と処理時間で優位を示し、Unitree G1での実機動作も確認した。本論文は査読前プレプリントである。
ドローン隊が道路網の渋滞を検出・予測し、その報告で信号制御を適応させるマルチエージェントシミュレーションを構築した。渋滞予測に基づく信号制御は検出に基づく場合に比べ、渋滞継続時間の短縮効果が多くのケースで約2倍となり、フリート台数を増やすよりも予測精度の向上が重要であることを示した。本論文は査読前のプレプリントである。
Optimus-Rは、視覚言語行動モデル(VLA)のタスク適応をパラメータ更新ではなく明示的なメモリ操作として定式化するフレームワークである。インラインメモリインタフェースで制御に関連するクエリとスキル表現を抽出し、クエリスキルメモリバンクに外部化することで、限られたデモでの効率的なスキル学習と破滅的忘却の緩和を実現した。本論文はプレプリントであり、LIBEROの30%データで平均成功率を16.5ポイント改善したほか、実機20デモで33.3%の成功率を報告している。
ロボットAIモデルは先の動作をひとまとまりで予測するが、そのうち何ステップを実行してから周囲を見直すかは、これまで技術者が固定値で決めることが多かった。清華大学や北京智源人工知能研究院(BAAI)などによる今回のプレプリントは、この値を動作中に自動で選ぶ追加モジュールを示し、Physical IntelligenceとNVIDIAの既存モデルを再学習せずに、シミュレーションと実機の双腕ロボットで成功率を高めた。
本プレプリントは、3Dビジオモータポリシーが学習時に見ていない細粒度な行動仕様を言語から実行する問題に取り組み、T3DPと呼ぶ枠組みを提案した。T3DPは指示のトークンと行動セグメントの局所的な対応関係を双方向に学習し、類似仕様を混同しない言語表現を獲得する。シミュレーション3ベンチマークで平均成功率をグローバルアライメント比11.0〜14.2ポイント、実機で47.5%から65.0%へ17.5ポイント改善した。
RoboCoachは、世界モデル内で長いタスクを模擬実行し、最初に失敗する部分作業と対応技能専門家を特定して追加実演を要求する枠組みである。このプレプリントでは、2つのシミュレーション環境と2台の実機で評価し、実機では150件の部分作業実演を追加するだけでFrankaの成功率を13.3%から75.0%に、AgileXを40.0%から83.8%に改善したと報告している。さらに、更新した専門家は未学習の4つの構成タスクで平均35.0%の成功率を示し、均一取得の共有方策ベースラインの0%を上回った。
A slow VLM planner (7–9 Hz) and a fast visuomotor policy (200 Hz) control a full humanoid upper body from language.
A video world model trained on robot egocentric footage predicts outcomes of actions for evaluation and planning.
論文は arXiv のロボティクス分野から取得しています。当社の要約が未作成の場合は、要旨の冒頭を表示します。