ROBOTNESS
研究

論文

ロボティクスとフィジカルAIの最新論文と、それぞれが産業にもたらす意味。

論文8本
日本語版は未提供のため、英語原文で表示しています。
arXiv
Co-speech Humanoid中級

音声と書き起こしを統合した人型ロボット向け発話動作生成「ECHO-G」を発表

Yizhao Li, Pusen Gao, Ming Wang, Shaojie Shen, Shuo Yang, Hao Xu

ECHO-Gは、音声とタイムコード付き書き起こしの双方を条件として人型ロボットの全身発話動作を直接生成するフレームワークである。BEAT2由来のロボット動作データセットで比較評価し、従来の人間動作生成とリターゲティングの経路に比べFGDやビート同期などのコスピーチ指標と処理時間で優位を示し、Unitree G1での実機動作も確認した。本論文は査読前プレプリントである。

arXiv
UAV traffic monitoring中級

渋滞予測に基づくドローン信号制御、検出ベースより短縮効果が約2倍

Samira Hayat, Christian Raffelsberger

ドローン隊が道路網の渋滞を検出・予測し、その報告で信号制御を適応させるマルチエージェントシミュレーションを構築した。渋滞予測に基づく信号制御は検出に基づく場合に比べ、渋滞継続時間の短縮効果が多くのケースで約2倍となり、フリート台数を増やすよりも予測精度の向上が重要であることを示した。本論文は査読前のプレプリントである。

arXiv
Memory-centric VLA中級

Optimus-R、VLA適応をメモリ中心に再設計し少データ性能を大幅改善

Zaijing Li, Rui Shao, Bing Hu, Haoyu Zhang, Dongmei Jiang, Liqiang Nie

Optimus-Rは、視覚言語行動モデル(VLA)のタスク適応をパラメータ更新ではなく明示的なメモリ操作として定式化するフレームワークである。インラインメモリインタフェースで制御に関連するクエリとスキル表現を抽出し、クエリスキルメモリバンクに外部化することで、限られたデモでの効率的なスキル学習と破滅的忘却の緩和を実現した。本論文はプレプリントであり、LIBEROの30%データで平均成功率を16.5ポイント改善したほか、実機20デモで33.3%の成功率を報告している。

arXiv
VLA中級

ChunkTrust:アクションエキスパートの手がかりでロボット方策の実行ホライズンを適応的に決める

Fanding Huang, Jingyan Jiang, Shifeng Bao, Mingkang Pu, Shiwei Li, Jing Xu, Shijia Xu, Guanbo Huang, Chenghao Gu, Yuzhi Huang, Chenxin Li, Faisal Nadeem Khan, Huan Yang, Yan Wang, Cheng Chi, Zhi WangTsinghua University, Beijing Academy of Artificial Intelligence (BAAI), Renmin University of China, Shenzhen Technology University, Hefei University of Technology, Jiangnan University, Chongqing University, The Chinese University of Hong Kong

ロボットAIモデルは先の動作をひとまとまりで予測するが、そのうち何ステップを実行してから周囲を見直すかは、これまで技術者が固定値で決めることが多かった。清華大学や北京智源人工知能研究院(BAAI)などによる今回のプレプリントは、この値を動作中に自動で選ぶ追加モジュールを示し、Physical IntelligenceとNVIDIAの既存モデルを再学習せずに、シミュレーションと実機の双腕ロボットで成功率を高めた。

arXiv
Text-to-3D Policy中級

T3DPが未見仕様の汎化を改善、言語と3D行動の局所アライメントで成功率向上

Xinhao Yang, Wenhao Wu, Ning Lv, Yanshen Ding, Zhenhong Sun, Daoyi Dong, Chunlin Chen, Zhi Wang

本プレプリントは、3Dビジオモータポリシーが学習時に見ていない細粒度な行動仕様を言語から実行する問題に取り組み、T3DPと呼ぶ枠組みを提案した。T3DPは指示のトークンと行動セグメントの局所的な対応関係を双方向に学習し、類似仕様を混同しない言語表現を獲得する。シミュレーション3ベンチマークで平均成功率をグローバルアライメント比11.0〜14.2ポイント、実機で47.5%から65.0%へ17.5ポイント改善した。

arXiv
Manipulation中級

RoboCoach:世界モデルを能動的コーチに用い、再利用可能な技能専門家を選択的に改善

Jiajun Liu, Yifan Chen, Yichao Liu, Jiayi Zhang, Ruoqu Chen, Shaoxuan Xie, Guocai Yao, Mengdi Xu, Sen Cui, Changshui Zhang

RoboCoachは、世界モデル内で長いタスクを模擬実行し、最初に失敗する部分作業と対応技能専門家を特定して追加実演を要求する枠組みである。このプレプリントでは、2つのシミュレーション環境と2台の実機で評価し、実機では150件の部分作業実演を追加するだけでFrankaの成功率を13.3%から75.0%に、AgileXを40.0%から83.8%に改善したと報告している。さらに、更新した専門家は未学習の4つの構成タスクで平均35.0%の成功率を示し、均一取得の共有方策ベースラインの0%を上回った。

論文は arXiv のロボティクス分野から取得しています。当社の要約が未作成の場合は、要旨の冒頭を表示します。