Co-speech Humanoid中級
音声と書き起こしを統合した人型ロボット向け発話動作生成「ECHO-G」を発表
ECHO-Gは、音声とタイムコード付き書き起こしの双方を条件として人型ロボットの全身発話動作を直接生成するフレームワークである。BEAT2由来のロボット動作データセットで比較評価し、従来の人間動作生成とリターゲティングの経路に比べFGDやビート同期などのコスピーチ指標と処理時間で優位を示し、Unitree G1での実機動作も確認した。本論文は査読前プレプリントである。
ロボティクスとフィジカルAIの最新論文と、それぞれが産業にもたらす意味。
ECHO-Gは、音声とタイムコード付き書き起こしの双方を条件として人型ロボットの全身発話動作を直接生成するフレームワークである。BEAT2由来のロボット動作データセットで比較評価し、従来の人間動作生成とリターゲティングの経路に比べFGDやビート同期などのコスピーチ指標と処理時間で優位を示し、Unitree G1での実機動作も確認した。本論文は査読前プレプリントである。
論文は arXiv のロボティクス分野から取得しています。当社の要約が未作成の場合は、要旨の冒頭を表示します。