Co-speech Humanoid进阶
ECHO-G 让 Unitree G1 边说话边做全身手势,FGD 降至 2.278
这是一篇预印本,提出 ECHO-G 框架,从语音音频和带时间戳的转录直接生成人形机器人全身协同语音动作。在 BEAT2 派生数据集的说话人留出验证集上,ECHO-G 的 FGD 为 2.278,优于 EMAGE+GMR 的 4.976、GestureLSM+GMR 的 5.008 和 Human-Retargeted 的 4.725,并在 Unitree G1 真机上部署。该框架省去人体动作重定向,端到端推理时间降至 5.96 毫秒每帧,并公开数据集与代码。