ECHO-G: Vollkörper-Co-Speech-Bewegungsgenerierung für humanoide Roboter aus Audiospur und zeitlich zugeordnetem Transkript
ECHO-G ist ein als Preprint veröffentlichtes Framework zur Vollkörper-Co-Speech-Bewegungsgenerierung für humanoide Roboter. Es kombiniert frame-genaue akustische Merkmale mit token-basiertem Transkriptkontext in einem Diffusion-Transformer und erzeugt direkt Bewegungsreferenzen im Roboterkoordinatenraum. Auf einem aus BEAT2 abgeleiteten G1-Datensatz erreicht der Ansatz die besten Co-Speech-Kennzahlen und die niedrigste Inferenzzeit pro Frame; in einem Nutzerstudium mit 45 Personen wird die gemeinsame Audio-Text-Konditionierung bevorzugt.