ROBOTNESS
Forschung

Studien

Neue Studien zu Robotik und Physical AI, jeweils mit ihrer Bedeutung für die Branche.

8 Studien
Noch nicht auf Deutsch verfügbar: Anzeige im englischen Original.
arXiv
Co-speech HumanoidFortgeschritten

ECHO-G: Vollkörper-Co-Speech-Bewegungsgenerierung für humanoide Roboter aus Audiospur und zeitlich zugeordnetem Transkript

Yizhao Li, Pusen Gao, Ming Wang, Shaojie Shen, Shuo Yang, Hao Xu

ECHO-G ist ein als Preprint veröffentlichtes Framework zur Vollkörper-Co-Speech-Bewegungsgenerierung für humanoide Roboter. Es kombiniert frame-genaue akustische Merkmale mit token-basiertem Transkriptkontext in einem Diffusion-Transformer und erzeugt direkt Bewegungsreferenzen im Roboterkoordinatenraum. Auf einem aus BEAT2 abgeleiteten G1-Datensatz erreicht der Ansatz die besten Co-Speech-Kennzahlen und die niedrigste Inferenzzeit pro Frame; in einem Nutzerstudium mit 45 Personen wird die gemeinsame Audio-Text-Konditionierung bevorzugt.

arXiv
UAV traffic monitoringFortgeschritten

Vorhersage statt Erkennung: Drohnengestützte Stauprognose verbessert adaptive Ampelsteuerung

Samira Hayat, Christian Raffelsberger

Das Paper ist ein Preprint, der eine Multiagenten-Simulation vorstellt, in der Drohnen Verkehrsstaus an Knotenpunkten erkennen und vorhersagen, um adaptive Ampelschaltungen auszulösen. Zentrale Ergebnisse sind, dass die Leistung ab einer Drohnenzahl etwa gleich der Knotenanzahl abflacht und dass eine vorausschauende Signaladaption die Staudauer ungefähr doppelt so stark reduziert wie eine reaktive Erkennung. Die Vorhersagegenauigkeit bleibt jedoch bei maximal 55 Prozent begrenzt, was auf Verbesserungsbedarf bei den Vorläufersignalen hinweist.

arXiv
Memory-centric VLAFortgeschritten

Optimus-R: Memory-centric Framework für Vision-Language-Action-Modelle

Zaijing Li, Rui Shao, Bing Hu, Haoyu Zhang, Dongmei Jiang, Liqiang Nie

Das Preprint stellt Optimus-R vor, ein memory-centric Framework zur Adaption von Vision-Language-Action-Modellen (VLA). Es führt eine Inline Memory Interface, eine Query-Skill Memory Bank und einen Bridge-and-Adapt-Mechanismus ein, um Roboterfähigkeiten als explizite Speichereinträge zu lernen und wiederzuverwenden. In Experimenten auf LIBERO, CALVIN und RoboTwin 2.0 verbessert Optimus-R die Dateneffizienz deutlich und erreicht im Cross-Domain-Transfer mit 20 Demonstrationen pro Aufgabe 33,3 % Erfolgsrate auf einem echten Roboter, 13,9 Prozentpunkte über der Baseline.

arXiv
VLAFortgeschritten

ChunkTrust: Ausführungshorizonte von Roboter-Policies anhand von Signalen des Action-Experts anpassen

Fanding Huang, Jingyan Jiang, Shifeng Bao, Mingkang Pu, Shiwei Li, Jing Xu, Shijia Xu, Guanbo Huang, Chenghao Gu, Yuzhi Huang, Chenxin Li, Faisal Nadeem Khan, Huan Yang, Yan Wang, Cheng Chi, Zhi WangTsinghua University, Beijing Academy of Artificial Intelligence (BAAI), Renmin University of China, Shenzhen Technology University, Hefei University of Technology, Jiangnan University, Chongqing University, The Chinese University of Hong Kong

Roboter-KI-Modelle planen immer einen kurzen Block künftiger Bewegungen, und wie viele davon der Roboter ausführt, bevor er wieder hinschaut, legen Entwickler bislang meist starr fest. Dieser Preprint der Tsinghua-Universität, der Beijing Academy of Artificial Intelligence (BAAI) und weiterer Partner ergänzt ein Zusatzmodul, das diese Zahl im laufenden Betrieb wählt und die Erfolgsquoten vorhandener Modelle von Physical Intelligence und Nvidia in der Simulation und auf einem realen Zweiarmroboter ohne Nachtraining erhöht.

arXiv
Text-to-3D PolicyFortgeschritten

T3DP: Feingranulare Sprach-Verhaltens-Ausrichtung für Text-to-3D-Policies

Xinhao Yang, Wenhao Wu, Ning Lv, Yanshen Ding, Zhenhong Sun, Daoyi Dong, Chunlin Chen, Zhi Wang

Der Preprint stellt T3DP vor, ein Framework, das feingranulare Sprach-Verhaltens-Ausrichtung nutzt, um textgesteuerte 3D-Diffusionsrichtlinien für ungesehene Verhaltensspezifikationen zu verbessern. In Simulationen (Meta-World, ManiSkill, RoboTwin) erreicht T3DP durchschnittlich 11,0 bis 14,2 Prozentpunkte mehr Erfolg als globale Ausrichtung; auf einem realen PiPer-X-Roboter steigt der Durchschnitt von 47,5 auf 65,0 Prozent. Die lokale Zuordnung von Instruktionstoken zu Verhaltenssegmenten erhält spezifikationsrelevante Unterschiede, die globale Verfahren oft verwischen.

arXiv
ManipulationFortgeschritten

RoboCoach: Weltmodelle als aktive Coaches für kompositionale Roboterfähigkeiten

Jiajun Liu, Yifan Chen, Yichao Liu, Jiayi Zhang, Ruoqu Chen, Shaoxuan Xie, Guocai Yao, Mengdi Xu, Sen Cui, Changshui Zhang

RoboCoach ist ein Preprint und beschreibt ein Framework, das mit dem aktionskonditionierten Weltmodell CoachWorld imaginierte Fehlschläge in langfristigen Manipulationsaufgaben lokalisiert und daraus gezielte Demonstrationsanfragen sowie LoRA-Updates für die zuständigen Skill-Experten ableitet. In Simulation und auf zwei echten Roboterplattformen steigt die Erfolgsrate mit 150 zusätzlichen Teilaufgaben-Demonstrationen von 13,3 % auf 75,0 % beim Franka und von 40,0 % auf 83,8 % beim AgileX, während eine gleichmäßige Datenerfassung mit gemeinsamem Adapter nur 30,0 % bzw. 47,5 % erreicht. Die Arbeit zeigt, dass Weltmodelle nicht nur simulieren, sondern als aktive Coaches entscheiden können, welche wiederverwendbare Fähigkeit als Nächstes gelernt werden soll.

Die Studien stammen aus den Robotik-Feeds von arXiv. Solange unsere Zusammenfassung fehlt, erscheinen die ersten Zeilen des Abstracts.