ROBOTNESS
Forschung

Studien

Neue Studien zu Robotik und Physical AI, jeweils mit ihrer Bedeutung für die Branche.

106 Studien
Noch nicht auf Deutsch verfügbar: Anzeige im englischen Original.
arXiv
PerceptionExperten

Non-Invasive Inspection of Water Canals Using Dronar

Michael Zielinski, Zhizhan Wang, Benjamin Dymond, Reza Razavian, Zhongwang Dou

Open concrete canals play a vital role in water transportation, serving as primary water infrastructure for millions of people across the Phoenix, Arizona, metro area. Over time, the concrete canals can experience a range of issues, including canal lining deformation, cracked concrete, and sediment buildup on the canal floor.

arXiv
UAV NavigationExperten

DiffWAM: Video-Repräsentationen direkt in UAV-Trajektorien umsetzen

Mo Zhu, Yuze Wu, Xijie Huang, Xiao Cui, Fei Gao, Xin Zhou

Die Autoren stellen mit DiffWAM ein System vor, das aus den Zwischenrepräsentationen eines eingefrorenen Videomodells kontinuierliche Kameratrajektorien für Drohnen ableitet, ohne zukünftige Videobilder zu generieren. Auf dem DiffWAM-1000-Benchmark erreicht das Verfahren eine Endpunkt-Erfolgsrate von 74,40 Prozent und eine Trajektorien-RMSE von 0,3492 Metern. Die Arbeit ist ein Preprint und zeigt, dass prädiktive Videomerkmale direkt für metrische Bewegungssteuerung genutzt werden können.

arXiv
VLAExperten

When Instructions Retrieve Trajectories: Diagnosing and Mitigating Generalization Failures in VLA Models

Hung-Jen Chen, Yu-Hsun Hou, Yan-Hong Chen, Yan-Fu Chen, Binghua Cai, Min Sun, Chun-Yi Lee

Vision-language-action (VLA) models can exceed 90% success on in-distribution tasks and withstand nuisance changes that preserve the required action, yet fail under counterfactual changes that demand a different action. Aggregate robustness scores can therefore conceal a more specific failure, in which a policy responds to both language and vision yet does not combine them to select the action the task requires.

arXiv
RoboticsExperten

Ego4WAM: What Matters When Scaling Egocentric Human Data for Robot Learning?

Zhihao Sun, Liu Liu, Xinjiang Wang, Haoyi Jiang, Wei Feng, Huiqiang Zhang, Xiaosong Jia, Zhizhong Su, Zuxuan Wu

Egocentric human data provides a scalable source of experience for robot learning, but varies substantially in human-robot alignment, behavioral coverage, and available supervision. Existing work shows favorable scaling with increasing human data, but it remains unclear which data properties drive downstream robot gains and how to use such data throughout the training pipeline.

arXiv
ManipulationExperten

Magnetic based In-situ Self 3D Pose Estimation for a Modular Soft Tendon-Driven Continuum Robot via IMU-Fusion

Zheng Cao, Guo Ning Sue, Xiangyun Bu, David Quinn, Junzhe Hu, Carmel Majidi

Continuum robots are well suited for gentle manipulation because of their inherent compliance and ability to adapt to complex environments. However, their continuously deformable structure makes accurate configuration estimation challenging, particularly when external vision systems are unavailable or obstructed.

arXiv
LearningExperten

Dream4ACT: A Shared Visual Action Interface for Multi-Embodiment Video-Action Modeling

Xiangyu Zhu, Jin Xu, Yue Guo, Xin Wu, Yifan Sun, Xiancong Ren, Jianxin Sun, Yong Dai, Xiaozhu Ju

Video generation models (VGMs) offer strong spatiotemporal priors for embodied observation--action modeling. However, joint-space action vectors lack explicit image-space structure and vary in dimensionality and semantics across embodiments, making it challenging to directly leverage the rich spatiotemporal priors of VGMs.

arXiv
Soft Pneumatic ActuatorsExperten

Topologieoptimierung für multidirektionale Soft-Pneumatikaktoren: Ein Greifer mit mehreren Freiheitsgraden

Swagatam Islam Sarkar, Prabhat Kumar

In diesem Preprint wird eine Topologieoptimierungsmethode für multidirektionale weiche Pneumatikaktoren vorgestellt. Die Autoren kombinieren eine robuste Drei-Felder-Formulierung mit einer Darcy-basierten Modellierung des druckabhängigen Lastpfads und erhalten eine unkonventionelle Kammergeometrie. Numerische Abaqus-Simulationen zeigen, dass sich drei Arme des Aktors als Greifer in verschiedene Richtungen verbiegen lassen; eine experimentelle Validierung steht noch aus.

arXiv
NavigationExperten

Active Mapping of Underwater Litter Using Camera-Sonar Fusion

David Rete, Patrick Boros, Lucian Busoniu

Marine litter is a growing threat to the underwater ecosystem, driving demand for autonomous survey methods that can locate debris efficiently over large areas. Existing survey methods typically follow predefined paths or operate with a single sensing modality, typically a camera (with image quality suffering in poor-visibility conditions) or sonar (usually noisy and low-resolution).

arXiv
ManipulationExperten

Magic-W0: A Structured World-Action Foundation Model for Physical Intelligence

Xuhua Chen, Zhenhan Yin, Yuan Zhang, Lingfeng Zhang, He Zheng, Tong Mu, Shun Zuo, Dian Zhou, Di Wu, Xuan Zhou, Shaojie Wan, Rongtian Shen, Qiulong Xu, Yiduo Li, Yinglong Wang, Yanqian Wang, Kun Wang, Tao Zhang

World-action models (WAMs) augment robot policies with action-conditioned environment dynamics, yet existing approaches largely rely on future observation reconstruction or generic latent prediction and lack structured, control-oriented world representations tightly coupled with action generation. We introduce Magic-W0, a world-action foundation model that jointly models structured physical state evolution and continuous actions.

arXiv
GroundingExperten

GroundingPI: Präzises visuelles Grounding als Perzeptionsfundament für physische Intelligenz

Qize Yu, Lianrui Fan, Boyu Chen, Jiaqi Liang, Xini Ding, Yue Chen, Zetian Song, Yuran Wang, Yi Zou, Kaixuan Wang, Tianxing Chen, Wenxuan Song, Bohan Zhou, Mingleyang Li, Siqiao Huang, Yuqi Ye, Caigao Jiang, Wei Wei, Ruihai Wu, Hang Zhang

In einem Preprint wird GroundingPI vorgestellt, ein 4-Milliarden-Parameter-Grounding-Foundation-Model, das Punkte und Boxen als quantisierte Koordinaten in einem gemeinsamen Vokabular erzeugt. Über 34 Grounding-Benchmarks mit 44 Baseline-Vergleichen erreicht das Modell einen Durchschnitt von 73,68 % und liegt damit vor dem größeren GPT-6 Astra mit 71,54 %. Als Perzeptionsbackbone verbessert es Robotermanipulation und autonomes Fahren, etwa mit bis zu 24,8 % relativem Vorteil im RoboTwin-2.0-OOD-Setting.

arXiv
Aerial ManipulationExperten

Synthetisches VLA-Training und Fortschrittsausrichtung für szenenweite Luftmanipulation

Weixiang Guo, Rui Jin, Haotian Jin, Xinhang Xu, Ruiyang Liu, Haoran Zhao, Yi Wang, Weiqi Gai, Kun Cao, Lihua Xie

In einem Preprint wird ein Framework vorgestellt, das lokale Vision-Language-Action-Verhalten für einen artikulierten Luftmanipulator synthetisch trainiert und über einen relationalen Szenengraph zu szenenweiten Missionen komponiert. Die lokale VLA-Politik erreicht unter Orakelbedingungen 65,0 % Erfolg, das Gesamtsystem schafft 42,0 % der simulierten Multi-Site-Missionen, und die gemessene Fortschrittsausrichtung MPAR reduziert den Phasenfehler bei 500 ms Latenz um 0,212 s. Erste physische Versuche bestätigen die Ausführbarkeit ohne Demonstrationen auf der Zielplattform.

arXiv
VLAExperten

PrefPI: Preference-Guided Steering into Out-of-Distribution Behaviors

Seungeun Rho, Wontaek Kim, Danfei Xu, Sehoon Ha

We present PrefPI (Preference-Guided Policy Iteration), an iterative framework for steering pretrained generative robot policies using only relative preferences over self-generated trajectories. Unlike prior preference-learning methods that primarily sharpen modes already represented by the policy, we study steering beyond the initial effective support, where desired behaviors are rarely or never observed under the initial policy.

arXiv
NavigationExperten

NavHarness: Adaptive Goals for Agentic Vision-Language Navigation

Haoxiang Shi, Zaijing Li, Muhe Ding, Xiang Deng, Yaowei Wang, Liqiang Nie

Vision-Language Navigation (VLN) requires embodied agents to generate actions based on instructions and observations. General-purpose multimodal agents offer a promising basis for this task, but selecting plausible local actions does not ensure that execution remains consistent with the intended route, particularly in long-horizon tasks.

arXiv
Floorplan SLAMExperten

MVP-SLAM korrigiert visuell-inertiales Multi-Kamera-SLAM online mit Grundriss-Prior

Asier Bikandi-Noya, Miguel Fernandez-Cortizas, Muhammad Shaheer, Holger Voos, Jose Luis Sanchez-Lopez

MVP-SLAM, ein in diesem Preprint vorgestelltes System, erweitert visuell-inertiales Multi-Kamera-SLAM um eine Online-Integration von Bauplänen. Es erreicht in der Hilti-Trimble SLAM Challenge 2026 im Localization-Task 0,29 m mittleren RMSE und Platz 2 von 22 Teams, im SLAM-Task 0,24 m und Platz 5 von 62 Teams und ist damit das bestplatzierte System unter denen, die online arbeiten und den Grundriss integrieren. Der Ansatz zeigt, dass Grundrisse als Driftkorrektur ohne Tiefensensor auf Baustellen nutzbar sind.

arXiv
Distributed ManipulationExperten

Membrangekoppeltes Delta-Array manipuliert Objekte von 15 mm bei 43,3 mm Aktorabstand

Bailey Dacre, Andrés Faíña, Oliver Kroemer, Zeynep Temel

In einem Preprint wird ein 8×8-Array aus 64 Drei-Freiheitsgrad-Deltarobotern vorgestellt, deren Endeffektoren mit einem dehnbaren Gewebe zu einer kontinuierlichen Fläche gekoppelt sind. Dadurch lassen sich Objekte von 15 mm bis 90 mm manipulieren, obwohl der Aktorabstand 43,3 mm beträgt. Eine auf niedrigen DCT-Koeffizienten eines 19-Delta-Nachbarschaftsbereichs trainierte Richtlinie erreicht auf der Hardware 76 % Erfolg ohne Anpassung.

arXiv
ManipulationExperten

Passive Stiffness Shaping in Cable-Suspended Aerial Manipulation via Movable Compliant Anchors

Antonio Franchi, Amr Afifi

Cable-suspended aerial manipulation offers a lightweight architecture for cooperative transportation and physical interaction, yet the passive mechanical response perceived at the load remains insufficiently understood and systematically exploited. This work interprets aerial vehicles as movable compliant anchors and develops a gravity-aware quasi-static theory for predicting and shaping the passive Cartesian stiffness of a suspended load.

arXiv
Multi-UAV State EstimationExperten

Neigungsbasierte Zustandsschätzung für agile visuelle Multi-UAV-Flüge

Michal Pliska, Matouš Vrba, Ondřej Víta, Martin Jiroušek, Viktor Walter, Martin Saska

Die Autoren stellen in einem Preprint einen neuen Schätzansatz vor, der Neigungsinformationen eines visuellen Detektors in die Zustandsschätzung benachbarter UAVs integriert. Über drei Datensätze sinken die mittleren Schätzfehler für Geschwindigkeit und Beschleunigung um 40 % beziehungsweise 57 % gegenüber positionsbasierten Verfahren. In einem simulierten Leader-Follower-Experiment mit NMPC-Regelung ermöglicht der Ansatz die stabile Verfolgung lateraler Manöver über 2 g, während positionsbasierte Schätzung versagt.

arXiv
VLAFortgeschritten

ChunkTrust: Ausführungshorizonte von Roboter-Policies anhand von Signalen des Action-Experts anpassen

Fanding Huang, Jingyan Jiang, Shifeng Bao, Mingkang Pu, Shiwei Li, Jing Xu, Shijia Xu, Guanbo Huang, Chenghao Gu, Yuzhi Huang, Chenxin Li, Faisal Nadeem Khan, Huan Yang, Yan Wang, Cheng Chi, Zhi WangTsinghua University, Beijing Academy of Artificial Intelligence (BAAI), Renmin University of China, Shenzhen Technology University, Hefei University of Technology, Jiangnan University, Chongqing University, The Chinese University of Hong Kong

Roboter-KI-Modelle planen immer einen kurzen Block künftiger Bewegungen, und wie viele davon der Roboter ausführt, bevor er wieder hinschaut, legen Entwickler bislang meist starr fest. Dieser Preprint der Tsinghua-Universität, der Beijing Academy of Artificial Intelligence (BAAI) und weiterer Partner ergänzt ein Zusatzmodul, das diese Zahl im laufenden Betrieb wählt und die Erfolgsquoten vorhandener Modelle von Physical Intelligence und Nvidia in der Simulation und auf einem realen Zweiarmroboter ohne Nachtraining erhöht.

Die Studien stammen aus den Robotik-Feeds von arXiv. Solange unsere Zusammenfassung fehlt, erscheinen die ersten Zeilen des Abstracts.