ROBOTNESS
Forschung

Studien

Neue Studien zu Robotik und Physical AI, jeweils mit ihrer Bedeutung für die Branche.

20 Studien
Noch nicht auf Deutsch verfügbar: Anzeige im englischen Original.
Gefiltert nach Technologie Vision-Language-Action-Modelle, zurücksetzen
arXiv
VLAExperten

DynaHarness: A Dynamic Physical Harness for Self-Evolving Robot Agents

Haoyuan Deng, Jiebin Liu, Tengxiao Zhang, Langning Yan, Hongye Cao, Ziwei Wang

Pretrained robot policies provide useful action priors, but long-horizon manipulation still requires coordination between semantic reasoning and physical execution. Semantic reasoning operates at a coarser timescale than physical interaction, while episode-level failures provide limited guidance on which system component should be revised.

arXiv
VLAExperten

Multi-Link Safety Filtering for VLA Policies Around Moving Hazards

Yatharth Agarwal, Vijay Raghunathan

A vision-language-action (VLA) policy can finish a manipulation task while knocking over objects unrelated to it, so task success alone does not show that the policy is safe to deploy in clutter. We study how to keep a pretrained VLA policy clear of such hazards at run time without retraining it, which requires guarding more of the arm than the end effector, following the hazard as it moves, and sharing onboard compute with the policy.

arXiv
Safe VLAExperten

FailBank: Self-Evolution von Vision-Language-Action-Modellen durch Laufzeit-Feedback

Mingyue Cui, Zheyuan Liu, Yihan Zhu, Zheyuan Zhang, Meng Jiang

FailBank ist ein vierstufiges Self-Evolution-Framework, das Laufzeit-Feedback einer CBF-basierten Sicherheitskomponente in persistente Policy-Verbesserungen für Vision-Language-Action-Modelle umwandelt. Ein Preprint auf arXiv berichtet, dass FailBank die Aufgabenerfolgsrate gegenüber den Basispolicies um 8,5 bzw. 6,9 Prozentpunkte steigert und die policy-induzierten kumulativen Kosten um 35,6 bzw. 23,8 Prozent senkt. Damit wird gezeigt, dass Laufzeitkorrekturen nicht nur temporäre Eingriffe, sondern auch Trainingssignal für künftiges Verhalten sein können.

arXiv
Memory-centric VLAFortgeschritten

Optimus-R: Memory-centric Framework für Vision-Language-Action-Modelle

Zaijing Li, Rui Shao, Bing Hu, Haoyu Zhang, Dongmei Jiang, Liqiang Nie

Das Preprint stellt Optimus-R vor, ein memory-centric Framework zur Adaption von Vision-Language-Action-Modellen (VLA). Es führt eine Inline Memory Interface, eine Query-Skill Memory Bank und einen Bridge-and-Adapt-Mechanismus ein, um Roboterfähigkeiten als explizite Speichereinträge zu lernen und wiederzuverwenden. In Experimenten auf LIBERO, CALVIN und RoboTwin 2.0 verbessert Optimus-R die Dateneffizienz deutlich und erreicht im Cross-Domain-Transfer mit 20 Demonstrationen pro Aufgabe 33,3 % Erfolgsrate auf einem echten Roboter, 13,9 Prozentpunkte über der Baseline.

arXiv
VLAExperten

When Instructions Retrieve Trajectories: Diagnosing and Mitigating Generalization Failures in VLA Models

Hung-Jen Chen, Yu-Hsun Hou, Yan-Hong Chen, Yan-Fu Chen, Binghua Cai, Min Sun, Chun-Yi Lee

Vision-language-action (VLA) models can exceed 90% success on in-distribution tasks and withstand nuisance changes that preserve the required action, yet fail under counterfactual changes that demand a different action. Aggregate robustness scores can therefore conceal a more specific failure, in which a policy responds to both language and vision yet does not combine them to select the action the task requires.

arXiv
GroundingExperten

GroundingPI: Präzises visuelles Grounding als Perzeptionsfundament für physische Intelligenz

Qize Yu, Lianrui Fan, Boyu Chen, Jiaqi Liang, Xini Ding, Yue Chen, Zetian Song, Yuran Wang, Yi Zou, Kaixuan Wang, Tianxing Chen, Wenxuan Song, Bohan Zhou, Mingleyang Li, Siqiao Huang, Yuqi Ye, Caigao Jiang, Wei Wei, Ruihai Wu, Hang Zhang

In einem Preprint wird GroundingPI vorgestellt, ein 4-Milliarden-Parameter-Grounding-Foundation-Model, das Punkte und Boxen als quantisierte Koordinaten in einem gemeinsamen Vokabular erzeugt. Über 34 Grounding-Benchmarks mit 44 Baseline-Vergleichen erreicht das Modell einen Durchschnitt von 73,68 % und liegt damit vor dem größeren GPT-6 Astra mit 71,54 %. Als Perzeptionsbackbone verbessert es Robotermanipulation und autonomes Fahren, etwa mit bis zu 24,8 % relativem Vorteil im RoboTwin-2.0-OOD-Setting.

arXiv
Aerial ManipulationExperten

Synthetisches VLA-Training und Fortschrittsausrichtung für szenenweite Luftmanipulation

Weixiang Guo, Rui Jin, Haotian Jin, Xinhang Xu, Ruiyang Liu, Haoran Zhao, Yi Wang, Weiqi Gai, Kun Cao, Lihua Xie

In einem Preprint wird ein Framework vorgestellt, das lokale Vision-Language-Action-Verhalten für einen artikulierten Luftmanipulator synthetisch trainiert und über einen relationalen Szenengraph zu szenenweiten Missionen komponiert. Die lokale VLA-Politik erreicht unter Orakelbedingungen 65,0 % Erfolg, das Gesamtsystem schafft 42,0 % der simulierten Multi-Site-Missionen, und die gemessene Fortschrittsausrichtung MPAR reduziert den Phasenfehler bei 500 ms Latenz um 0,212 s. Erste physische Versuche bestätigen die Ausführbarkeit ohne Demonstrationen auf der Zielplattform.

arXiv
VLAExperten

PrefPI: Preference-Guided Steering into Out-of-Distribution Behaviors

Seungeun Rho, Wontaek Kim, Danfei Xu, Sehoon Ha

We present PrefPI (Preference-Guided Policy Iteration), an iterative framework for steering pretrained generative robot policies using only relative preferences over self-generated trajectories. Unlike prior preference-learning methods that primarily sharpen modes already represented by the policy, we study steering beyond the initial effective support, where desired behaviors are rarely or never observed under the initial policy.

arXiv
VLAFortgeschritten

ChunkTrust: Ausführungshorizonte von Roboter-Policies anhand von Signalen des Action-Experts anpassen

Fanding Huang, Jingyan Jiang, Shifeng Bao, Mingkang Pu, Shiwei Li, Jing Xu, Shijia Xu, Guanbo Huang, Chenghao Gu, Yuzhi Huang, Chenxin Li, Faisal Nadeem Khan, Huan Yang, Yan Wang, Cheng Chi, Zhi WangTsinghua University, Beijing Academy of Artificial Intelligence (BAAI), Renmin University of China, Shenzhen Technology University, Hefei University of Technology, Jiangnan University, Chongqing University, The Chinese University of Hong Kong

Roboter-KI-Modelle planen immer einen kurzen Block künftiger Bewegungen, und wie viele davon der Roboter ausführt, bevor er wieder hinschaut, legen Entwickler bislang meist starr fest. Dieser Preprint der Tsinghua-Universität, der Beijing Academy of Artificial Intelligence (BAAI) und weiterer Partner ergänzt ein Zusatzmodul, das diese Zahl im laufenden Betrieb wählt und die Erfolgsquoten vorhandener Modelle von Physical Intelligence und Nvidia in der Simulation und auf einem realen Zweiarmroboter ohne Nachtraining erhöht.

arXiv
Real-time VLAExperten

Echtzeit-VLA-Inferenz: Nicht-uniformes Zwei-Stufen-Denoising spart 64 Prozent Rechenzeit

Di Wu, Rongtian Shen, Ping Liu, Yan Shen, Zhenhan Yin, Shun Zuo, Xuhua Chen, He Zheng, Lingfeng Zhang, Jianglin Zhang, Tao Zhang

Das Paper stellt ein zweistufiges, nicht-uniformes Denoising für Flow-Matching-basierte Vision-Language-Action-Modelle vor; es reduziert die Modellinferenzzeit von 61,557 ms auf 21,956 ms, eine 2,804-fache Beschleunigung, bei vergleichbarer Aktionsfehlergröße. Zusätzlich wird ein verteiltes Echtzeit-Framework mit entkoppelten Raten für Inferenz, Aktionspublikation und Robotersteuerung entwickelt. In physischen Langzeit-Faltversuchen mit π0.5 erzielt Legato 96,7 Prozent Erfolg; die kombinierte Zwei-Stufen-Methode senkt die Erfolgsrate von Legato auf 86,7 Prozent, liefert aber deutliche Effizienzgewinne. Der Preprint motiviert die gemeinsame Optimierung von Modellinferenz und System-Timing.

arXiv
VLAExperten

EWAM: Emergent Depth-Wise Specialization in a Unified Embodied Model -- From Semantic Understanding through Visual Foresight to Action

Hao Wang, Jiajun Wen, Jingzhi Liu, Shuoshuo Xue, Zhiliang Chen, Min Lin, Yicheng Chang, Xiaoyu Guo, Yukang Zhuo, Zheng Chong, Yunshuang Nie, Jian Zhang, Weijia Liufu, Qingman Wu, Heming Xu, Bingchang Song, Dantong Wu, Zhiyuan Wang, Hang Xu, Jianhua Han

Vision-language-action (VLA) policies emphasize semantic understanding, whereas world-action models (WAMs) learn predictive representations of environment dynamics. Systems that expose a policy to both sources often still concentrate action computation on a single expert.

arXiv
VLAExperten

MotorMind: Scaffolding General Vision Language Models for Zero-Shot Robot Manipulation

Bingxuan Li, Siqi Song, Yizhuo Wu, Jiarui Yao, Tong Zhang, Huan Zhang

Vision-language-action (VLA) models have advanced robotic manipulation, but their zero-shot generalization in new tasks and environments remains limited, and their reliance on specialized training keeps them from benefiting directly from rapidly advancing general-purpose vision-language models (VLMs). In parallel, recent agentic robotic systems leverage VLMs for high-level reasoning or coding agents for robot control, but often depend on extensive external models and tools, introducing additional complexity and cost.

arXiv
VLAExperten

WayFinder: Hierarchical Visual-Language-Action for Zero-Shot Waypoint Generation and Low-Level Kinematic Control

Timothy K Johnsen, Marco Levorato

Visual Language Action (VLA) models offer unprecedented generalization for autonomous robots; however, their real-world deployment is frequently bottlenecked by unreliable execution and the prohibitive computational cost of fine-tuning for specific robot embodiments and tasks. To bridge this gap, we propose WayFinder, an end-to-end, closed-loop hierarchical VLA framework that circumvents the need for fine-tuning by decoupling high-level task reasoning from low-level kinematic control.

arXiv
VLAExperten

Urgent Actions Go First: Urgency-Aware Denoising for Real-Time VLA Control

Zibo Wang, Haochen Han, Pengzhen Ren, Mingtong Dai, Fangming Liu

Diffusion and flow-matching Vision-Language-Action (VLA) policies generate action chunks through iterative denoising, incurring substantial inference latency that severely limits real-time robotic control. Existing acceleration methods treat an action chunk as a monolithic computational unit, ignoring a crucial physical reality of receding-horizon control: actions are generated jointly but consumed sequentially, resulting in inherently heterogeneous execution urgencies.

arXiv
VLAExperten

Faster and Better? Benchmark Bugs and Design Limitations Distort the Evaluation of Vision-Language-Action Acceleration

Qiwei Chen, Kaijun Zhou, Nuohui Shi, Zhiyang Li, Yuxuan Feng, Jinyu Gu

Simulated manipulation benchmarks are the standard tool for evaluating vision-language-action (VLA) policies and the acceleration methods that reduce their inference latency for on-robot deployment. On these benchmarks, we observe that some training-free acceleration methods, which approximate the baseline policy's computation, achieve higher measured success rates than the baseline itself.

arXiv
VLAExperten

RawVLA: Embodied Neural Image Signal Processor For Robotic Manipulation

Shuhong Liu, Heng Zhou, Lingfeng Qian, Yuhao Fang, Xianbao Hou, Qianyu Zhou, Lin Gu, Wei Sui, Jianfei Yang, Ziteng Cui

Vision-language-action (VLA) models typically operate on RGB images produced by a fixed camera image signal processor (ISP), leaving the imaging pipeline outside the learning and evaluation loop. We systematically examine the consequences of this overlooked design choice across five fundamental ISP dimensions: gain, sensor noise, chromatic response, tonal response, and bit depth.

arXiv
VLAExperten

Rho: A Foundation for Efficiently Adaptable VLA Models

Rho Team, Simran Bagaria, Daphne Chen, Dean Fortier, Jianlong Fu, Michael Harrison, Tess Hellebrekers, Neel Joshi, Andrey Kolobov, Dalton Moore, Galen Mullins, Michael Murray, Eduardo Salinas, Reuben Tan

General-purpose physical AI models must combine broad visual and linguistic capabilities with precise control across robot embodiments and efficient adaptation to downstream tasks. We introduce Rho, a family of open-weights VLA models for bimanual manipulation designed for data-light task adaptation on 3 embodiments representative of dual-arm robots across research labs and the industry -- YAM Box, UR AI Trainer, and FR3 Duo.

Die Studien stammen aus den Robotik-Feeds von arXiv. Solange unsere Zusammenfassung fehlt, erscheinen die ersten Zeilen des Abstracts.