ROBOTNESS
专业arXiv

合成监督与场景图组合实现跨站点空中操作,MPAR对齐执行进度

Weixiang Guo, Rui Jin, Haotian Jin, Xinhang Xu, Ruiyang Liu, Haoran Zhao, Yi Wang, Weiqi Gai, Kun Cao, Lihua Xie
30 秒速读

该预印本提出统一框架,将局部全身VLA行为组合为场景级空中操作。在仿真中完成21/50个跨站点任务(42.0%),物理平台验证了2/5次取水浇花任务。关键贡献包括无需真实平台演示的合成训练、MPAR对齐异步动作块,以及场景图引导的可行交接与拓扑转移。

研究问题

能否通过合成监督、执行进度对齐和场景图组合,使关节型空中机械臂从语言指令完成跨站点操作任务?

问题

将VLA模型扩展到场景级空中操作面临三个挑战:物理平台上采集全身演示成本高且风险大;推理延迟导致动作块与实际执行进度错位;关系型语言目标需要解析到具体物体实例并找到可行的全身交接状态,且跨站点转移需满足碰撞与动力学约束。

既有方法

此前空中VLA方法依赖人类演示或非全身表达,主要关注导航;执行延迟与运动可行性通常分开处理;场景图方法仅解决语义级别的目标实例或点级导航,未提供适合空中机械臂的可行交接区域和全身转移。

新方法

该框架包含三部分:场景可重构的监督管线利用全身专家规划与同步多视角渲染合成训练数据,无需在目标平台上采集演示;MPAR将估计的交接状态投影到新的VLA路径上,通过C²桥接和MINCO轨迹优化实现连续、约束感知的执行;场景图基于关系描述解析目标实例,构建技能条件下的交互区域,并通过多面体拓扑引导跨站点转移。

结果

在MuJoCo仿真中,局部VLA技能在oracle目标和可行交接条件下成功39/60次(65.0%)。完整系统在50次仿真跨站点任务中成功21次(42.0%),对比的Monolithic Whole-Task VLA为0/50。MPAR在120次扰动试验中成功78次(65.0%),高于名义时间对齐(71/120, 59.2%)和RTC-Direct(54/120, 45.0%);在500ms延迟及短暂指令停顿条件下,MPAR将中位交接相位误差降低0.212秒。场景图消融中,完整系统实现接口成功14/15、任务成功9/15。物理平台上,局部VLA完成瓶子抓取2/5、矩形块抓取1/5、浇花3/5、放置3/5;完整系统完成2/5次跨站点浇花任务。

局限

作者承认依赖预构建并注册到度量地图的场景图,VLA推理远程执行,任务级表现受局部技能限制。明显局限包括:大部分评估在仿真中进行,物理试验次数少(每任务5次),未报告开源代码;训练需远程GPU算力,且局部技能中物体获取是主要瓶颈。

产业影响

该框架适用于空中操作机器人公司,如无人机巡检、物流抓取、农业喷洒等场景。1至3年内可在结构化工业或农业环境中部署,前提是具备可靠的场景图构建和稳定的无线推理链路;3年以上需实现机载推理和在线场景图更新以拓展到非结构化环境。

受许可协议限制,本站不转载该论文全文,仅提供摘要和原文链接。