ROBOTNESS
进阶arXiv

RoboCoach 让世界模型主动当教练:想象失败后定向补数据,真机成功率升至 75.0% 和 83.8%

Jiajun Liu, Yifan Chen, Yichao Liu, Jiayi Zhang, Ruoqu Chen, Shaoxuan Xie, Guocai Yao, Mengdi Xu, Sen Cui, Changshui Zhang
30 秒速读

RoboCoach 是一个预印本框架,用世界模型中的想象执行来诊断长程机器人任务中最先失败的子任务,并据此请求对应技能专家的演示数据。在 Franka 和 AgileX 真机上,仅追加 150 条子任务演示,成功率分别从 13.3% 升至 75.0%、从 40.0% 升至 83.8%,显著超过统一采集加共享适配器的基线。该工作表明世界模型可以成为主动教练,把稀缺的真实数据导向可复用的技能模块。

研究问题

如何在有限的演示预算下,决定下一步采集哪些演示数据以及更新哪个策略组件,以提升长程机器人组合技能的成功率?

问题

长程机器人操作会复用技能,但用额外的端到端演示来改进组合任务成本很高,且局部执行错误会在技能链中传播。现有系统难以把想象中的失败转化为针对具体子技能的真实数据请求,并同步定位到对应的可复用策略组件上。

既有方法

此前的方法包括通用视觉语言动作模型、主动或纠错模仿学习、动作条件世界模型和模块化策略。它们通常把预测与策略更新分离,用端到端演示或共享适配器进行统一更新,无法在技能级别上明确决定该采集哪条演示、该更新哪个专家。

新方法

RoboCoach 提出 Route-Imagine-Diagnose-Improve(RIDI)循环。共享的动作条件世界模型 CoachWorld 基于条件流匹配训练,使用稀疏视觉历史、两槽末端执行器轨迹和相机标定作为条件。执行层由共享 VLA 骨干加技能专家 LoRA 适配器构成。路由模块选择下一个未完成子任务并调度对应专家,专家在 CoachWorld 中闭环想象执行,进度裁判 RoboMeter 判断当前子任务是否完成;若在时限内未完成,则记录最先超时的子任务-专家对。按任务均衡的首次超时质量汇总,选出优先级最高的子任务-专家对请求新的演示,并只更新对应专家的 LoRA 参数。

结果

在 22 个任务-策略对上,想象成功率与真实部署成功率的 Spearman 相关系数为 0.840,Pearson 相关系数为 0.820。真机实验中,Franka 初始成功率为 13.3%,追加 150 条子任务演示后 RoboCoach 达 75.0%,而 Single VLA + Uniform 仅 30.0%;AgileX 初始 40.0%,RoboCoach 达 83.8%,基线为 47.5%。归一化预算 AUC 在 Franka 上为 53.1 对 18.9,AgileX 上为 72.7 对 46.3。仿真中,RoboCoach 在 LIBERO 达到 71.2%,RoboTwin 达到 68.0%,为四种条件中最高的最终成功率;与统一采集加共享适配器相比,把相同定向演示用于对应专家在 LIBERO 上额外提升 3.4 个百分点,RoboTwin 上额外提升 13.2 个百分点。在 4 个未参与训练和教练的保留组合中,RoboCoach 平均成功率为 35.0%,基线为 0%。世界模型保真度上,混合域 CoachWorld 在 DROID-180 上取得 LPIPS 0.0996、FVD 51.71 和指令跟随分数 0.880。进度裁判在 CoachWorld 生成观测上的切换 MAE 为 0.815 秒,召回率 62.73%,结果 F1 为 83.84%。

局限

作者承认当被操作物体被遮挡或接触发生在相机视野外时,物理建模和预测会变得困难,且世界模型可能存在系统性偏差,无法仅靠多随机种子一致性排除。专家库由技能语义预定义,学习其结构并减少对人类演示的依赖仍是开放问题。此外,真实机器人每任务仅 20 次试验,平台只有 Franka 和 AgileX 两种,论文未报告代码是否开源。

产业影响

该框架可用于需要长程操作和快速技能迭代的机器人产品,如服务机器人、工业分拣和双臂协作平台。其思路在仿真中已可复现,1 至 3 年内有望在具备多样化机器人数据、模块化技能库和可靠进度裁判的真实场景中落地。前提是能训练或获取高质量的动作条件世界模型,并具备收集少量针对性人类演示的能力。

受许可协议限制,本站不转载该论文全文,仅提供摘要和原文链接。