Optimus-R:记忆中心VLA框架实现低数据适应与终身学习
本文提出预印本方法Optimus-R,一个记忆中心的视觉语言动作模型框架,将机器人适应任务转化为显式的查询技能记忆调优,而非反复更新模型参数。在LIBERO、CALVIN、RoboTwin 2.0仿真基准及真实机器人上,Optimus-R在低数据适应、跨域迁移和终身学习中均优于基线π0.5,显著缓解灾难性遗忘。该框架通过内联记忆接口、查询技能记忆库和轻量桥接适配机制,为机器人持续学习提供了高效路径。
能否让视觉语言动作模型通过显式记忆接口获取、存储和重用技能,而不是反复更新模型参数来实现对新任务和领域的适应?
现有视觉语言动作模型在适应新任务和领域时依赖参数更新,成本高且容易灾难性遗忘。外部检索式记忆与动作条件通路耦合弱,难以编码控制相关信息;参数更新使新技能难以检索、扩展和重用;域偏移会导致查询与存储技能不匹配。
此前主流做法是参数中心式适应,例如全量微调、LoRA或适配器微调,将每个新技能隐式写入模型权重。这种方法在每次适应时更新大量参数,带来高训练成本,且在持续学习中新旧任务相互干扰,遗忘严重。
Optimus-R将技能外部化为显式的查询原型和技能值,存储在一个全局记忆库中。它插入可学习的记忆令牌到VLA前缀流,通过双头注意力池化分别提取查询嵌入和技能嵌入,并用技能解码器监督技能空间。记忆库通过聚类构建原型,检索时对查询进行对齐并使用原型残差更新;跨域时用低秩残差技能适配器校正检索技能,且仅更新轻量对齐模块、原型残差和记忆库条目,冻结大部分骨干。
在LIBERO、CALVIN、RoboTwin 2.0三个仿真基准上,使用30%训练数据时,Optimus-R将LIBERO平均成功率从72.1%提高到88.6%(提升16.5个百分点),CALVIN平均完成长度从2.09提高到2.51(提升0.42),RoboTwin 2.0 Hard成功率从9.8%提高到14.8%(提升5.0个百分点)。在9个真实世界跨域任务中,每任务20个演示时Optimus-R成功率为33.3%,比π0.5高13.9个百分点;80个演示时达到72.2%,是表中最高。在真实世界终身学习中,20演示新任务成功率21.0%,比π0.5高11.0个百分点;80演示适应后旧任务成功率为77.5%,平均遗忘从15.0%降至10.0%。训练成本上,在100%数据下Optimus-R达到LIBERO平均成功率97.8%,仅需86 GPU小时,推理频率14Hz,对比π0.5全量微调96.9%需560 GPU小时,LoRA 96.5%需128 GPU小时。
论文未报告代码是否开源。真机实验仅在单一双臂机器人平台GALAXEA R1 Lite上进行,任务数量为9个,终身学习只测试了4个旧任务加5个新任务的一轮适应。所有实验均基于π0.5骨干,未验证在其他VLA模型上的泛化。跨域实验中每个任务仅20次rollout评估,统计误差可能较大。论文未报告长期多轮终身学习的累积遗忘情况。
该方法可用于仓储物流、服务机器人、柔性制造等需要快速适应新任务并保留旧技能的场景。时间尺度为1至3年,前提是企业已部署或有权使用预训练VLA基础模型,能够采集少量演示数据(如20至80个演示),并接受约86 GPU小时的适应训练成本。短期可先在仿真和受控环境中验证,长期可集成到机器人操作平台中。
受许可协议限制,本站不转载该论文全文,仅提供摘要和原文链接。