ROBOTNESS
进阶arXiv

T3DP:细粒度语言-行为对齐提升文本到3D策略的未见过规格泛化

Xinhao Yang, Wenhao Wu, Ning Lv, Yanshen Ding, Zhenhong Sun, Daoyi Dong, Chunlin Chen, Zhi Wang
30 秒速读

本文提出T3DP框架,通过在指令token和局部行为表示之间建立双向细粒度对齐,让3D扩散策略能执行训练中未出现的精细行为规格。在Meta-World、ManiSkill和RoboTwin上,T3DP较全局语言-行为对齐平均成功率提升11.0至14.2个百分点;在真实机器人上平均成功率从47.5%升至65.0%。该工作为预印本,尚未经过同行评审。

研究问题

如何在不丢失精细结构的前提下,将语言与3D机器人行为对齐,使策略能泛化到同一任务族内训练时未出现的规格?

问题

现有文本到3D策略难以执行演示中未覆盖的精细行为规格(如目标位置、位移距离、关节状态)。同一任务族的指令语义相近但需要不同行为,而预训练语言表征和全局语言-行为对齐会把整个指令和轨迹压缩为单个嵌入,模糊了区分相近规格的局部差异。语言单独提供的可操作信息不足,策略可能过度依赖视觉目标。

既有方法

先前方法要么直接使用预训练语言模型条件化3D策略(如3DDA、3D-LOTUS),要么采用全局语言-行为对齐(如T2DA),将完整指令和完整轨迹分别池化为全局嵌入进行对比学习。这些方法缺乏对局部语言元素与行为片段对应关系的建模,相近规格在表示空间中容易塌缩。

新方法

T3DP分三阶段:先用奖励预测目标训练行为编码器,从演示轨迹窗口提取规格相关的行为表示;然后冻结行为编码器,用全局对比损失和双向token级细粒度对比损失(指令token与状态-动作隐状态之间)微调文本编码器(LoRA);最后冻结对齐后的文本编码器,训练一个基于点云的3D扩散策略,仅用池化后的语言嵌入作为条件。细粒度对齐保留了规格定义的局部语言变化,无需修改下游策略架构。

结果

在Meta-World上,T3DP平均成功率为50.3%,比T2DA的36.1%高14.2个百分点,比无语言DP3高34.1个百分点。在ManiSkill上,平均成功率54.2%,比T2DA的40.7%高13.5个百分点。RoboTwin上平均提升11.0个百分点(摘要报告)。所有15个任务家族均有提升,评估基于三个训练种子。真实机器人(PiPer X机械臂)两个任务家族、每任务20个规格,T3DP平均成功率从T2DA的47.5%升至65.0%(+17.5个百分点)。

局限

作者承认T3DP需要带奖励信号的专家轨迹,且评估限于已知任务族内的模板化指令,未覆盖新任务族或自由形式指令。真实机器人实验仅在单一机械臂(PiPer X)和两种任务上验证。论文未报告代码是否开源。

产业影响

该方法可提升工业机械臂、服务机器人和仓储机器人对精细语言指令的遵循能力,尤其是需要区分相近位置或位移的场景。预计1至3年内可应用于已有专家演示和奖励标注的任务族。前提是需要为每个任务族收集带奖励的专家数据,并且指令形式相对模板化;扩展到开放指令和新任务族仍需进一步验证。

受许可协议限制,本站不转载该论文全文,仅提供摘要和原文链接。