ROBOTNESS
专业arXiv

PL-MPC 在模型预测控制中同时改进 critic 监督、终端估计与策略蒸馏,真机 unseen 尺寸成功率超 TD-M(PC)2

Kowndinya Boyalakuntla, Yuhan Liu, Abdeslam Boularias
30 秒速读

PL-MPC 是 arXiv 预印本,未注明经同行评审。该方法在 TD-M(PC)2 上同步修改 critic 监督、MPC 终端值估计和 planner 到策略的转移,不改世界模型与 MPPI。在 HumanoidBench 的 balance-hard 上 TAR 从 98±18 升至 387±255,hurdle 从 199±13 升至 466±200;在 KUKA IIWA14 真机 wrench–nut 对齐中,训练尺寸和两个未见尺寸的观测成功率均高于 TD-M(PC)2。

研究问题

能否在不改变 latent world model 和 MPPI 优化器的前提下,通过同时调整 critic 目标、MPC 终端估值和 planner 到 actor 的蒸馏,提升 TD-M(PC)2 在困难控制任务和零样本真机迁移中的表现?

问题

TD-MPC 的规划和学习形成闭环,但标准一步 TD 目标只提供即时奖励;MPPI 排序依赖可能不确定的 critic 终端值;planner 生成的轨迹质量差异很大而策略蒸馏未按结果区分。现有方法主要对齐 policy 与 planner 行为,未系统处理 critic 监督和终端值不确定性。

既有方法

TD-M(PC)2 等 policy-constrained 变体通过 planner prior 约束 actor,BMPC、BOOM、PO-MPC 进一步用模仿 MPC 专家或 value-weighted imitation 改善 planner-policy 一致性。它们主要改变 planner 到 policy 的接口,critic 训练仍以一步 TD 为主,MPC 终端值通常直接使用 critic 随机平均。

新方法

PL-MPC 在 TD-M(PC)2 上新增三个机制:MTD 构造混合多步 TD 目标,在采样的 replay 切片内使用 planner 执行轨迹中的观测奖励,超出切片则用 actor 驱动的 learned model rollout,默认 n=H=3;ATE 在 MPPI 中对在线 critic 的终端值减去与 target-critic 集成 disagreement 成比例的惩罚;RAD 用轨迹的未折扣回报作为权重,对 planner-executed action 进行 behavior cloning,并设定 warmup 后才启用。此外只增加 episode return 作为 replay annotation。

结果

在 HumanoidBench 13 个 locomotion 任务中,PL-MPC 相比 TD-M(PC)2 在 8 个任务上均值更高,5 个更低。最大提升为 balance-hard TAR 98±18 到 387±255(3 seeds),hurdle 199±13 到 466±200。DMControl 4 个任务上保持竞争,humanoid-walk 最高。Leave-one-out 消融显示,balance-hard 去除 MTD 后 TAR 降至 186±51;hurdle 去除 ATE 降至 296±21、去除 RAD 降至 231±72,而去除 MTD 得到 530±275,说明组件交互任务相关且非加性。RAD warmup 从 200K 改为 750K 时,crawl、balance-simple、sit-hard 分别提高 +116、+44、+170,hurdle 下降 52。真机实验中,部署 checkpoint 在训练前 500K 步内按仿真评估选出,PL-MPC 在训练尺寸 size 5(31 次试验)成功率 74.2% vs TD-M(PC)2 61.3%;unseen size 3(15 次)80.0% vs 73.3%;unseen size 1(15 次)33.3% vs 20.0%;unseen pooled 56.7% vs 46.7%。

局限

作者承认整体提升任务相关,组件在 balance-hard 和 hurdle 上存在非加性交互,且 RAD 对 warmup 敏感;hard tasks 跨 seed 标准差大。真机验证只用一台 KUKA IIWA14、一种 wrench–nut 对齐任务,未见尺寸试验次数各 15 次。论文未报告跨其他 TD-MPC 类骨干的实验,当前仅基于 TD-M(PC)2;代码和数据尚未在 arXiv 版本中提供(称将开源);未报告算力成本。预印本尚未同行评审。

产业影响

人形机器人、机械臂操作和基于模型的强化学习平台可能利用该类改进,尤其是需要 sim-to-real 的装配、插入和灵巧操作。短期(现在至 1 年)可作为 TD-MPC 系方法的工程增强;1 至 3 年若开源代码并扩展到更多基线和硬件,可能进入仓储、制造中的视觉伺服对齐任务;3 年以上需验证在更多任务、更多机器人本体和更一致的 seed 表现后,才可能用于高可靠性应用。

受许可协议限制,本站不转载该论文全文,仅提供摘要和原文链接。