Model-based RL上級
PL-MPCがTD-M(PC)2にMTDとATEとRADを追加、HumanoidBenchの高難度タスクで平均報酬を大幅改善
プレプリントとして公開された本研究では、TD-M(PC)2を基盤に、批評家の学習目標を多段階化するMTD、計画時の終端価値に不確実性ペナルティを加えるATE、実現報酬で重み付けした模倣を行うRADを組み込んだPL-MPCを提案した。HumanoidBenchのbalance-hardでTotal Average Returnが98±18から387±255へ、hurdleで199±13から466±200へ向上し、実機のKUKA IIWA14によるレンチとナットの位置合わせでもTD-M(PC)2を上回る成功率を報告した。