PL-MPC erweitert TD-M(PC)2 um Multi-Step-TD, adaptive Terminalwerte und returngewichtete Aktordestillation
Das Preprint stellt PL-MPC vor, eine Erweiterung des policy-constrained TD-M(PC)2-Rückgrats, die Critic-Supervision, MPPI-Terminalwertbewertung und Planer-zu-Policy-Transfer verändert. Auf HumanoidBench steigt der Total Average Return bei balance-hard von 98±18 auf 387±255 und bei hurdle von 199±13 auf 466±200; auf vier DMControl-Aufgaben bleibt die Methode konkurrenzfähig. In einem Sim-to-Real-Transfer mit einem KUKA IIWA14 erreicht PL-MPC höhere Erfolgsraten als TD-M(PC)2 auf der Trainingsgröße und zwei ungesehenen Objektgrößen.