PL-MPC erweitert TD-M(PC)2 um Multi-Step-TD, adaptive Terminalwerte und returngewichtete Aktordestillation
Das Preprint stellt PL-MPC vor, eine Erweiterung des policy-constrained TD-M(PC)2-Rückgrats, die Critic-Supervision, MPPI-Terminalwertbewertung und Planer-zu-Policy-Transfer verändert. Auf HumanoidBench steigt der Total Average Return bei balance-hard von 98±18 auf 387±255 und bei hurdle von 199±13 auf 466±200; auf vier DMControl-Aufgaben bleibt die Methode konkurrenzfähig. In einem Sim-to-Real-Transfer mit einem KUKA IIWA14 erreicht PL-MPC höhere Erfolgsraten als TD-M(PC)2 auf der Trainingsgröße und zwei ungesehenen Objektgrößen.
Wie lassen sich in einer geschlossenen Planungs-Lern-Schleife bei TD-MPC zusätzlich zur Policy-Ausrichtung auch Critic-Supervision, Terminalwertschätzung und Planer-zu-Policy-Transfer verbessern, ohne Weltmodellarchitektur oder MPPI-Optimierer zu ändern?
TD-MPC-artige Systeme bilden eine Rückkopplungsschleife, in der der Planer Trainingsdaten erzeugt, Critic und Actor diese bewerten und künftige Planungen beeinflussen. Bestehende Varianten fokussieren meist nur die Planer-Policy-Schnittstelle. Die Ein-Schritt-TD-Supervision setzt den Critic nur unmittelbaren beobachteten Rewards aus, der gleiche gelernte Critic liefert unsichere Terminalwerte für MPPI-Rollouts und beeinflusst so die Trajektorienauswahl, und die Planer-zu-Policy-Übertragung gewichtet Trajektorien nicht nach ihrem realisierten Ertrag.
TD-MPC kombiniert latente Weltmodelle mit MPPI und lernt Critic sowie Actor. Policy-constrained Nachfolger wie TD-M(PC)2, BMPC, BOOM und PO-MPC zielen vor allem darauf, den Actor an das Planerverhalten anzugleichen. Diese Verfahren behalten jedoch Ein-Schritt-TD-Ziele, unveränderte Terminalwertschätzungen und eine im Wesentlichen gleichgewichtete Destillation von Planeraktionen bei.
PL-MPC baut auf dem policy-constrained TD-M(PC)2 auf und ergänzt drei Mechanismen. MTD ersetzt das Ein-Schritt-TD-Ziel durch hybride n-Schritt-Ziele (Standard n=H=3), die beobachtete Rewards aus dem Replay-Slice nutzen und nur für den über die Replay-Länge hinausgehenden Teil gelernte Dynamik- und Reward-Modellrollouts unter dem aktuellen Actor verwenden. ATE bestraft den MPPI-Terminalwert mit der Standardabweichung des Target-Critic-Ensembles, normalisiert über exponentiell gewichtete Schätzer; es ändert nur das Trajektorienranking im Planer, nicht das TD-Ziel. RAD gewichtet die Imitation planner-ausgeführter Aktionen mit dem realisierten, undiskontierten Episodenertrag, normalisiert über eine FIFO-Queue und erst nach einem Warmup von 200K Schritten. Encoder, Dynamikmodell, Rewardmodell, Critic-Ensemble und MPPI-Optimierer bleiben unverändert. Für den realen Transfer werden Policies vollständig in Isaac Gym trainiert und ohne Feintuning auf einem KUKA IIWA14 mit Robotiq-Greifer und RGB-D-Pose-Tracking eingesetzt.
Auf HumanoidBench (13 Locomotion-Aufgaben) steigt der TAR bei balance-hard von 98±18 (TD-M(PC)2) auf 387±255 und bei hurdle von 199±13 auf 466±200; über die 13 Aufgaben verbessert PL-MPC den Mittelwert gegenüber TD-M(PC)2 in acht Aufgaben und liegt in fünf darunter, darunter run und sit-hard unterhalb der Referenzschwelle. Auf vier DMControl-Aufgaben ist PL-MPC konkurrenzfähig und erreicht den höchsten Mittelwert bei humanoid-walk. Leave-one-out-Ablationen: balance-hard ohne MTD fällt auf 186±51, hurdle ohne ATE auf 296±21 und ohne RAD auf 231±72; hurdle ohne MTD erreicht 530±275, was die nicht-additive Aufgabenabhängigkeit zeigt. Die für Hardware ausgewählten Checkpoints erzielen in separater Simulation auf Trainingsgröße 5 terminale Erfolgsraten von 81,0 % (PL-MPC) und 67,5 % (TD-M(PC)2). Im realen Wrench-Nut-Transfer (31 Versuche auf Größe 5, 15 pro ungesehener Größe) erreicht PL-MPC Erfolgsraten von 74,2 % gegenüber 61,3 % auf Größe 5, 80,0 % gegenüber 73,3 % auf ungesehener Größe 3, 33,3 % gegenüber 20,0 % auf ungesehener Größe 1 und gepoolt auf ungesehenen Größen 56,7 % gegenüber 46,7 %.
Das Paper ist ein Preprint und nennt keine Begutachtung. Die Modifikationen sind nur auf dem TD-M(PC)2-Rückgrat evaluiert; eine Übertragung auf andere TD-MPC-Varianten steht aus. Die Leistung ist stark aufgabenabhängig, mit großer Seed-Variabilität auf HumanoidBench; auf run und sit-hard bleibt PL-MPC unter der Referenzschwelle. RAD ist empfindlich gegenüber dem Warmup-Zeitpunkt, ein adaptiver Zeitplan fehlt. Die Hardware-Studie umfasst einen einzigen Roboter, eine Aufgabe und kleine Stichproben (31 beziehungsweise 15 Versuche pro Größe); die Konfidenzintervalle der Erfolgsraten überlappen teilweise deutlich.
Unternehmen mit modellbasierter Robotersteuerung, insbesondere für Manipulation und Locomotion mit MPC, könnten PL-MPC in bestehende TD-MPC-Pipelines integrieren. Das reale KUKA-Experiment zeigt eine sofortige Machbarkeit im Labor; für produktive Montage- oder Handhabungsanwendungen ist je nach Branche mit 1 bis 3 Jahren zu rechnen. Voraussetzungen sind robuste 6D-Pose-Schätzung, ausreichende Simulationsdomänen, Validierung auf weiteren Robotern und eine Reduktion der Aufgabenabhängigkeit und Seed-Variabilität.
Der Volltext wird hier nicht wiedergegeben, weil die Lizenz der Studie das nicht erlaubt. Das Original steht auf arXiv.