ROBOTNESS
ExpertenarXiv

RL-geführte PAC-NMPC kombiniert stochastische MPC und Actor-Critic-Lernen für sichere Navigation

Adam Polevoy, Dillon Capalongo, Katherine Tang, Mark Gonzales, Marin Kobilarov, Joseph Moore
In 30 Sekunden

Das Preprint beschreibt eine Methode, die stochastische modellprädiktive Regelung (PAC-NMPC) mit durch Reinforcement Learning trainierten Actor-Critic- und Sensorprädiktionsmodellen kombiniert, um in unbekannten Umgebungen mit lokaler Wahrnehmung probabilistisch sicher zu navigieren. In Simulation und Hardwareversuchen auf einem Fixed-Wing-UAV erreicht der Ansatz höhere Erfolgsraten als die Einzelkomponenten und Baselines, in der Simulation 90 Prozent, in Hardware 80 Prozent. Er verbessert damit die Sicherheit von RL-Policies und die Langzeitleistung von NMPC durch statistische Garantien.

Forschungsfrage

Wie lassen sich Reinforcement Learning und stochastische nichtlineare modellprädiktive Regelung so kombinieren, dass eine probabilistisch sichere, sensorbasierte Navigation in unbekannten Umgebungen für hochdimensionale Roboter möglich wird?

Problem

Die Navigation mit lokaler Wahrnehmung in unbekannten Umgebungen ist für agile, unteraktuierte Roboter mit komplexer Dynamik schwierig. Klassische NMPC ist rechenintensiv und auf kurze Horizonte beschränkt, was zu kurzsichtigem Verhalten führt. Reinforcement-Learning-Policies hingegen optimieren langfristige Kosten, bieten aber keine harten Sicherheitsgarantien und sind außerhalb der Trainingsverteilung oft unzuverlässig.

Bisheriger Ansatz

Bisherige hybride Ansätze wie PETS, POLO, MQP, DMPC oder CACTO kombinieren MPC und RL, liefern jedoch meist keine Sicherheitsgarantien oder berücksichtigen keine stochastische Wertfunktion. Methoden wie Safe RL-MPC oder Predictive Safety Filters erzeugen Sicherheitsgarantien, sind aber oft konservativ und nicht für Systeme mit hochdimensionaler Wahrnehmung geeignet. Learned Warm-Starting für NMPC existiert, aber nur wenige Arbeiten adressieren lokale Wahrnehmung in unbekannten Umgebungen.

Neuer Ansatz

Der Ansatz trainiert zunächst unabhängig voneinander einen Actor und einen Critic mit TD3 (CleanRL) sowie ein generatives Sensorprädiktionsmodell (U-Net oder vollvernetzt) für Tiefenbilder. Während der Laufzeit werden diese Modelle in das PAC-NMPC-Verfahren integriert: Der Actor dient als Warmstart für die Verteilung der Regelparameter, der stochastische Critic als terminale Kostenfunktion, und eine Nebenbedingung erzwingt die Verbesserung der Wertfunktion über den Horizont. Das Sensorprädiktionsmodell sagt zukünftige Messungen direkt aus der aktuellen Beobachtung voraus, um den Actor entlang des Trajektorienhorizonts auszuwerten, ohne rekursive Fehler zu akkumulieren. PAC-NMPC optimiert eine Verteilung über Feedback-Policies und liefert endliche statistische Garantien für Kosten und Kollisionswahrscheinlichkeit.

Ergebnisse

In der Simulation mit dem Fixed-Wing-UAV über 100 Umgebungen erreicht AC-PAC-NMPC 90 Prozent Erfolgsrate (Kosten 513,3) gegenüber 81 Prozent (468,1) für die reine Actor-Policy und 85 Prozent (718,14) für PAC-NMPC mit Karte, A*-Planer und Unbekannt-Kosten. In Hardwaretests mit 10 Umgebungen erreicht AC-PAC-NMPC 80 Prozent Erfolg (Kosten 252,2), während Actor-Policy und PAC-NMPC mit Karte/A* jeweils nur 40 Prozent erreichen. Auf dem Rally-Car-Hardwareaufbau erzielt PAC-NMPC mit gelernter Wertfunktion 95 Prozent Erfolg ohne Kollisionen gegenüber 85 Prozent der Actor-Policy. Ablationsstudien zeigen, dass ohne RL-Warmstart oder ohne gelernte Sensorprädiktion die Erfolgsrate auf 3 bzw. 11 Prozent fällt. In Out-of-Distribution-Umgebungen mit horizontalem Hindernis sinkt die Actor-Policy auf 46 Prozent Erfolg, AC-PAC-NMPC und die beste Baseline erreichen jeweils 76 Prozent, wobei AC-PAC-NMPC niedrigere Kosten aufweist.

Grenzen

Die Autoren nennen, dass die Unsicherheitsschätzung durch Monte-Carlo-Dropout nicht kalibriert oder beschränkt ist und die Lücke zwischen geschätzter und wahrer Wertfunktion weiter analysiert werden sollte. Das Training erfolgt nicht gemeinsam mit PAC-NMPC und Sensorprädiktion. Die Sensorauflösung ist auf 16x12 Pixel begrenzt, was dünne Hindernisse übersehen kann. Die Hardwareversuche nutzen Motion-Capture zur Zustandsschätzung und sind auf wenige Umgebungen beschränkt (10 für Fixed-Wing, 20 für Rally Car). Die PAC-Garantien sind lokal und endlich-horizont, nicht global für die gesamte Mission. Code oder trainierte Modelle werden im Paper nicht bereitgestellt.

Bedeutung für die Branche

Für Anbieter autonomer Drohnen und Fixed-Wing-UAVs in Inspektion, Landwirtschaft, Lieferung oder Suche und Rettung könnte der Ansatz innerhalb von 1 bis 3 Jahren als Prototyp dienen, sofern die Sensorvorhersage kalibriert und auf eingebetteter Hardware optimiert wird. Für sicherheitskritische zertifizierte Anwendungen sind mehr als 3 Jahre nötig, da zunächst die statistischen Garantien in realen Umgebungen validiert und möglicherweise mit deterministischen Sicherheitsnachweisen kombiniert werden müssen. Auch Hersteller von Bodenrobotern für Logistik oder Inspektion könnten profitieren, wenn die Methode auf andere Sensoren wie LiDAR übertragen wird.

Der Volltext wird hier nicht wiedergegeben, weil die Lizenz der Studie das nicht erlaubt. Das Original steht auf arXiv.