Erfahrungsgetriebenes Continual Learning für Terrain-Traversabilität bei Quadruped-Robotern mit Validierungs-Gate
Das Preprint stellt eine Pipeline vor, die für einen Unitree Go2 aus Bildern vor dem Kontakt mit einem eingefrorenen DINOv3-Backbone fünf propriozeptive Interaktionsindikatoren vorhersagt und deren Unsicherheit über eine evidentiale Regression schätzt. In einem sequenziellen Hardware-Versuch über drei unbekannte Untergründe senkt das Validierungs-Gate die finale Anchor-NLL-Verschlechterung um 23,1 Prozent gegenüber Replay ohne Gate bei ähnlicher Anpassung an neue Terrains. Damit wird ein Weg gezeigt, kontinuierliches Lernen aus Robotererfahrung mit kontrollierter Beibehaltung früherer Terrain-Modelle zu verbinden.
Wie kann ein Quadruped-Roboter aus eigenen Fuß-Boden-Kontakten lernen, vor dem Kontakt mehrere traversabilitätsrelevante Interaktionsindikatoren samt Unsicherheit vorherzusagen, und wie lässt sich dieses Wissen bei neuen Terrains aktualisieren, ohne frühere Erfahrung übermäßig zu verschlechtern?
Die reine Geometrie und Optik eines Untergrunds sagt nicht zuverlässig voraus, wie der Roboter rutscht, Kräfte aufnimmt oder Energie verbraucht; bestehende Systeme nutzen oft nur einzelne Eigenschaften, neigen bei Online-Feintuning zu katastrophalem Vergessen oder werden auf unbekanntem Terrain übermäßig sicher.
Bisherige Ansätze umfassen geometrische und semantische Karten, selbstüberwachte visuelle Vorhersagen einzelner physikalischer Größen wie Reibung oder Steifigkeit, Online-Adaptionsverfahren mit Replay oder generativem Gedächtnis sowie unsicherheitsbewusste Navigation. Sie sagen meist keinen vollständigen Satz propriozeptiver Indikatoren voraus, koppeln Update-Auswahl nicht an getrennte historische und aktuelle Validierungsdaten oder behandeln Unsicherheit nicht als Teil der kontinuierlichen Update-Entscheidung.
Die Pipeline verknüpft jeden abgeschlossenen Fußkontakt kausal mit dem zuletzt vor dem Aufsetzen sichtbaren Bildausschnitt. Ein eingefrorener DINOv3 ViT-S/16 extrahiert 36x36 Token à 384 Dimensionen; ein kleiner MLP-Regressor mit fünf Köpfen gibt für jeden Indikator Parameter einer Normal-Inverse-Gamma-Verteilung aus, woraus Mittelwert, aleatorische und epistemische Unsicherheit folgen. Trainiert wird mit einem konfidenzgewichteten evidentialen Ziel, wobei jede der fünf Messgrößen eigene Zuverlässigkeitswerte erhält. Im Betrieb wird ein Kandidat im Hintergrund mit bis zu 150 Replay-Samples und höchstens 1000 Online-Gedächtniselementen optimiert; übernommen wird er nur, wenn er die NLL auf kürzlich gehaltenen Kontakten strikt verbessert und die NLL auf einem historischen Anker um höchstens 0,15 Prozent relativ verschlechtert. Die Vorhersagen werden in eine lokale 15x15-m-Karte mit 0,1-m-Zellen projiziert, zeitlich geglättet und mit epistemischer Varianz konservativ zu einem gewichteten Traversabilitätswert fusioniert. Hardware ist ein Unitree Go2 mit RealSense D435 und externer RTX-5050-PC, die Software läuft unter ROS 2.
Die Offline-Regression erreicht in Simulation für planar foot slip MAE 0,0050 m, R² 0,3958 und 80%-Coverage 82,11 %, für traction index MAE 0,0711, R² 0,6037 und Coverage 74,80 %. Auf Hardware sind die Werte für planar foot slip MAE 0,0047 m, R² 0,4110, Coverage 80,21 %; Normal-GRF MAE 3,6191 N, R² 0,3470, Coverage 80,21 %; Traction Index MAE 0,0296, R² 0,5269, Coverage 82,81 %; CoT MAE 0,235608, R² 0,3128, Coverage 85,42 %; Loading Rate MAE 321,605 N/s, R² 0,5908, Coverage 71,36 %. Die räumliche Trennung ergibt Score-Lücken von 0,2991 in Simulation und 0,4382 auf Hardware. Im sequenziellen Hardware-Versuch mit einem aufgezeichneten Strom aus 951 akzeptierten Kontakten über künstliches Gras, strukturierten Schaum und Schaum reduziert CL-P die finale Anchor-NLL-Verschlechterung auf 0,608 % gegenüber 0,790 % bei Replay, eine relative Reduktion von 23,1 %. Die Anpassung an neue Terrains liegt bei 1,658 % für CL-P und 1,664 % für Replay; die Labor-MAE-Verschlechterung beträgt 0,801 % gegenüber 0,924 %, die finale Makro-MAE 1,03711 gegenüber 1,03633. CL-P akzeptiert 53 von 80 Kandidaten und lehnt 24 durch das Anker-Gate ab, Replay akzeptiert 70 und lehnt 10 über die Recent-Validierung ab. In der Navigationssimulation mit Nav2 und SMAC Lattice über fünf identische Versuche erreichen Offline und CL-P jeweils 5 von 5 Zielen; die Exposition auf ungünstigem Terrain beträgt 3,13 % für Offline und 2,76 % für CL-P, die Pfadlängen 23,75 m und 24,53 m.
Die Hardware-Studie verwendet nur einen aufgezeichneten Kontaktstrom mit fünf Optimierungs-Seeds; es gibt keine unabhängigen Wiederholungen mit mehreren Strömen. Simulation und Hardware trainieren getrennte Modelle, ein Sim-to-Real-Transfer wird nicht gezeigt. Die Navigationstests finden nur in Simulation statt und isolieren den Gate-Beitrag nicht. Längere Terrainsequenzen, deformierbares Terrain und variable Gangbedingungen werden als offene Punkte genannt. Ob der Code veröffentlicht ist, wird im Paper nicht berichtet.
Unternehmen mit legged robots wie Unitree, Boston Dynamics oder ANYbotics sowie Anbieter von Navigationssoftware für Inspektions- und Arbeitsroboter könnten die Pipeline in 1 bis 3 Jahren in ihre Stacks integrieren, sofern längere und vielfältigere Erfahrungsströme, deformierbare Untergründe und Onboard-Compute ohne externe GPU validiert werden. Voraussetzung ist außerdem, dass sich die Update-Gate-Regeln auf mehreren Robotern und über längere Einsätze als stabil erweisen; ein direkter Produkteinsatz im jetzigen Stand ist wegen der schmalen Hardware-Evidenz und des Preprint-Status nicht belegt.
Der Volltext wird hier nicht wiedergegeben, weil die Lizenz der Studie das nicht erlaubt. Das Original steht auf arXiv.