ROBOTNESS
FortgeschrittenarXiv

Optimus-R: Memory-centric Framework für Vision-Language-Action-Modelle

Zaijing Li, Rui Shao, Bing Hu, Haoyu Zhang, Dongmei Jiang, Liqiang Nie
In 30 Sekunden

Das Preprint stellt Optimus-R vor, ein memory-centric Framework zur Adaption von Vision-Language-Action-Modellen (VLA). Es führt eine Inline Memory Interface, eine Query-Skill Memory Bank und einen Bridge-and-Adapt-Mechanismus ein, um Roboterfähigkeiten als explizite Speichereinträge zu lernen und wiederzuverwenden. In Experimenten auf LIBERO, CALVIN und RoboTwin 2.0 verbessert Optimus-R die Dateneffizienz deutlich und erreicht im Cross-Domain-Transfer mit 20 Demonstrationen pro Aufgabe 33,3 % Erfolgsrate auf einem echten Roboter, 13,9 Prozentpunkte über der Baseline.

Forschungsfrage

Kann ein VLA-Modell Roboterfähigkeiten über eine explizite Speicherschnittstelle erwerben, speichern und wiederverwenden, statt wiederholt Modellparameter zu aktualisieren?

Problem

Bestehende VLA-Adaptionsmethoden basieren meist auf Parameter-Tuning und verursachen hohe Kosten sowie katastrophales Vergessen. Externe Retrieval-Speicher sind nur schwach mit dem Action-Conditioning-Pfad des VLA gekoppelt, und bei Domain-Shift passen Zielbeobachtungen nicht zum Quell-Speicherraum; dadurch leidet die Wiederverwendbarkeit von Fähigkeiten.

Bisheriger Ansatz

Bisherige Ansätze wie Full Fine-Tuning, LoRA oder Adapter kodieren neue Fähigkeiten implizit in Modellgewichten und riskieren Interferenzen mit früheren Aufgaben. Externe Gedächtnisse für Embodied Agents (z. B. MemoryVLA oder RAG-basierte Methoden) behandeln Speicher als losgelösten Kontext oder episodische Abrufe und sind nicht eng mit der Aktionskonditionierung verbunden.

Neuer Ansatz

Optimus-R fügt vier lernbare Memory-Token in den VLA-Präfix-Stream ein (Inline Memory Interface), leitet daraus getrennte Query- und Skill-Repräsentationen ab und speichert diese als Query-Prototypen und Skill-Werte in einer Query-Skill Memory Bank. Ein Bridge-and-Adapt-Mechanismus richtet Ziel-Domänen-Queries und -Skills durch einen Lightweight-Adapter und residuale Updates am bestehenden Speicherraum aus. Das Training erfolgt in drei Stufen: Interface-Pretraining, Bridge-Adaption und Memory-Adaption. Verwendet werden 256-dimensionale Einbettungen, Top-2-Retrieval, initial 128 Prototypen, 8 NVIDIA A800 GPUs, 30.000 Schritte und eine Batchgröße von 256. Die reale Evaluierung nutzt einen 14-DoF bimanuellen GALAXEA R1 Lite Roboter.

Ergebnisse

Auf LIBERO erreicht Optimus-R mit 30 % Trainingsdaten im Durchschnitt 88,6 % Erfolgsrate (π0.5: 72,1 %), mit 100 % Daten 97,8 % (π0.5: 96,9 %). Auf CALVIN steigt die durchschnittliche Abschlusslänge mit 30 % Daten von 2,09 auf 2,51, auf RoboTwin 2.0 Hard von 9,8 % auf 14,8 %. Im Cross-Domain-Transfer mit 20 Demos pro Aufgabe erzielt Optimus-R 33,3 % Erfolgsrate (π0.5: 19,4 %), mit 80 Demos 72,2 % (π0.5: 63,3 %). Im Lifelong Learning mit 20 Demos für neue Aufgaben erreicht Optimus-R 21,0 % Erfolg (π0.5: 10,0 %), nach 80-Demo-Adaption behält es 77,5 % alte Aufgaben und reduziert das Vergessen von 15,0 % (π0.5) auf 10,0 %. Optimus-R hat 7M zusätzliche Parameter, 0,3B trainierbare Parameter, benötigt 86 GPU-Stunden für LIBERO (100 % Daten) und erreicht 14 Hz Inferenzfrequenz.

Grenzen

Die Autoren nennen keine expliziten Limitationen. Offensichtliche Grenzen sind: Evaluierung auf nur einem realen Roboter (GALAXEA R1 Lite) und neun realen Aufgaben; keine Angaben zur Skalierung auf sehr viele Aufgaben oder langfristiges kontinuierliches Lernen; kein veröffentlichter Code im Paper erwähnt; Rechenaufwand für die Memory-Bank-Konstruktion und das Clustering wird nicht detailliert berichtet.

Bedeutung für die Branche

Unternehmen, die VLA-Modelle für Roboter-Manipulation einsetzen, etwa Anbieter von Lager- oder Servicerobotern, könnten Optimus-R nutzen, um mit wenigen Demonstrationen neue Aufgaben zu lernen. Ein Einsatz in Produkten ist innerhalb von 1 bis 3 Jahren denkbar, sofern der Code veröffentlicht, auf weiteren Roboterplattformen validiert und die Langzeitstabilität der Memory-Bank über viele Aufgaben nachgewiesen wird. Zuerst müssen Rechenkosten und Wartung des Speichers geklärt sein.

Der Volltext wird hier nicht wiedergegeben, weil die Lizenz der Studie das nicht erlaubt. Das Original steht auf arXiv.