Optimus-R: Memory-centric Framework für Vision-Language-Action-Modelle
Das Preprint stellt Optimus-R vor, ein memory-centric Framework zur Adaption von Vision-Language-Action-Modellen (VLA). Es führt eine Inline Memory Interface, eine Query-Skill Memory Bank und einen Bridge-and-Adapt-Mechanismus ein, um Roboterfähigkeiten als explizite Speichereinträge zu lernen und wiederzuverwenden. In Experimenten auf LIBERO, CALVIN und RoboTwin 2.0 verbessert Optimus-R die Dateneffizienz deutlich und erreicht im Cross-Domain-Transfer mit 20 Demonstrationen pro Aufgabe 33,3 % Erfolgsrate auf einem echten Roboter, 13,9 Prozentpunkte über der Baseline.