Optimus-R, 쿼리-스킬 메모리 뱅크로 VLA 적응 비용과 망각을 낮추다
하얼빈공업대학(선전)과 Pengcheng Laboratory 연구팀이 공개한 프리프린트에서 VLA 모델의 새 작업 적응을 메모리 중심으로 바꾼 Optimus-R을 제안했다. Optimus-R은 학습 가능한 메모리 토큰을 VLA prefix 스트림에 삽입해 제어 관련 쿼리와 스킬 표현을 추출하고, 이를 쿼리-스킬 메모리 뱅크에 저장해 재사용한다. 실험에서 30% 학습 데이터만으로 LIBERO 평균 성공률을 16.5%p, CALVIN 평균 완료 길이를 0.42, RoboTwin 2.0 Hard 성공률을 5.0%p 높였고, 실물 로봇 20개 데모 크로스도메인 적응에서 33.3% 성공률로 π0.5 대비 13.9%p 우위를 보였다.
VLA 모델이 매번 파라미터를 갱신하지 않고 명시적 메모리 인터페이스를 통해 새 기술을 획득, 저장, 재사용할 수 있는가?
기존 VLA 적응은 전체 또는 일부 파라미터를 미세 조정해 새 작업을 학습하므로 적응 비용이 크고, 이전 작업 성능이 저하되는 파국적 망각이 발생한다. 외부 검색 메모리는 행동 조건화 경로와 약하게 결합해 제어 관련 정보를 담기 어렵고, 도메인 이동 시 쿼리와 저장된 스킬의 불일치가 커진다.
기존 접근은 π0.5 전체 미세 조정, LoRA, OpenVLA-OFT 같은 파라미터 효율적 튜닝, 또는 시연, 에피소드를 외부 컨텍스트로 검색하는 메모리 보강 방식이었다. 이들은 새 스킬을 모델 가중치에 암묵적으로 흡수하거나 메모리를 정책 경로 밖에 두어 재사용과 확장이 어렵고, 연속 학습에서 간섭이 생긴다.
Optimus-R은 세 요소를 도입했다. 첫째, Inline Memory Interface는 학습 가능한 메모리 토큰을 VLA prefix 스트림에 넣고 두 개의 attention pooling으로 쿼리 q_t와 스킬 s_t를 분리해 뽑는다. s_t는 스킬 디코더로 행동 청크를 재구성하도록 보조 학습한다. 둘째, Query-Skill Memory Bank는 스킬을 쿼리 프로토타입 p_j^q와 스킬 프로토타입 p_j^s 쌍으로 저장하고, 군집화와 top-K 검색으로 재사용하며, 잔차 Δp를 업데이트해 기존 프로토타입을 덮어쓰지 않는다. 셋째, Bridge-and-Adapt는 Stage A에서 인터페이스와 초기 뱅크를 학습하고, Stage B에서 백본과 정렬 어댑터, 잔차를 갱신해 도메인 이동을 흡수하고, Stage C에서는 메모리 뱅크와 정렬기만 갱신해 평생 학습을 지원한다.
In-domain adaptation: LIBERO 4개 스위트(Spatial, Object, Goal, Long) 평균 성공률은 30% 데이터에서 Optimus-R 88.6%로 π0.5 72.1%보다 16.5%p 높았고, 100% 데이터에서 97.8%로 비교 모델 중 최고였다. CALVIN ABC→D 평균 완료 길이는 30% 데이터에서 2.51로 π0.5 2.09보다 0.42 길었고, 100% 데이터에서 4.38이었다. RoboTwin 2.0 Hard는 30% 데이터에서 14.8%로 π0.5 9.8%보다 5.0%p 높았고, 100% 데이터에서 55.0%였다. Cross-domain: RoboTwin 2.0 사전학습 모델을 14자유도 양팔 GALAXEA R1 Lite 실물 로봇 9개 작업에 전이했을 때, 작업당 20개 데모로 평균 33.3% 성공률을 기록해 π0.5 19.4%보다 13.9%p 높았고, 80개 데모에서는 72.2%로 비교 모델 중 최고였다. Lifelong learning: 실물 로봇에서 4개 작업 학습 후 5개 새 작업을 20개 데모로 적응할 때 새 작업 성공률 21.0%로 π0.5보다 11.0%p 높았고, 80개 데모 적응 후 평균 망각률은 10.0%로 OpenVLA-OFT와 π0.5의 15.0%보다 낮았다. 비용: LIBERO 100% 데이터 기준 Optimus-R은 추가 파라미터 7M, 학습 가능 파라미터 0.3B, GPU 86시간, 추론 14Hz였고, π0.5 LoRA는 128시간, 12Hz였다.
논문에 명시적인 한계 섹션은 없지만, 실험 규모가 9개 실물 작업과 단일 GALAXEA R1 Lite 로봇에 국한됐고, 크로스도메인은 RoboTwin 2.0에서 실물로의 단일 경로만 다뤘다. 20개 데모 크로스도메인 성공률 33.3%는 절대적으로 낮으며, 평생 학습에서도 망각률 10.0%가 남아 완전한 망각 제거는 아니다. 코드 공개 여부는 논문에 보고되지 않았다. Stage B에서 백본을 갱신하므로 크로스도메인 적응 시 일부 파라미터 비용이 발생할 수 있다.
제조, 물류, 서비스 로봇 운영사가 새 작업을 소량 데모로 추가할 때 전체 파라미터 재학습 없이 메모리 뱅크만 갱신하면 되므로 적응 비용과 다운타임을 줄일 수 있다. 특히 다품종 조립, 재고 처리, 가정용 로봇의 지속적 기술 확장에 활용 가능하다. 다만 실험은 단일 양팔 로봇과 제한된 작업 세트에 머물러 있어, 상용 배치 전에 다양한 로봇 플랫폼과 작업, 장기간 평생 학습 검증, 메모리 뱅크 확장성 및 코드 공개가 필요하다. 시점은 연구 단계에서 1~3년 내 파일럿 적용이 가능하며, 3년 이후 대규모 상용화는 추가 실증이 필요하다.
이 논문은 라이선스상 전문을 게재할 수 없어 요약과 원문 링크만 제공합니다.