Magic-W0, 구조화된 세계 전이와 행동 생성을 결합한 로봇 기반 모델
Magic-W0는 현재 3D 지오메트리, 3D 모션, 미래 의미 표현으로 세계 상태 전이를 구조화하고 연속 행동 생성을 층 정렬 주의로 결합한 세계-행동 기반 모델이다. RoboDojo-Sim에서 평균 Score 27.10으로 비교된 WAM 중 1위를 기록했고, 실물 로봇 5개 과제 평균 성공률 94.6%로 pi0.5의 91.8%를 넘었다. 이 논문은 아직 동료 심사를 거치지 않은 프리프린트다.
로봇 제어에 필요한 물리적 상태 변화를 구조화된 예측 표현으로 조직하고, 행동 가설과 세계 전이 예측이 서로 조건화하며 함께 진화하도록 단일 정책 안에서 결합할 수 있는가?
기존 VLA는 행동 모방 중심으로 세계 이해를 암묵적으로만 학습하고, 기존 WAM은 미래 관측 복원이나 일반적 잠재 특징 예측에 그쳐 제어에 필요한 3D 구조와 행동 유도 변화를 명시적으로 표현하지 못한다. 또한 세계 예측과 행동 생성이 긴밀히 결합되지 않아 후보 행동이 세계 변화에 지속적으로 반영되지 않는다.
픽셀 기반 WAM(UniPi, Dreamitate, RoboDreamer 등)은 미래 영상 복원에 용량을 쓰고 질감, 조명, 배경 등 제어와 무관한 정보를 포함하며 2D 변화로 3D 공간을 드러내지 못한다. 잠재 WAM(DINO-WM, Fast-WAM 등)은 복원 부담을 줄였지만 미래 표현의 구조와 행동 표현과의 정렬이 부족하다.
Magic-W0는 Current State(VLM 컨텍스트+Current 3D Geometry), Transition(3D Motion), Future State(Future Semantics)로 Structured World Transition을 정의한다. Qwen3.5-2B 백본 위에 3D 스트림, 의미 스트림, 행동 전문가를 두고 24개 층에서 3개 Gated DeltaNet 층마다 조인트 어텐션으로 상호 교환한다. 행동 가설이 미래 모션, 의미를 조건화하고 세계 표현이 행동 속도장을 갱신한다. 학습은 Track4World와 DINOv3의 잠재 교사 특징을 사용하며, 34차원 통합 상태-행동 인터페이스로 인간 조작, UMI, 실물 로봇, 시뮬레이션 약 201.4만 에피소드를 사전학습한다.
RoboDojo-Sim 42개 태스크 공식 평가에서 Magic-W0는 평균 Score 27.10, 평균 성공률 20.84%로 비교된 WAM 중 1위였다. 평균 Score는 OpenWAM-alpha보다 9.92점 높았고, Generalization 차원에서 Score 28.20, 성공률 22.01%로 WAM 중 최고였다. LIBERO 파인튜닝 평가에서는 평균 성공률 99.1%, Spatial 99.4%, Goal 99.6%를 기록했다. 실물 로봇 5개 과제(각 100회 독립 시행)에서는 평균 성공률 94.6%로 pi0.5의 91.8%보다 2.8%p 높았고, object storage 90%→95%, kitchen storage 91%→95%, pen storage +3%p, clothes folding +2%p 개선, bottle uprighting은 둘 다 100%였다.
저자들은 손가락 정밀 조작과 촉각, 힘 신호 통합을 향후 과제로 제시했고, 다층 세계-행동 상호작용의 추가 연산 비용과 최신 VLA 대비 추론 속도 격차를 해소해야 한다고 밝혔다. 프리프린트로 동료 심사가 확인되지 않았고, 실물 평가는 5개 과제 100회 시행에 그쳤다.
다중 실시예 로봇 데이터를 하나의 인터페이스로 통합해 조작 정책을 만들 수 있어, 로봇 제조사나 물류, 서비스 로봇 기업이 자사 로봇에 파인튜닝해 적용할 여지가 있다. 현재 오픈소스로 공개된 모델을 보유한 기업은 자체 데이터로 시범 적용할 수 있지만, 대규모 배포에는 추론 가속, 촉각 등 접촉 정보 통합, 더 넓은 실물 검증이 선행되어야 하며 실제 제품 적용은 1~3년 뒤에 가능할 것으로 보인다.
이 논문은 라이선스상 전문을 게재할 수 없어 요약과 원문 링크만 제공합니다.