ROBOTNESS
전문가arXiv

Scene Graph와 MPAR로 로컬 전신 VLA를 장면 규모 공중 조작으로 확장

Weixiang Guo, Rui Jin, Haotian Jin, Xinhang Xu, Ruiyang Liu, Haoran Zhao, Yi Wang, Weiqi Gai, Kun Cao, Lihua Xie
30초 요약

이 프리프린트는 관절형 무인 항공 조작기(UAM)에서 로컬 전신 비전-언어-행동(VLA) 정책을 장면 규모 임무로 확장하는 통합 프레임워크를 제안했다. 합성 데모로 VLA를 훈련하고 측정 진행 정렬(MPAR)로 비동기 행동 청크를 연속 궤적으로 실현하며, Scene Graph로 언어 목표를 실행 가능한 핸드오프 상태로 연결한다. 시뮬레이션 다중 사이트 임무 50회 중 21회(42.0%)를 완료했고 물리 UAM에서도 검증해 합성 데이터 기반 공중 조작 가능성을 보였다.

연구 질문

로컬 전신 VLA 행동을 장면 규모 공중 조작 임무로 확장할 때, 물리 플랫폼 데모 없이 합성 훈련 데이터를 만들고 비동기 추론 지연과 언어 목표의 물리적 실행 가능성을 동시에 해결할 수 있는가?

문제

관절형 UAM에 전신 데모를 수집하는 것은 기체, 팔, 그리퍼가 결합된 동역학과 구동 한계 때문에 비용과 위험이 크다. VLA 추론과 실행이 비동기라 새 행동 청크 도착 시 경과 시간이 실제 진행 상태와 어긋나며, 관계형 언어 목표는 대상 객체뿐 아니라 로컬 행동을 시작할 수 있는 전신 핸드오프 상태로도 해석돼야 하는데 기존 시스템은 이 세 문제를 분리해서 다룬다.

기존 접근

AirVLA는 RTC로 비동기 실행을, Flying Hand와 UMI-on-Air는 물리 관절형 UAM에서 학습된 비주모터 제어를 다뤘지만 언어 조건형 기반 VLA와 실행 정렬을 함께 처리하지 않았다. SayPlan, DovSG, USS-Nav 등은 장면 그래프로 의미, 위상 추론을 지원하지만, 언어 목표를 실행 가능한 전신 핸드오프 상태와 충돌 없는 전신 이동으로 연결하지는 못했다.

새 접근

본 시스템은 세 부분으로 구성된다. 첫째, 장면 재구성형 파이프라인이 MuJoCo 및 3DGS 렌더링으로 전신 전문가 궤적과 동기화된 다중 뷰 관측을 생성해 물리 플랫폼 데모 없이 VLA를 훈련한다. π0.5를 OpenPI로 파인튜닝하고 PaliGemma 언어 모듈과 행동 expert에 LoRA를 적용해 224×224 베이스, 손목 카메라, 고유수용감각, 언어 지시를 입력받아 0.25초 간격으로 10개 미래 행동(2.5초 지평)을 예측한다. 둘째, MPAR는 측정 상태를 새 VLA 경로에 투영해 핸드오프 위상을 정렬하고 C² 브리지와 MINCO 궤적 최적화로 기체, 요, 팔 전신 제약을 만족하는 연속 궤적을 만든다. 셋째, Scene Graph가 Area-Polyhedron 계층에서 언어 지시를 객체 인스턴스와 기술별 상호작용 영역으로 연결하고, 위상 탐색과 폴리헤드론 회랑으로 사이트 간 전신 이동을 안내한다.

결과

시뮬레이션 다중 사이트 임무에서 Monolithic Whole-Task VLA 기준은 0/50 성공인 반면 제안 시스템은 21/50(42.0%, 95% Wilson CI [29.4, 55.8]%)을 달성했다. 제안 시스템의 29회 실패 중 1회는 계획 실패, 28회는 로컬 VLA 상호작용에서 발생했다. oracle target과 feasible-handoff 조건의 로컬 VLA 기술은 39/60(65.0%) 성공했고, 이 중 물체 획득은 14/30, 획득 후 작업은 25/30이었다. MPAR는 비동기 실행 조건에서 78/120(65.0%) 성공해 nominal-time ablation 71/120(59.2%), RTC-Direct 54/120(45.0%)보다 높았다. 60회의 짝지은 C2, C3 에피소드에서 MPAR는 P50 위상 오차를 평균 0.212초(95% CI [0.163, 0.262]초), P95 위상 오차를 0.315초 줄였고, 충돌 발생 실행은 RTC-Direct 22/120, nominal-time 4/120, MPAR 1/120이었다. 물리 UAM에서 로컬 VLA는 병 집기 2/5, 직육면체 블록 집기 1/5, 물주기 3/5, 보관 3/5를 성공했고, 전체 시스템은 교차 사이트 물주기 임무에서 2/5 성공했다.

한계

저자들은 사전 구축된 Scene Graph와 원격 VLA 추론에 의존하며, 임무 성능이 개별 로컬 스킬의 한계에 좌우된다고 밝혔다. 물리 실험은 과제별 5회, 전체 교차 사이트 물주기 2/5 등 시행 횟수가 적고, 단일 관절형 UAM에서 수행됐다. 코드 공개 여부는 논문에 보고되지 않았다. 외부 호스팅 LLM에 의존하는 임무 구성과 온라인 Scene Graph 갱신 부재도 현재 한계로 남는다.

업계 영향

물류 창고, 농업, 재난 현장 등에서 드론과 로봇팔을 결합한 공중 조작 제품이 활용할 수 있다. 사전 구축된 장면 그래프가 있는 구조화된 실내외 현장이라면 1~3년 내 파일럿 적용 가능성이 있지만, 온보드 VLA 추론, 온라인 Scene Graph 구축, 갱신, 더 넓은 물리 상호작용 성능이 먼저 확보돼야 한다. 현재는 원격 GPU 추론과 사전 구축 지도에 의존하므로 즉시 상용 배치보다는 연구, 검증 단계에 가깝다.

이 논문은 라이선스상 전문을 게재할 수 없어 요약과 원문 링크만 제공합니다.