ROBOTNESS
전문가arXiv

DiffWAM, 미래 영상 생성 없이 비디오 예측 표현을 UAV 궤적으로 직접 전환

Mo Zhu, Yuze Wu, Xijie Huang, Xiao Cui, Fei Gao, Xin Zhou
30초 요약

DiffWAM은 동결된 비디오 기초 모델의 중간 예측 표현을 첫 프레임 기하 정보와 결합해 연속 카메라 궤적으로 직접 변환하는 내비게이션 세계-행동 모델이다. DiffWAM-1000 1,000개 평가에서 궤적 RMSE 0.3492m, 엔드포인트 성공률 74.40%를 기록했고, DiffWAM-Flash는 Jetson AGX Thor에서 모델 파이프라인 지연 1.080초를 보였다. 이 연구는 arXiv 프리프린트이며, 미래 비디오 생성과 다중 프레임 복원 없이 예측 표현만으로 구조적 UAV 비행을 수행할 수 있음을 보였다.

연구 질문

비디오 기초 모델의 초기 중간 예측 표현에서 미래 비디오 생성과 기하 복원 없이 언어 지시에 따른 연속 UAV 모션을 직접 복원할 수 있는가?

문제

기존 VLN/VLA는 VLM 기반으로 어디로 갈지 결정하는 데 강하지만, 방향과 여유 공간, 공간 스케일 제약이 있는 연속적이고 구조화된 모션을 실행 가능한 궤적으로 바꾸는 데 한계가 있다. NavDreamer 같은 생성-재구성 방식은 미래 영상 생성과 픽셀 렌더링, 다중 프레임 기하 복원에 큰 연산을 쓰지만 내비게이션에는 불필요하다. 초기 예측 특징은 외관과 카메라 모션, 객체 모션, 언어 조건, 예측 불확실성이 얽혀 있고, 전역 풀링은 모션 복원에 필요한 공간 대응을 파괴하며 암시적 특징만으로는 미터 단위 기준이 없다.

기존 접근

NavDreamer와 ImagineUAV는 미래 영상을 생성한 뒤 3D 모션을 복구한다. WorldVLN은 잠재 세계 전이를 예측해 웨이포인트 동작을 디코딩하고, Fast-WAM과 Faster-WAM은 비디오 모델 표현에서 행동을 직접 예측하지만 여러 은닉층을 집계하거나 전역 풀링을 사용해 공간 대응을 잃고 미터 단위 기하 기준이 약하다.

새 접근

DiffWAM은 MiniMax H3 동결 비디오 백본에서 스케줄 인덱스 0~3의 초기 예측 특징과 DiT 블록 15, 25, 35의 다중 깊이 특징을 선택적으로 추출한다. Grid-Motion은 현재 그리드와 1슬롯 및 4슬롯 이전 그리드 간 시간 연관, 첫 프레임 관측 앵커와 기하 값 조건 연관을 학습한다. Latent2Pose는 38개 미래 포즈 쿼리와 8개 트랜스포머 디코더 블록으로 첫 프레임 MoGe2 기하와 장면 스케일 s0를 조건으로 연속 자세를 출력한다. 학습은 오프라인에서만 완전 비디오 롤아웃과 pi3 재구성, MoGe2 깊이 보정으로 교사 궤적을 만들어 초기 예측 특징으로 증류한다. 배포 시 미래 비디오 VAE 디코딩과 다중 프레임 재구성을 제거한다. DiffWAM-Flash는 스케줄 인덱스 0만 유지한다. FastDreamer는 예측과 기하 계산을 비행과 중첩하고 타임스탬프 인지 비동기 궤적 핸드오프로 연속 실행을 지원한다.

결과

벤치마크에서 DiffWAM은 IndoorUAV-VLA 56.77%, UAV-FLOW-Sim 91.42%, DiffWAM-1000 74.40%의 엔드포인트 성공률을 기록해 비교 모델 중 1위였다. 같은 기준에서 WorldVLN은 39.32%, 80.24%, 58.40%였다. DiffWAM-1000에서는 기본 모션 92.00%, 객체 상호작용 70.46%, 공간 내비게이션 74.00%, 장면 이해 84.00%로 보고됐다. 아키텍처 비교에서 DiffWAM은 RMSE 0.3492m, ADE 0.3151m, FDE 0.4357m, RoE 2.9179도, 헤드 P50/P95 37.35/38.84ms였다. Faster-WAM 대비 RMSE 50.19%, FDE 59.63% 감소했고, MLP 대비 RMSE 74.84%, FDE 83.36% 감소했다. 생성 지도 데이터를 1k에서 64k로 늘리면 RMSE 0.8203m에서 0.4873m, FDE 1.4011m에서 0.6884m, RoE 9.9409도에서 2.7894도로 감소했다. DiffWAM-Flash의 Jetson AGX Thor 모델 파이프라인 P50/P95 지연은 1.080/1.101초였고, 이는 명령 재작성과 외부 통신을 제외한 수치다. 실물 실험은 Differential Robotics 플랫폼에서 제약 통과, 궤도 비행, S자 비행, 다단계 내비게이션을 시연했다.

한계

저자는 엔드포인트 성공률이 이동 방향, 궤도 커버리지, 착륙 완료를 검증하지 않으며, 태스크별 폐쇄 루프 완료율과 물리 스케일 정확도, 전체 내비게이션 갱신 지연은 추가 평가가 필요하다고 밝혔다. 교사 궤적은 실측이 아니라 재구성 기반 추정 미터이며, 생성 오류와 재구성 드리프트, 단안 스케일 편향이 남을 수 있다. DiffWAM-Flash 지연은 명령 재작성과 외부 통신을 제외한 모델 파이프라인 수치다. 실물 실험은 대표 사례 중심이고 집계된 실물 성공률은 보고되지 않았다. 코드 공개 여부는 논문에 보고되지 않았다. 프리프린트다.

업계 영향

드론 검사, 실내외 자율 비행, 물류 등 연속 기동이 필요한 UAV 제품에 적용 가능하다. DiffWAM-Flash가 Jetson AGX Thor에서 1.080초 파이프라인 지연을 보여 온보드 프로토타입은 단기간에 가능하지만, 충돌 회피 플래너와 제어 스택의 통합, 태스크별 폐쇄 루프 성공률과 물리 스케일 정확도 검증, 통신과 명령 재작성 포함 전체 지연 측정이 먼저 필요하다. 실측 궤적 데이터와 안전 인증이 갖춰지면 1~3년 안에 검사와 순찰용 드론에 적용될 수 있다. 대규모 생성 지도 학습의 확장성은 더 긴 기간의 범용 비행 모델로 이어질 수 있다.

이 논문은 라이선스상 전문을 게재할 수 없어 요약과 원문 링크만 제공합니다.