UAV Navigation전문가
DiffWAM, 미래 영상 생성 없이 비디오 예측 표현을 UAV 궤적으로 직접 전환
DiffWAM은 동결된 비디오 기초 모델의 중간 예측 표현을 첫 프레임 기하 정보와 결합해 연속 카메라 궤적으로 직접 변환하는 내비게이션 세계-행동 모델이다. DiffWAM-1000 1,000개 평가에서 궤적 RMSE 0.3492m, 엔드포인트 성공률 74.40%를 기록했고, DiffWAM-Flash는 Jetson AGX Thor에서 모델 파이프라인 지연 1.080초를 보였다. 이 연구는 arXiv 프리프린트이며, 미래 비디오 생성과 다중 프레임 복원 없이 예측 표현만으로 구조적 UAV 비행을 수행할 수 있음을 보였다.