ROBOTNESS
专业arXiv

DiffWAM:直接从冻结视频模型预测表征解码无人机连续轨迹的世界动作模型

Mo Zhu, Yuze Wu, Xijie Huang, Xiao Cui, Fei Gao, Xin Zhou
30 秒速读

DiffWAM 是 arXiv 预印本提出的导航世界动作模型,它从冻结视频模型的中间预测表征中直接生成连续相机轨迹,部署时无需完成未来视频生成和几何重建。在自建 DiffWAM-1000 基准上,DiffWAM 轨迹 RMSE 为 0.3492 米,端点成功率为 74.40%;机载 DiffWAM-Flash 在 NVIDIA Jetson AGX Thor 上模型管道延迟为 1.08 秒。该工作表明预测视频表征可被高效地落地为连续三维运动,为生成再重建的导航管线提供了直接替代方案。

研究问题

能否直接从冻结视频模型的早期预测表征中恢复出语言条件下的连续无人机相机轨迹,从而避免部署时进行完整的未来视频生成和几何重建?

问题

现有基于视觉语言模型的无人机导航方法擅长离散航点决策,但难以将复杂语言指令转化为满足方向、间隙和尺度约束的连续可执行轨迹;基于视频生成的导航管线(如 NavDreamer)需要先合成未来视频再重建相机运动,计算开销大。现有的隐式世界动作模型虽然尝试直接从视频模型特征解码动作,但往往聚合大量隐藏层,全局池化破坏空间对应关系,且隐式特征缺乏可靠的度量空间参考。

既有方法

此前工作分为两类:一类以 NavDreamer、ImagineUAV 为代表,先生成未来视频,再利用几何重建恢复相机轨迹,部署时须进行完整的视频解码和多帧重建;另一类如 Fast-WAM、Faster-WAM,从视频模型隐藏特征中解码动作,但通常汇聚全层特征并做全局池化,无法保留运动恢复所需的时空对应,且缺乏与首帧几何的对齐。

新方法

DiffWAM 使用冻结的 MiniMax H3 视频世界模型,在早期去噪评估(调度索引 0 至 3,Flash 版仅索引 0)中提取 DiT 块 15、25、35 的多层预测特征;Grid-Motion 模块在空间位置和时间上建立运动关联,并通过首帧几何条件化的锚点特征引入场景几何;Latent2Pose 利用冻结 MoGe2 估计的首帧几何,通过 38 个可学习位姿查询和 8 层 Transformer 解码器输出连续相机位姿。训练采用非对称教师-学生流程:离线完成完整视频滚动、用 π3 重建相机运动并用 MoGe2 深度校准尺度,将得到的参考轨迹蒸馏到仅使用早期预测特征的读出器。FastDreamer 进一步将预测与几何计算并行化,与当前飞行重叠执行,并执行时间戳感知的异步轨迹交接,支持连续闭环导航。

结果

在室内 UAV-VLA、UAV-FLOW-Sim 和自建 DiffWAM-1000 基准上,DiffWAM 端点成功率分别为 56.77%、91.42% 和 74.40%,均高于对比方法;最强基线 WorldVLN 对应为 39.32%、80.24% 和 58.40%。在 DiffWAM-1000 任务族中,DiffWAM 基础运动、物体交互、空间导航和场景理解成功率分别为 92.00%、70.46%、74.00% 和 84.00%。在轨迹读出器架构对比中,DiffWAM 的 RMSE、ADE、FDE、RoE 分别为 0.3492 m、0.3151 m、0.4357 m、2.9179°,优于 Faster-WAM(0.7011 m、0.5749 m、1.0792 m、4.5870°);轨迹头部 P50/P95 延迟为 37.35/38.84 ms。机载 DiffWAM-Flash 在 NVIDIA Jetson AGX Thor 上模型管道 P50/P95 延迟为 1.080/1.101 秒,该测量不包括指令重写和外部通信。训练使用超过 510K 条合成轨迹,来自 FlyMirage 和 NavGen。真机实验覆盖三种平台和 9 个代表性案例,包括受限穿越、环绕、S 形飞行和多阶段导航,但论文未报告定量真机成功率。

局限

作者承认需要进一步评估任务特定的闭环完成率、物理尺度精度和跨未见环境的完整导航更新延迟。端点成功率不代表穿越方向、环绕覆盖或降落条件是否满足;教师轨迹由重建和单目深度校准得到,不是物理真值,可能包含生成误差、重建漂移或单目尺度偏差。机载延迟数据排除了指令重写和外部通信,不是完整导航更新延迟。论文未报告代码是否开源,也未提供大规模真机定量指标。训练过程需要完成完整视频滚动和几何重建作为离线监督,算力成本较高;FastDreamer 的闭环执行验证仍以代表性案例为主。

产业影响

该技术可服务于无人机巡检、影视航拍、物流配送和安防巡逻等需要连续结构化飞行的产品,尤其是需要在机载边缘设备上运行视觉语言导航的厂商。在 1 至 3 年内,若闭环完成率和安全性在真实环境中得到充分验证,同时具备类似 Jetson AGX Thor 的机载算力,相关公司可将 DiffWAM 类模型集成到自主无人机堆栈中。更长期(3 年以上)有望扩展到多机协同和复杂动态环境,但前提是解决真机尺度精度、完整更新延迟和碰撞安全认证问题。

受许可协议限制,本站不转载该论文全文,仅提供摘要和原文链接。