RL引导PAC-NMPC:固定翼无人机视觉导航实现概率安全与远见
本文提出将强化学习训练的actor-critic和传感器预测模型嵌入PAC-NMPC框架,为未知环境中基于感知的导航提供有限时间概率安全保证和长期性能。在固定翼无人机上,该方法在仿真中取得90%成功率,在硬件试验中取得80%成功率,均优于纯RL和传统规划基线。本文为预印本,未经同行评审。
如何在不牺牲长期导航性能的前提下,让基于感知的机器人在未知环境中获得可证明的概率安全保证?
传统NMPC受限于短视和计算负担,难以处理高维感知输入;纯RL策略缺乏硬约束安全保证,且在分布外环境下性能下降。现有NMPC-RL混合方法大多要么不提供安全保证,要么无法扩展到高维传感器输入或复杂非线性动力学。
此前方法包括单独使用NMPC或RL、NMPC与RL混合(如DMPC、POLO、Safe RL-MPC等)、以及使用学习热启动或路标的NMPC。这些方法大多不能同时处理随机动力学、随机价值函数、概率安全保证和高维感知输入,且多数未在真机上验证。
本方法用RL独立训练actor、critic和传感器预测模型,并通过MC dropout近似不确定性;在采样式SNMPC框架PAC-NMPC中引入三个扩展:用actor热启动决策变量、用学习值函数作为终端成本、施加值函数改进约束。传感器预测模型直接从当前测量预测未来深度图,避免递归误差。这种解耦训练避免了内层NMPC优化循环,降低部署计算负担。
固定翼无人机仿真(100个环境):本文方法成功率90%,成本513.3,优于最优PAC-NMPC基线(85%,718.14)和纯RL(81%,468.1)。硬件试验(10个环境):本文方法成功率80%,成本252.2,而纯RL和PAC-NMPC(Map&A*Unknown)均为40%。拉力车硬件试验(20个环境):PAC-NMPC结合学习值函数成功率95%且无碰撞,纯RL成功率85%但有15%碰撞。消融实验表明,去掉RL热启动或学习传感器预测后,固定翼仿真成功率分别降至3%和11%(完整方法90%)。分布外仿真中本文方法成功率76%,与最优基线持平但成本更低(512.1 vs 732.6),纯RL仅46%。
作者承认MC dropout的不确定性估计未校准,缺乏联合训练,且未分析估计值函数与真实值函数的差距。硬件试验仅在室内运动捕捉场地进行,试验次数有限(固定翼10次、拉力车20次),传感器分辨率低(16x12深度图),对细小障碍物可能失效。论文未报告开源代码。
该方法适合无人机、自动驾驶汽车和移动机器人在未知或杂乱环境中高速自主导航。预计1-3年内可在具备实时GPU计算和深度摄像头的硬件上应用,前提是进一步验证安全保证的严格性、提高传感器分辨率并完成更广泛的现场测试。
受许可协议限制,本站不转载该论文全文,仅提供摘要和原文链接。