ROBOTNESS
专业arXiv

经验驱动的持续学习预测四足机器人地形可通过性,验证门控降低遗忘23.1%

Luca Bricarello, João Carlos Virgolino Soares, Alberto Sanchez-Delgado, Fulvio Mastrogiovanni, Claudio Semini
30 秒速读

这篇预印本提出一个持续学习管线,利用冻结的DINOv3视觉特征和证据回归器从接触前图像预测五种足端交互指标,并通过有界重放和验证门控持续更新。在Unitree Go2真机顺序经过三种新地形时,带历史验证门控的方法比仅重放方法将最终锚点负对数似然退化降低23.1%,同时新地形适应相近。该预印本尚未经同行评审。

研究问题

如何在不遗忘旧地形知识的前提下,让四足机器人从自身运动经验中持续学习地形可通过性?

问题

仅靠几何和外观无法判断机器人会打滑、受力或耗能;现有方法要么离线预测,要么在线微调会灾难性遗忘,且对多个接触测量指标的不同可靠性处理不足。

既有方法

此前方法如WVN、EVORA、SALON、COTRATE等利用重建置信度、高斯过程方差或集成不确定性,但未同时预测多个足端交互指标及其个体置信度权重;在线更新时也缺少基于近期和历史验证数据的候选模型接受门控。

新方法

使用冻结的DINOv3 ViT-S/16骨干提取36×36图像块特征,证据回归多层感知机输出五个属性的Normal-Inverse-Gamma分布,同时给出均值和不确定性;接触级监督对五个指标按各自测量置信度加权;持续学习将有界重放(上限150个样本)与验证门控结合,候选模型必须在近期验证集上严格改进NLL且历史锚点NLL相对增加不超过0.15%才被部署;遍历地图保留各属性和认知不确定性层,导航权重可调而无需重训。

结果

真机顺序流包含1072个观测、951个接受接触,分人工草、纹理泡沫、泡沫三阶段。在5个优化种子上平均:CL-P(带历史门控)与Replay(仅重放)的新地形适应改善分别为1.658%和1.664%;独立实验室地面测试MAE退化分别为0.801%和0.924%;锚点NLL退化分别为0.608%和0.790%,相对降低23.1%;最终四域宏标准化MAE分别为1.03711和1.03633。仿真导航中Offline和CL-P各完成5/5次试验,不利地形暴露分别为3.13%和2.76%,平均路径长度分别为23.75m和24.53m。硬件离线预测的MAE分别为:平面滑移0.0047m、法向GRF 3.6191N、牵引指数0.0296、CoT 0.235608、加载率321.605N/s。

局限

硬件持续学习比较仅有一条记录流和五个优化种子,未在独立硬件流上验证;仿真和硬件模型分别训练,未验证跨域迁移;导航闭环评估未隔离门控的单独作用;预印本未报告代码开源;仅使用Unitree Go2单一平台,试验规模较小。作者也指出未来需测试更长地形序列、可变形地形和不同运动条件。

产业影响

可应用于需要在未知或变化地形上自主导航的四足机器人产品,如巡检、农业、救援和物流场景。当前原型依赖外接PC和RTX 5050 GPU,距离嵌入部署仍需1至3年;前提是完成更多真实地形长期验证,并降低计算需求以提高机载实时能力。

受许可协议限制,本站不转载该论文全文,仅提供摘要和原文链接。