ROBOTNESS
전문가arXiv

경험 기반 지속 학습 CL-P로 쿼드러패드 로봇의 지형 통과성을 예측한다

Luca Bricarello, João Carlos Virgolino Soares, Alberto Sanchez-Delgado, Fulvio Mastrogiovanni, Claudio Semini
30초 요약

프리프린트로 공개된 이 논문은 쿼드러패드 로봇이 접촉 전 이미지로부터 평면 발 미끄러짐, 평균 수직 지면 반력, 견인 지수, 이동 비용, 접지 하중률 등 5가지 상호작용 지표를 예측하고, 검증 게이트를 적용한 지속 학습으로 새로운 지형에 적응하면서 과거 성능 저하를 줄이는 파이프라인을 제안했다. 하드웨어 순차 실험에서 과거 앵커 NLL 성능 저하를 리플레이 단독 대비 23.1% 줄였으며, 시뮬레이션 내비게이션에서도 안정적으로 동작했다.

연구 질문

로봇의 접촉 경험을 활용해 새로운 지형에 적응하면서 과거 지형에 대한 예측 성능을 유지할 수 있는 검증 게이트 기반 지속 학습이 가능한가?

문제

지형 통과성은 지형의 기하학적 형태나 시각적 외관만으로는 결정되지 않는다. 로봇 발의 미끄러짐, 하중, 에너지 소비 등 접촉 결과를 사전에 예측해야 하지만, 기존 시스템은 새로운 지형을 만나면 온라인 학습 과정에서 과거 경험을 잊거나 불확실성을 과소평가할 수 있다.

기존 접근

기존 연구는 시각 기반 물리 속성 예측, 경험 리플레이, 불확실성 인지 내비게이션을 개별적으로 다뤘다. 그러나 여러 상호작용 지표를 측정 신뢰도에 따라 가중치를 두고 예측하면서, 후보 모델을 최근 및 과거 검증 데이터로 선별하는 통합 방식은 없었다.

새 접근

이 논문은 고정된 DINOv3 ViT-S/16 백본으로 추출한 패치 특징을 에비덴셜 회귀 모델에 입력해 다섯 가지 지표와 불확실성을 예측한다. 학습은 인과적 시각-고유수용 감각 쌍으로 구성되며, 각 지표는 측정 신뢰도로 가중된다. 지속 학습은 제한된 리플레이(최대 150개)와 검증 게이트를 결합하는데, 후보 모델이 최근 검증 NLL을 개선하고 과거 앵커 NLL 저하를 허용 오차(0.15%) 이내로 유지할 때만 배포된다. 또한 개별 속성과 불확실성 레이어를 유지하는 지도를 생성하여 내비게이션 가중치를 재학습 없이 조정할 수 있다.

결과

오프라인 예측에서 하드웨어 테스트셋 평균 절대 오차(MAE)는 평면 발 미끄러짐 0.0047m, 견인 지수 0.0296, 이동 비용 0.235608, 접지 하중률 321.605 N/s 등이었다. 순차 하드웨어 실험(인공 잔디, 질감 폼, 폼 순서, 수용된 접촉 951개, 시드 5개)에서 CL-P는 리플레이 단독 대비 최종 앵커 NLL 저하를 23.1% 줄였다(0.608% vs 0.790%). 새 지형 적응률은 CL-P 1.658%, 리플레이 1.664%로 유사했고, 독립 실험실 테스트 MAE 저하는 각각 0.801%, 0.924%였다. 시뮬레이션 내비게이션 5회 시험에서 Offline과 CL-P 모두 성공했고, 불리한 지형 노출은 각각 3.13%와 2.76%, 경로 길이는 23.75m와 24.53m였다.

한계

저자들은 하드웨어 비교가 하나의 녹화 스트림과 5개 최적화 시드에 국한되었고, 시뮬레이션과 하드웨어 모델을 별도로 학습했으며, 내비게이션 평가에서 게이트의 기여를 분리하지 못했다고 밝혔다. 독립적으로 수집된 하드웨어 스트림에 대한 일반화는 아직 검증되지 않았고, 코드 공개 여부도 보고되지 않았다. 추론은 외부 PC(RTX 5050)에서 실행되어 온보드 경량화가 필요하다.

업계 영향

보행 로봇 제조사(Unitree, Boston Dynamics, ANYbotics 등)와 검사, 농업, 건설, 재난 현장용 로봇 내비게이션 스택에 통합 가능하다. ROS 2와 Nav2 기반으로 구현되어 기존 자율주행 시스템과의 연동이 용이하며, 속성 가중치를 재학습 없이 조정할 수 있어 현장 맞춤형 설정이 가능하다. 다만 현재는 외부 GPU가 필요하고 장시간, 변형 지형, 다양한 보행 조건 검증이 부족해 상용 적용은 1~3년 후가 될 전망이다.

이 논문은 라이선스상 전문을 게재할 수 없어 요약과 원문 링크만 제공합니다.