RL 기반 Actor-Critic PAC-NMPC, 미지 환경 인지 내비게이션에 확률적 안전 보장
이 논문은 RL로 학습한 액터, 크리틱과 센서 예측 모델을 PAC-NMPC에 결합해 미지 환경에서 확률적 안전을 보장하는 Actor-Critic PAC-NMPC를 제안했다. 고정익 UAV 하드웨어 실험에서 성공률 80%로 기존 RL 액터와 PAC-NMPC의 40%를 크게 웃돌았고, 시뮬레이션에서는 90% 성공률을 기록했다. 이는 학습 기반 장기 계획과 샘플링 기반 SNMPC의 충돌 확률 상한 보장을 동시에 얻는 방법이다. arXiv 프리프린트다.
RL 액터, 크리틱과 센서 예측 모델을 PAC-NMPC에 결합하면, 미지 환경에서 인지 기반 내비게이션의 확률적 안전 보장과 장기 성능을 동시에 달성할 수 있는가?
미지 환경을 고속으로 비행하는 고정익 UAV나 지상 로봇은 비선형 동역학과 부분 관측, 제한된 시야를 다뤄야 한다. 순수 RL 정책은 학습 분포 밖에서 충돌 제약을 강제할 수 없고, NMPC는 근시적 단기 최적화에 그쳐 장기 성능이 떨어진다.
기존 연구는 RL 정책에 CBF나 안전 계층을 붙이거나 PAC-NMPC 같은 SNMPC로 확률적 상한을 제공했지만, 각각 전역 보장이 없거나 고차원 인지 입력과 학습 모델 결합이 어려웠다. 매핑과 A* 전역 플래너를 결합한 PAC-NMPC도 센서 노이즈와 미관측 공간 처리에 한계를 보였다.
RL(TD3)로 액터, 크리틱을 독립 학습하고 Monte Carlo dropout으로 불확실성을 근사한다. 센서 예측 모델은 현재 깊이 영상과 미래 상태에서 미래 센서 측정을 직접 예측해 재귀 오차를 줄인다. 이 모델들로 PAC-NMPC의 결정 변수를 warm-start하고, 학습된 확률적 가치 함수를 종단 비용으로 쓰며, 궤적상 가치 함수 개선 제약을 추가한다. PAC-NMPC는 피드백 정책 분포를 최적화해 충돌 확률과 비용에 대한 유한 시간 PAC 상한을 제공한다.
고정익 UAV 시뮬레이션 100개 환경에서 Actor-Critic PAC-NMPC는 성공률 90%를 기록해 RL 액터 81%, PAC-NMPC 변형(깊이 이력 52%, 맵 63%, 맵+A* 74%, 맵+A* 미지 공간 페널티 85%)보다 높았다. 성공 시 평균 누적 비용은 513.3으로 RL 액터 468.1보다 높지만 PAC-NMPC 계열 중 최저였다. Ablation에서는 RL warm-start 제거 시 3%, 센서 예측을 기하 투영으로 대체 시 11%로 떨어졌다. 분포 밖 시뮬레이션에서는 76%로 PAC-NMPC 76%와 같고 RL 46%보다 높았으며, 비용 512.1로 PAC-NMPC 732.6보다 낮았다. 고정익 하드웨어 10개 환경에서는 80% 성공률과 평균 비용 252.2를 기록해 RL 액터 40%, 403.8, PAC-NMPC 40%, 325.4를 앞섰다. 1/10 스케일 랠리카 하드웨어 20개 환경에서는 95% 성공률, 0% 충돌로 액터 정책 85%, 15% 충돌보다 안전했고, 휠베이스 모델 불일치 조건에서도 80% 성공, 0% 충돌로 액터 70%, 30% 충돌보다 나았다.
저자들은 MC dropout 불확실성이 보정되지 않았고, 센서 예측과 PAC-NMPC를 분리해 학습해 공동 최적화가 안 됐으며, 추정 가치 함수와 실제 가치 함수의 차이 분석이 필요하다고 밝혔다. PAC 보장은 현재 관측에 조건부인 유한 지평 보장이라 무한 지평 폐루프 전역 안전을 뜻하지 않는다. 16×12 저해상도 깊이 입력은 얇은 장애물 검출에 불리할 수 있고, 평가는 두 플랫폼과 제한된 환경 분포에 국한됐다. 코드 공개 여부는 논문에 보고되지 않았다.
고정익 UAV 자율 검사, 배송이나 비정형 환경 지상 로봇 내비게이션에 적용 가능하다. 실시간 GPU 기반 SNMPC가 이미 하드웨어에서 동작했으므로 연구 시제품에는 지금 적용할 수 있다. 다만 산업 배치에는 센서 노이즈 제거, 불확실성 보정, 안전 인증과 결정적 연산 요건이 필요해 1~3년 뒤 본격 도입이 예상된다.
이 논문은 라이선스상 전문을 게재할 수 없어 요약과 원문 링크만 제공합니다.