Model-based RL전문가
PL-MPC, 계획-학습 폐루프를 함께 개선해 HumanoidBench와 실물 렌치-너트 정렬 성능 향상
PL-MPC는 정책 제약형 TD-M(PC)2 백본에서 비평가 지도, MPPI 종단 가치 평가, 플래너-정책 전이를 동시에 바꾼 방법이다. HumanoidBench에서는 balance-hard의 TAR(Total Average Return)가 98±18에서 387±255로, hurdle은 199±13에서 466±200으로 올랐고, KUKA IIWA14 실물 실험에서는 학습 물체 크기와 미학습 크기 모두에서 TD-M(PC)2보다 높은 성공률을 보였다. 아직 동료 심사를 거치지 않은 프리프린트다.