Text-to-3D Policy(T3DP), 토큰-행동 정렬로 보지 못한 세부 지시를 수행
T3DP는 언어 명령의 토큰과 행동 세그먼트를 지역적으로 정렬해 훈련에서 보지 못한 세부 사양을 수행하는 텍스트-3D 정책이다. Meta-World, ManiSkill, RoboTwin에서 전역 정렬 대비 평균 성공률을 11.0~14.2%포인트 높였고, 실물 PiperX 로봇에서는 평균 성공률을 47.5%에서 65.0%로 17.5%포인트 끌어올렸다. 이 논문은 아직 동료 심사를 거치지 않은 프리프린트이며, 같은 장면에서 목표 위치나 이동량이 다른 작업을 언어로 세밀하게 지시하는 데 중요하다.
언어로 주어지는 목표 위치, 이동 변위, 관절 상태 같은 미세한 행동 사양이 훈련 시연에 없을 때, 텍스트-3D 비주오모터 정책이 이를 따라할 수 있는가?
같은 작업군 안에서 목표 위치, 이동 거리, 관절 상태 등이 다른 사양은 언어 의미가 비슷해 기존 표현으로 구분되지 않는다. 모든 사양을 시연으로 덮기 어렵고, 같은 관찰에서도 여러 행동이 가능해 장면만으로는 의도를 알 수 없다. 기존 언어 표현이나 전역 정렬은 가까운 사양을 구분하는 지역적 차이를 흐린다.
기존에는 사전학습 언어 표현을 그대로 정책 조건으로 쓰거나, CLIP식 전역 언어-행동 정렬로 전체 지시와 궤적을 하나의 임베딩으로 압축했다. 대표적으로 T2DA가 전역 정렬을 수행하지만, 작업 수준 의미는 잡아도 가까운 사양을 구분하는 세부 정보는 평균화로 사라질 수 있다.
T3DP는 먼저 행동 인코더가 시연 궤적에서 보상 예측을 통해 사양 의존 행동 표현을 학습한다. 그 다음 언어 인코더를 전역 정렬과 함께 상태-행동 은닉 상태와 언어 토큰 간 양방향 지역 정렬로 미세 조정한다. 지역 정렬은 LME(late interaction) 점수로 세그먼트-토큰 대응을 부드럽게 매칭한다. 정렬된 언어 표현은 포인트클라우드 기반 3D diffusion policy의 조건으로 쓰이며, 정책 구조는 바꾸지 않는다.
Meta-World에서 T3DP 평균 성공률은 50.3%로 전역 정렬 T2DA 36.1%보다 14.2%포인트 높았고, ManiSkill에서는 54.2%로 T2DA 40.7%보다 13.5%포인트 높았다. RoboTwin을 포함한 15개 작업군 모두에서 전역 정렬 대비 성공률이 높아졌다. 실물 PiperX 로봇에서는 두 작업군 각 20개 사양 평가에서 평균 성공률이 47.5%에서 65.0%로 올랐다. Meta-World 절제 실험에서 언어만 추가한 경우 19.1%, 전역 정렬만 한 경우 36.1%, 지역 정렬을 더한 T3DP는 50.3%를 기록했다. 훈련 사양 수가 40개일 때도 T3DP는 76.4%로 T2DA 69.2%보다 높았다.
T3DP는 보상 신호가 있는 전문가 궤적을 필요로 하며, 평가는 알려진 작업군 안의 템플릿 지시에 국한됐다. 미지 작업군, 자유 형식 지시, 다양한 로봇으로의 일반화는 다루지 않았다. 실물 실험은 두 작업군과 단일 로봇에서 수행됐고, 코드 공개 여부는 논문에 보고되지 않았다.
물류 피킹, 조립, 서비스 로봇에서 같은 장면에서 목표 위치나 이동량이 다른 작업을 언어로 세밀하게 지시할 때 활용할 수 있다. 실물 PiperX에서 일부 검증됐지만, 자유 형식 지시와 미지 작업군으로 확장하려면 추가 데이터와 검증이 필요하다. 제한된 템플릿 지시 기반의 창고, 제조 셀은 1~3년 내 적용 가능성이 있고, 개방형 지시를 다루는 제품화는 3년 이후가 될 수 있다.
이 논문은 라이선스상 전문을 게재할 수 없어 요약과 원문 링크만 제공합니다.