ROBOTNESS
중급arXiv

Text-to-3D Policy(T3DP), 토큰-행동 정렬로 보지 못한 세부 지시를 수행

Xinhao Yang, Wenhao Wu, Ning Lv, Yanshen Ding, Zhenhong Sun, Daoyi Dong, Chunlin Chen, Zhi Wang
30초 요약

T3DP는 언어 명령의 토큰과 행동 세그먼트를 지역적으로 정렬해 훈련에서 보지 못한 세부 사양을 수행하는 텍스트-3D 정책이다. Meta-World, ManiSkill, RoboTwin에서 전역 정렬 대비 평균 성공률을 11.0~14.2%포인트 높였고, 실물 PiperX 로봇에서는 평균 성공률을 47.5%에서 65.0%로 17.5%포인트 끌어올렸다. 이 논문은 아직 동료 심사를 거치지 않은 프리프린트이며, 같은 장면에서 목표 위치나 이동량이 다른 작업을 언어로 세밀하게 지시하는 데 중요하다.

연구 질문

언어로 주어지는 목표 위치, 이동 변위, 관절 상태 같은 미세한 행동 사양이 훈련 시연에 없을 때, 텍스트-3D 비주오모터 정책이 이를 따라할 수 있는가?

문제

같은 작업군 안에서 목표 위치, 이동 거리, 관절 상태 등이 다른 사양은 언어 의미가 비슷해 기존 표현으로 구분되지 않는다. 모든 사양을 시연으로 덮기 어렵고, 같은 관찰에서도 여러 행동이 가능해 장면만으로는 의도를 알 수 없다. 기존 언어 표현이나 전역 정렬은 가까운 사양을 구분하는 지역적 차이를 흐린다.

기존 접근

기존에는 사전학습 언어 표현을 그대로 정책 조건으로 쓰거나, CLIP식 전역 언어-행동 정렬로 전체 지시와 궤적을 하나의 임베딩으로 압축했다. 대표적으로 T2DA가 전역 정렬을 수행하지만, 작업 수준 의미는 잡아도 가까운 사양을 구분하는 세부 정보는 평균화로 사라질 수 있다.

새 접근

T3DP는 먼저 행동 인코더가 시연 궤적에서 보상 예측을 통해 사양 의존 행동 표현을 학습한다. 그 다음 언어 인코더를 전역 정렬과 함께 상태-행동 은닉 상태와 언어 토큰 간 양방향 지역 정렬로 미세 조정한다. 지역 정렬은 LME(late interaction) 점수로 세그먼트-토큰 대응을 부드럽게 매칭한다. 정렬된 언어 표현은 포인트클라우드 기반 3D diffusion policy의 조건으로 쓰이며, 정책 구조는 바꾸지 않는다.

결과

Meta-World에서 T3DP 평균 성공률은 50.3%로 전역 정렬 T2DA 36.1%보다 14.2%포인트 높았고, ManiSkill에서는 54.2%로 T2DA 40.7%보다 13.5%포인트 높았다. RoboTwin을 포함한 15개 작업군 모두에서 전역 정렬 대비 성공률이 높아졌다. 실물 PiperX 로봇에서는 두 작업군 각 20개 사양 평가에서 평균 성공률이 47.5%에서 65.0%로 올랐다. Meta-World 절제 실험에서 언어만 추가한 경우 19.1%, 전역 정렬만 한 경우 36.1%, 지역 정렬을 더한 T3DP는 50.3%를 기록했다. 훈련 사양 수가 40개일 때도 T3DP는 76.4%로 T2DA 69.2%보다 높았다.

한계

T3DP는 보상 신호가 있는 전문가 궤적을 필요로 하며, 평가는 알려진 작업군 안의 템플릿 지시에 국한됐다. 미지 작업군, 자유 형식 지시, 다양한 로봇으로의 일반화는 다루지 않았다. 실물 실험은 두 작업군과 단일 로봇에서 수행됐고, 코드 공개 여부는 논문에 보고되지 않았다.

업계 영향

물류 피킹, 조립, 서비스 로봇에서 같은 장면에서 목표 위치나 이동량이 다른 작업을 언어로 세밀하게 지시할 때 활용할 수 있다. 실물 PiperX에서 일부 검증됐지만, 자유 형식 지시와 미지 작업군으로 확장하려면 추가 데이터와 검증이 필요하다. 제한된 템플릿 지시 기반의 창고, 제조 셀은 1~3년 내 적용 가능성이 있고, 개방형 지시를 다루는 제품화는 3년 이후가 될 수 있다.

이 논문은 라이선스상 전문을 게재할 수 없어 요약과 원문 링크만 제공합니다.