ROBOTNESS
연구

논문

새로 나온 로봇, 피지컬 AI 논문과, 각 논문이 업계에 갖는 의미.

논문 8편
아직 한국어판이 없어 영어 원문으로 표시.
arXiv
Co-speech Humanoid중급

ECHO-G: 오디오와 시간 대본으로 휴머노이드 전신 코스피치 동작을 생성하는 프레임워크

Yizhao Li, Pusen Gao, Ming Wang, Shaojie Shen, Shuo Yang, Hao Xu

이 논문은 음성 오디오와 시간 정렬된 대본을 함께 조건으로 사용해 휴머노이드 로봇의 전신 코스피치 동작을 생성하는 ECHO-G를 제안한다. BEAT2 기반 로봇 데이터셋에서 기존 인간 동작 생성 후 리타게팅 파이프라인보다 코스피치 지표와 처리 시간이 우수했고, Unitree G1 실물 로봇 배포를 시연했다. 프리프린트다.

arXiv
UAV traffic monitoring중급

드론 교통 혼잡 제어에서 예측이 감지보다 효과적

Samira Hayat, Christian Raffelsberger

드론 편대가 교차로를 순찰하며 정체를 감지하고 예측해 교통 신호를 적응 제어하는 시뮬레이션을 수행했다. 드론 수가 교차로 수에 가까워지면 감지율과 예측율이 정체됐고, 예측 기반 신호 조정은 감지 기반보다 정체 지속 시간 감소 효과가 약 2배 컸다. 이 논문은 arXiv 프리프린트다.

arXiv
Memory-centric VLA중급

Optimus-R, 쿼리-스킬 메모리 뱅크로 VLA 적응 비용과 망각을 낮추다

Zaijing Li, Rui Shao, Bing Hu, Haoyu Zhang, Dongmei Jiang, Liqiang Nie

하얼빈공업대학(선전)과 Pengcheng Laboratory 연구팀이 공개한 프리프린트에서 VLA 모델의 새 작업 적응을 메모리 중심으로 바꾼 Optimus-R을 제안했다. Optimus-R은 학습 가능한 메모리 토큰을 VLA prefix 스트림에 삽입해 제어 관련 쿼리와 스킬 표현을 추출하고, 이를 쿼리-스킬 메모리 뱅크에 저장해 재사용한다. 실험에서 30% 학습 데이터만으로 LIBERO 평균 성공률을 16.5%p, CALVIN 평균 완료 길이를 0.42, RoboTwin 2.0 Hard 성공률을 5.0%p 높였고, 실물 로봇 20개 데모 크로스도메인 적응에서 33.3% 성공률로 π0.5 대비 13.9%p 우위를 보였다.

arXiv
VLA중급

ChunkTrust: 행동 전문가 신호로 로봇 정책의 실행 구간을 조절하는 방법

Fanding Huang, Jingyan Jiang, Shifeng Bao, Mingkang Pu, Shiwei Li, Jing Xu, Shijia Xu, Guanbo Huang, Chenghao Gu, Yuzhi Huang, Chenxin Li, Faisal Nadeem Khan, Huan Yang, Yan Wang, Cheng Chi, Zhi WangTsinghua University, Beijing Academy of Artificial Intelligence (BAAI), Renmin University of China, Shenzhen Technology University, Hefei University of Technology, Jiangnan University, Chongqing University, The Chinese University of Hong Kong

로봇 AI 모델은 앞으로의 동작을 한 묶음씩 예측하는데, 그중 몇 개를 실행한 뒤 다시 주변을 살필지는 대개 사람이 고정값으로 정해 왔다. 칭화대와 베이징즈위안인공지능연구원(BAAI) 등이 낸 이번 프리프린트는 이 값을 작업 중에 스스로 고르는 부가 모듈을 제안했고, 피지컬인텔리전스와 엔비디아의 기존 모델을 다시 학습시키지 않고도 시뮬레이션과 실제 양팔 로봇에서 성공률을 끌어올렸다.

arXiv
Text-to-3D Policy중급

Text-to-3D Policy(T3DP), 토큰-행동 정렬로 보지 못한 세부 지시를 수행

Xinhao Yang, Wenhao Wu, Ning Lv, Yanshen Ding, Zhenhong Sun, Daoyi Dong, Chunlin Chen, Zhi Wang

T3DP는 언어 명령의 토큰과 행동 세그먼트를 지역적으로 정렬해 훈련에서 보지 못한 세부 사양을 수행하는 텍스트-3D 정책이다. Meta-World, ManiSkill, RoboTwin에서 전역 정렬 대비 평균 성공률을 11.0~14.2%포인트 높였고, 실물 PiperX 로봇에서는 평균 성공률을 47.5%에서 65.0%로 17.5%포인트 끌어올렸다. 이 논문은 아직 동료 심사를 거치지 않은 프리프린트이며, 같은 장면에서 목표 위치나 이동량이 다른 작업을 언어로 세밀하게 지시하는 데 중요하다.

arXiv
Manipulation중급

RoboCoach, 세계 모델로 상상한 실패를 다음 로봇 기술 학습 신호로 바꾼다

Jiajun Liu, Yifan Chen, Yichao Liu, Jiayi Zhang, Ruoqu Chen, Shaoxuan Xie, Guocai Yao, Mengdi Xu, Sen Cui, Changshui Zhang

프리프린트로 공개된 RoboCoach는 행동 조건 세계 모델 CoachWorld에서 로봇 실행을 굴려 실패한 하위 작업을 찾고, 해당 기술 전문가에만 추가 데모를 요청해 LoRA 어댑터를 갱신하는 프레임워크다. 22개 작업-정책 쌍에서 상상 실행과 실제 실행 성공률 간 스피어만 상관이 0.840이었고, 실물 로봇에서 플랫폼당 150개 하위 작업 데모만 추가해 Franka는 13.3%에서 75.0%로, AgileX는 40.0%에서 83.8%로 성공률이 올랐다. 이는 세계 모델이 데이터를 더 만드는 것을 넘어 어떤 기술을 가르칠지 결정하는 능동 코치가 될 수 있음을 보여준다.

논문은 arXiv 로봇 피드에서 가져옵니다. 요약이 아직 작성되지 않은 논문은 초록의 첫 부분을 보여줍니다.