도요타연구소, 사이언스 로보틱스서 '다중 작업 로봇 모델' 효과 입증… 새 작업 학습에 데이터 일부만 필요
도요타연구소(TRI)와 코넬대, MIT 연구진 82명이 2026년 4월 15일 사이언스 로보틱스에 발표한 논문에서, 확산 정책 기반의 다중 작업 '대규모 행동 모델(LBM)'이 블라인드 무작위 실험에서 단일 작업 모델보다 성공률과 강건성이 높고 새 작업을 훨씬 적은 데이터로 익힌다고 밝혔다. 사전 공개본에 따르면 약 1700시간, 500개 이상 작업의 로봇 시연 데이터를 썼고 통제된 실환경 시험을 1800회 수행했다.
도요타의 미국 연구조직 도요타연구소(TRI)가 로봇 파운데이션 모델에 쏠리는 투자의 핵심 전제를 동료 심사 논문으로 검증했다. 2026년 4월 15일 사이언스 로보틱스에 실린 논문에서 82명의 연구진은 TRI가 '대규모 행동 모델(LBM)'이라 부르는 다중 작업 로봇 조작 정책이 단일 작업 정책보다 성공률과 강건성이 높고, 복잡한 새 작업을 적은 데이터로 더 빨리 익혔다고 밝혔다.
논문 제목은 '다중 작업 정밀 조작을 위한 대규모 행동 모델의 면밀한 검토'로, 학술지 11권 113호에 실렸다. 저자는 매사추세츠주 케임브리지의 TRI, 코넬대, MIT 소속이며 제1저자는 J. 바레이로스(Barreiros), 마지막 저자는 러스 테드레이크(Russ Tedrake)다. 연구의 사전 공개본은 2025년 7월 7일 아카이브(arXiv)에 처음 올라왔다.
이 연구의 차별점은 모델이 아니라 방법론에 있다. 연구진은 잡음을 반복적으로 다듬어 로봇 행동을 생성하는 확산 정책(diffusion policy) 방식을 시뮬레이션 데이터와 실제 로봇 데이터 전반으로 확장했다. 이어 시뮬레이션과 실제 하드웨어 양쪽에서 통제된 조건 아래 블라인드 무작위 시험으로 단일 작업 기준 모델과 비교하고, 통계적 신뢰도를 갖춘 평가 체계를 구축했다고 초록에서 설명했다.
규모는 사전 공개본에 나와 있다. TRI는 자체 수집한 500개 이상 작업을 아우르는 약 1700시간의 로봇 시연 데이터와 공개 로봇 데이터로 여러 모델을 학습시켰고, 실제 환경에서 1800회 시험했다. 실환경 작업은 정책과 조건마다 50회, 시뮬레이션 작업은 200회씩 돌렸다. 작업은 단순 집어 옮기기부터 사과 속 파내기, 아침 식사 쟁반 차리기, 자전거 브레이크 로터 장착 같은 다단계 작업까지 다양했다.
하드웨어는 의도적으로 평범했다. 사전 공개본에 따르면 병렬 그리퍼를 단 프랑카 FR3 로봇팔 2대로 구성한 양팔 탁상 스테이션 9대를 썼고 정책은 10Hz로 작동했다. 시뮬레이션 평가는 TRI가 드레이크(Drake) 시뮬레이터 위에 구축한 벤치마크 lbm_eval로 진행했으며 주방을 본뜬 4개 시나리오를 사용했다.
사이언스 로보틱스 초록이 밝힌 핵심 결과는 세 가지다. 다중 작업 사전학습을 거친 뒤 미세조정한 정책이 단일 작업 정책보다 성공률과 강건성이 높았다. 복잡한 새 작업을 일부 데이터만으로 더 빨리 가르칠 수 있었다. 사전학습 데이터의 규모와 다양성이 커질수록 성능이 예측 가능하게 올랐다. 사전 공개본에서 연구진은 시뮬레이션 기준으로 미세조정 모델이 처음부터 학습한 모델과 비슷한 성능을 내는 데 필요한 데이터가 30% 미만이었고, 실제 '아침 식탁 차리기' 작업에서는 데이터 15%로 미세조정한 모델이 전체 데이터로 학습한 기준 모델을 이미 앞섰다고 밝혔다.
연구는 업계의 성과 보고 방식에도 경종을 울렸다. 연구진은 작업 난도를 성공률 50% 안팎이 되도록 조정했고, 부분 완수도를 채점하는 평가표를 만들었으며, 정책 간 차이가 실제인지 통계 검정으로 판별했다. 절대 성공률은 작업을 얼마나 어렵게 설계하느냐에 크게 좌우된다고 명시해, 기업 시연 영상 속 성공률 수치를 서로 비교하는 데 주의를 당부했다.
산업적 의미도 작지 않다. 피지컬 인텔리전스, 스킬드AI, 피규어AI, 구글 딥마인드, 엔비디아가 모두 범용 로봇 모델을 내세우고 있고 투자자들은 폭넓은 사전학습이 효과를 낸다는 가정 위에 기업가치를 매겼다. TRI의 결과는 그 가정을 통제된 증거로 뒷받침한다. 현대차그룹 계열 보스턴다이내믹스는 2025년 8월 아틀라스용 LBM 연구가 TRI와의 협력이라고 밝힌 바 있어, 이번 결과는 국내 완성차 그룹의 휴머노이드 전략과도 맞닿아 있다.
한계는 저자들이 직접 밝혔다. 사전 공개본은 신뢰구간이 학습 과정 자체의 무작위성을 반영하지 않으며, 실환경 잡음 때문에 작은 효과는 놓칠 수 있고, 최신 비전 언어 행동(VLA) 모델의 대형 백본이 아닌 CLIP 기반의 중간 규모 언어 인코더를 썼다고 적었다. 실환경 시험은 모두 병렬 그리퍼 로봇팔에서 이뤄졌고 다지 로봇손이나 휴머노이드는 포함되지 않았다.
- 저자 수
- 82
- 사이언스 로보틱스
- 로봇 시연 데이터(시간, 약)
- 1700
- arXiv 사전 공개본
- 자체 수집 작업 수(이상)
- 500
- arXiv 사전 공개본
- 실환경 평가 시험 횟수
- 1800
- arXiv 사전 공개본
- 작업, 정책, 조건별 실환경 시행 횟수
- 50
- arXiv 사전 공개본
- 작업, 정책, 조건별 시뮬레이션 시행 횟수
- 200
- arXiv 사전 공개본
- 로봇 스테이션 수
- 9
- arXiv 사전 공개본
- 정책 동작 주기(Hz)
- 10
- arXiv 사전 공개본
사이언스 로보틱스 기록(DOI 10.1126/scirobotics.aea6201)과 2025년 7월 arXiv 버전(2507.05331) 공개값. 게재본에서 사전 공개본 수치가 수정됐을 수 있다.
2026년 10월 1일 기준
- 스킬드AI
- 미국
- 시리즈C
- 1,400,000,000
- 14,000,000,000
- 2026-01-14
- 피규어AI
- 미국
- 시리즈C
- 1,000,000,000
- 39,000,000,000
- 2025-09-16
- 앱트로닉
- 미국
- 시리즈A 확장
- 520,000,000
- 자료 없음
- 2026-02-11
- 월든로보틱스
- 미국
- 시드
- 300,000,000
- 1,100,000,000
- 2026-07-15
- 피지컬 인텔리전스
- 미국
- 시리즈B
- 자료 없음
- 자료 없음
- 2025-11-20
각 사 또는 투자사 공개 기준. 미공개는 null. 도요타연구소는 도요타의 연구조직으로 별도 투자 라운드가 없다.
2026년 10월 1일 기준
ROBOTNESS 분석
TRI 논문은 다중 작업 사전학습이 로봇 조작에서 효과를 낸다는 현재까지 가장 엄밀한 공개 증거이며, 더 큰 기여는 영상 위주로 성과를 알리는 업계에 평가 기준을 제시한 데 있다.
근거는 설계에 있다. 블라인드 A/B 시험, 조건당 실환경 50회, 수백 회의 시뮬레이션, 통계적 분리 검정은 선별된 시연에 기대는 이 분야에서 드물다. 데이터 15%로 미세조정한 모델이 전체 데이터 기준 모델을 이겼다는 결과는 데이터 효율에 대한 직접적이고 측정 가능한 진술이다.
가장 강한 반론은 시험한 모델이 이미 한 세대 전 기술이라는 점이다. 병렬 그리퍼에서 CLIP 언어 인코더를 쓴 확산 정책은 피지컬 인텔리전스나 구글 딥마인드가 지금 내놓는 제품과 다르다. 추세는 확인했지만 현재 제품을 고르는 구매자에게 주는 정보는 제한적일 수 있다.
강세 시나리오. 엄밀한 평가가 경쟁력이 되고 고객이 통계적으로 타당한 인수 시험을 요구하기 시작하며, 드레이크 기반 TRI 도구가 기준으로 자리 잡는다. 데이터 효율 결과는 도요타를 포함한 제조 현장의 사전학습 모델 도입 논리를 강화한다.
약세 시나리오. 업계는 여전히 시연 영상으로 홍보하고, 조건당 50회 시험 비용은 스타트업에 너무 크며, 작업 다양성이 포화되면 확장 효과가 둔화한다. 논문의 확장 곡선만으로는 그 가능성을 아직 배제할 수 없다.
주목할 신호:
- TRI나 협력사가 같은 평가 절차를 VLA형 모델이나 휴머노이드에 적용한 후속 연구를 CoRL 2026 등에서 발표하는지.
- 2027년 중반 이전에 상용 로봇 모델 개발사가 통계를 공개한 블라인드 A/B 평가를 출시 자료에 도입하는지.
- 도요타그룹이 보스턴다이내믹스와의 협력 등을 통해 LBM을 연구 단계에서 공장 시범 적용으로 옮기는 발표를 하는지.
- 사이언스 로보틱스 11권 113호, eaea6201
- 2026년 4월 15일
- 82명, 도요타연구소, 코넬대, MIT
- 확산 정책 기반 대규모 행동 모델(LBM)
- 약 1700시간, 500개 이상 작업, 공개 데이터 포함
- 1800회, 작업별 정책 및 조건마다 50회
- 프랑카 FR3 양팔 스테이션 9대, 정책 10Hz
- 시뮬레이션에서 처음부터 학습 대비 30% 미만 데이터, 실제 작업 하나에서 15%로 기준 모델 추월
- arXiv 2507.05331, 2025년 7월 7일
왜 중요한가
로봇 파운데이션 모델에는 여러 작업으로 사전학습하면 로봇을 더 싸고 안정적으로 가르칠 수 있다는 전제 아래 막대한 자금이 몰렸다. 이 논문 전까지 그 전제를 지지하는 공개 근거는 대부분 기업 시연과 통제 비교 없는 벤치마크 표였다. TRI는 적어도 확산 기반 조작 정책에 대해서는 이 전제가 성립한다는 블라인드 무작위, 통계 분석 증거를 내놨다.
두 번째 의미는 평가의 표준이다. 논문은 작업과 조건마다 실환경 50회, 재현 가능한 초기 조건, 부분 완수 평가표 등 로봇 정책 성능을 제대로 재는 데 드는 비용을 보여줬다. 고객과 투자자가 기업에 근거를 요구할 때 인용할 수 있는 기준이 생긴 셈이다.
경쟁사 비교
피지컬 인텔리전스, 스킬드AI, 구글 딥마인드, 엔비디아, 피규어AI는 모두 범용 로봇 모델을 개발하며 대부분 자체 벤치마크나 영상으로 성과를 알린다. TRI 연구는 같은 하드웨어와 작업에서 단일 작업 기준 모델과 비교해 사전학습의 효과만 분리해냈다는 점에서 다르다.
가장 가까운 산업 연결고리는 보스턴다이내믹스다. 이 회사는 2025년 8월 아틀라스용 LBM 연구가 TRI와의 협력이라고 밝혔다. 논문 자체는 탁상형 로봇팔만 다뤘지만 현대차그룹 휴머노이드 프로그램과 이어지는 셈이다.
밸류에이션 맥락
TRI는 도요타의 연구조직이어서 별도 기업가치가 없다. 의미는 같은 확장 가설에 기업가치를 기대는 비상장사들에 있다. 각 사 발표 기준 스킬드AI는 2026년 1월 14억 달러를 유치하며 140억 달러, 피규어AI는 2025년 9월 10억 달러를 유치하며 390억 달러로 평가됐고, 앱트로닉은 2026년 2월 5억2000만 달러 시리즈A 확장을, 월든로보틱스는 2026년 7월 3억 달러 시드를 기업가치 11억 달러에 유치했다.
사전학습이 데이터 효율을 높인다는 엄밀한 확인은 원론적으로 이런 기업가치를 뒷받침한다. 동시에 투자자에게 제대로 된 증거가 무엇인지 보여주는 공개 사례가 생겨 검증 문턱도 높아졌다.
공급망 파급
사전 공개본에 따르면 연구는 프랑카 FR3 로봇팔, WSG50 그리퍼, 프라모스 D415e 장면 카메라, 플리어 블랙플라이 손목 카메라 등 상용 부품으로 진행됐다. 로봇 학습의 진짜 제약이 특수 하드웨어가 아니라 데이터와 평가 역량이라는 점을 보여준다.
공급 측면에서 중요한 것은 데이터다. 500개 이상 작업에 걸친 약 1700시간의 시연에는 원격조작 스테이션과 운영 인력, 장기간의 데이터 정제가 필요했다. 원격조작 서비스, 착용형 수집 장비, 시뮬레이션 등으로 이 물량을 더 싸게 만들 수 있는 기업이 전략적 위치를 차지한다. 국내 로봇 데이터 구축 사업도 이런 관점에서 설계될 필요가 있다.
지켜볼 신호
TRI가 같은 절차를 VLA 모델과 휴머노이드에 적용하는지 지켜볼 필요가 있다. 그래야 기업들이 현재 내놓는 구조에서도 결과가 유지되는지 확인된다. 보스턴다이내믹스가 아틀라스 성과를 비슷한 통계로 보고하는지도 관전 포인트다.
상업 측면에서는 로봇 도입 인수 시험이 시행 횟수와 통계 기준을 명시하기 시작하는지가 신호다. TRI 기준이 구매 절차로 확산되는지를 보여주기 때문이다.
애널리스트 시각
논지: 다중 작업 사전학습은 로봇 조작에서 측정 가능한 데이터 효율과 강건성 향상을 가져오며, TRI는 이를 통제된 방식으로 가장 잘 입증했다. 확신도: 좁은 주장에는 높음, 현행 VLA 제품으로의 확장에는 중간.
좁은 주장은 블라인드 시험, 큰 표본, 동료 심사에 기대고 있다. 확장이 불확실한 이유는 시험 모델이 작은 CLIP 언어 인코더, 병렬 그리퍼, 탁상 작업을 썼던 반면 상용 시스템은 대형 비전 언어 백본, 다지 손, 이동형 몸체를 쓰고 있기 때문이다.
따져봐야 할 질문
대형 언어 백본을 쓴 VLA 모델에서도 같은 데이터 효율 향상이 나타날까, 아니면 모델이 기본적으로 유능해질수록 줄어들까. 작업 다양성이 TRI 데이터의 500여 개를 넘어설 때 확장 효과는 얼마나 빨리 둔화할까.
도요타는 LBM을 공장에 도입하고 같은 엄밀성으로 결과를 공개할까. 스타트업이 이 수준의 평가 비용을 감당할 수 있을까, 아니면 엄밀한 시험은 자금력 있는 연구소의 전유물로 남을까.
