ROBOTNESS
산업6분 분량ROBOTNESS 데스크미국

VLA(비전-언어-행동) 모델이란 무엇이고 누가 만드나

VLA(비전-언어-행동) 모델은 카메라 영상과 자연어 지시를 함께 읽어 로봇의 다음 동작 명령을 내놓는 단일 신경망으로, 이미지와 글을 이해하는 비전-언어 모델에 로봇 시연 데이터를 추가 학습시켜 만든다. 구글 딥마인드와 피지컬 인텔리전스, 엔비디아, 피규어 AI, 스킬드 AI가 앞서 있고 한국은 LG와 KIST를 중심으로 추격에 나섰으며, 승부는 모델 구조보다 행동 데이터를 얼마나 싸게 모으느냐로 옮겨가고 있다.

VLA(비전-언어-행동) 모델이란 무엇이고 누가 만드나 (ROBOTNESS 일러스트)
요약

VLA(Vision-Language-Action, 비전-언어-행동) 모델은 카메라 영상과 "컵을 싱크대에 넣어" 같은 자연어 지시를 한꺼번에 입력받아 로봇이 다음에 실행할 모터 명령을 출력하는 하나의 신경망이다. 사진을 설명할 줄 아는 비전-언어 모델(VLM)을 출발점으로 삼아 로봇 시연 데이터로 추가 학습시키면, 출력이 글자 대신 관절 각도와 그리퍼 개폐 같은 움직임으로 바뀐다.

이 용어는 2023년 7월 구글 딥마인드가 arXiv 프리프린트로 공개한 RT-2에서 본격적으로 쓰이기 시작했다. 논문에 따르면 웹 이미지와 로봇 데이터를 함께 학습한 RT-2는 처음 보는 물체와 환경에서 성공률이 약 62%로, 이전 모델 RT-1의 32%의 두 배 수준이었다. 3년이 지난 지금 이 분야는 구글 딥마인드, 피지컬 인텔리전스, 엔비디아, 피규어 AI, 스킬드 AI, 중국 즈위안(AgiBot)이 이끌고 있고, 한국 정부는 올해 5월 KIST와 LG 계열사가 참여하는 504억 원 규모 휴머노이드 모델 사업을 시작했다. 이 글은 VLA의 작동 원리와 기존 로봇 프로그래밍, 월드 모델과의 차이, 주요 개발사, 그리고 한국 제조업에 왜 데이터가 관건인지를 차례로 짚는다.

픽셀과 문장이 모터 명령이 되는 과정

대부분의 VLA는 세 부분으로 이뤄진다. 비전 인코더가 카메라 프레임을 시각 토큰으로 바꾸고, 사전학습된 언어 백본이 이 토큰과 지시문, 로봇 관절 상태를 함께 읽는다. 마지막으로 액션 헤드가 백본의 내부 표현을 관절, 그리퍼, 바퀴를 움직일 숫자로 변환한다. 엔비디아가 공개한 GR00T N1 모델 카드는 이 구조를 그대로 보여준다. 224×224 화소 영상을 읽는 SigLIP 2 비전 트랜스포머, T5 텍스트 인코더, 로봇 몸체마다 바뀌는 상태 처리망, 그리고 동작을 생성하는 디퓨전 트랜스포머로 구성됐다고 엔비디아는 설명했다.

VLM에서 출발하는 이유는 지식 전이다. 방대한 웹 이미지로 학습한 백본은 이미 가정과 공장의 물건 대부분을 알아보기 때문에, 로봇 학습 때 한 번도 보지 못한 물체도 다룰 수 있다. RT-2 연구진은 로봇이 탁자 위에서 가장 작은 물건을 고르거나 웹에서만 본 숫자 위로 캔을 옮기는 등 새로 생긴 능력 평가에서 60%의 성공률을 기록해 RT-1의 17%를 크게 앞섰다고 밝혔다. 남는 문제는 신경망이 움직임을 어떤 형식으로 표현하느냐다.

토큰이냐 흐름이냐, 동작을 내보내는 두 방식

초기 VLA는 움직임을 단어처럼 다뤘다. 논문에 따르면 RT-2는 그리퍼의 위치와 회전 6개, 그리퍼 개폐 1개, 작업 종료 1개 등 8개 동작 차원을 각각 256개 구간으로 나눠, 동작 하나를 언어 모델이 글자처럼 출력하는 짧은 토큰 열로 만들었다. 2024년 6월 스탠퍼드 주도 연구진이 가중치를 공개한 70억 파라미터 OpenVLA도 같은 방식을 썼고, 29개 작업에서 구글의 550억 파라미터 RT-2-X보다 성공률이 16.5%포인트 높았다고 보고했다.

토큰 방식은 정밀 작업에는 느리고 거칠다. 가장 큰 RT-2는 초당 1~3회(1~3Hz) 제어에 그쳤다. 피지컬 인텔리전스가 2024년 10월 31일 프리프린트로 공개한 π0는 30억 파라미터 PaliGemma 백본에 3억 파라미터 규모의 별도 '액션 전문가'를 붙이고, 이미지 생성 AI의 디퓨전 기법과 같은 계열인 플로 매칭으로 학습시켰다. 무작위 잡음에서 출발해 10단계에 걸쳐 앞으로 50스텝 분량의 동작 묶음을 다듬어 내는 방식으로, 최대 50Hz 제어가 가능하다고 회사는 설명했다.

세 번째 설계는 생각과 반사신경을 나눈다. 피규어 AI가 2025년 2월 20일 발표한 Helix는 7~9Hz로 도는 70억 파라미터 VLM과 200Hz로 도는 8000만 파라미터 정책을 짝지어, 로봇에 탑재한 GPU 2개로 35자유도를 제어한다고 회사는 밝혔다. 엔비디아는 이를 시스템2와 시스템1이라 부르고, 즈위안이 2026년 9월 8일 공개한 GO-2도 느린 의미 계획 모듈과 빠른 동작 추종 모듈을 비동기로 묶었다. 이런 계층 구조가 VLA를 기존 공장 로봇 소프트웨어와 가르는 지점이다.

티칭 프로그래밍과도, 월드 모델과도 다르다

전통적인 산업용 로봇은 점 단위로 프로그래밍한다. SI 업체가 티칭 펜던트로 경유점을 입력하거나 오프라인으로 경로를 짜면, 부품 위치가 바뀌거나 라인을 개조할 때까지 같은 동작을 반복한다. VLA는 이 스크립트를 매 순간 장면을 읽는 학습된 정책으로 대체해 어수선한 작업대나 새 물체에 대응하지만, 인증이 쉬운 엄격한 반복 정밀도는 그만큼 포기한다. 일본 야스카와전기는 2026년 7월 MOTOMAN NEXT에 구글 딥마인드의 Gemini Robotics ER 1.6을 얹어 세부 티칭 없이 상위 지시만으로 작업을 계획하되, 비전과 경로 계획, 힘 센싱은 기존 로봇 기능이 맡는 구조를 택했다고 밝혔다.

월드 모델은 다른 질문에 답한다. 로봇이 어떤 행동을 하면 장면이 어떻게 바뀔지를 주로 영상으로 예측하고, 합성 학습 데이터를 만들거나 실제 장비에 올리기 전 정책을 시험하는 데 쓰인다. 런웨이는 9월 30일 자사 월드 모델 안에서의 정책 결과와 실제 결과의 상관계수가 0.95라고 밝혔다. 다만 경계는 흐려지고 있다. 런웨이는 신모델 Praxis-1을 로봇 제어를 직접 출력하는 '월드 액션 모델'이라 부르고, 제너럴리스트 AI는 로봇 데이터 없이 착용형 기기로 모은 50만 시간 이상의 사람 동작 데이터로 GEN-1을 사전학습했다고 밝혔다.

누가 만들고, 누가 공개하나

구글 딥마인드는 2025년 3월 12일 Gemini 2.0 기반 Gemini Robotics를 공개하며 앱트로닉을 휴머노이드 파트너로 내세웠고, 2026년 7월 30일에는 휴머노이드 전신 제어용 Gemini Robotics 2를 내놨다. 동작 모델은 여전히 파트너와 신뢰 테스터에게만 제공된다. 피지컬 인텔리전스는 반대 길을 택해 openpi 저장소에 π0, π0-FAST, 2025년 9월부터는 π0.5를 Apache 2.0 라이선스로 올렸다. 엔비디아는 2025년 3월 18일 GR00T N1을 비상업 라이선스로 공개했고, 30억 파라미터 GR00T N1.7은 엔비디아 오픈 모델 라이선스로 허깅페이스 LeRobot에 들어갔다. 피규어는 Helix를 자사 로봇에만 쓰고, 스킬드 AI는 Skild Brain과 S1을 현장 배치 형태로 판다.

주요 VLA 모델 비교
  • RT-2
    개발사
    구글 딥마인드
    최초 공개
    2023-07-28
    파라미터(십억)
    55
    가중치 공개
    비공개(파트너 한정)
  • OpenVLA
    개발사
    스탠퍼드 주도 연구진
    최초 공개
    2024-06-13
    파라미터(십억)
    7
    가중치 공개
    공개
  • π0
    개발사
    피지컬 인텔리전스
    최초 공개
    2024-10-31
    파라미터(십억)
    3.3
    가중치 공개
    공개
  • Helix
    개발사
    피규어 AI
    최초 공개
    2025-02-20
    파라미터(십억)
    7.08
    가중치 공개
    자료 없음
  • Gemini Robotics
    개발사
    구글 딥마인드
    최초 공개
    2025-03-12
    파라미터(십억)
    자료 없음
    가중치 공개
    비공개(파트너 한정)
  • GR00T N1
    개발사
    엔비디아
    최초 공개
    2025-03-18
    파라미터(십억)
    2
    가중치 공개
    공개(비상업)
  • π0.5
    개발사
    피지컬 인텔리전스
    최초 공개
    2025-04-22
    파라미터(십억)
    자료 없음
    가중치 공개
    공개
  • Skild Brain
    개발사
    스킬드 AI
    최초 공개
    2025-07-29
    파라미터(십억)
    자료 없음
    가중치 공개
    자료 없음
  • Gemini Robotics 2
    개발사
    구글 딥마인드
    최초 공개
    2026-07-30
    파라미터(십억)
    자료 없음
    가중치 공개
    비공개(파트너 한정)
  • S1
    개발사
    스킬드 AI
    최초 공개
    2026-08-18
    파라미터(십억)
    자료 없음
    가중치 공개
    자료 없음
  • GO-2
    개발사
    즈위안(AgiBot)
    최초 공개
    2026-09-08
    파라미터(십억)
    자료 없음
    가중치 공개
    자료 없음

최초 공개는 첫 논문, 모델 카드, 회사 발표 기준. Helix는 시스템2 70억 개와 시스템1 8000만 개의 합. π0.5 가중치는 2025년 9월 openpi로 공개. null은 미공개. 추정치 없이 공개 수치만 사용.

2026년 10월 1일 기준

공개 여부는 사업 전략이다. openpi 기준으로 LoRA 미세조정에는 22.5GB 이상의 GPU 메모리면 충분해 RTX 4090 한 장으로도 가능하다. 대학과 중소 로봇 업체에는 문턱이 낮아진 셈이다. 폐쇄형은 데이터 선순환과 고객 관계를 모델 소유자가 쥔다. 두 진영이 진짜로 갈라지는 곳은 데이터 비용이다.

비용의 핵심은 구조가 아니라 데이터

챗봇과 달리 VLA는 학습 데이터를 웹에서 긁어올 수 없다. 로봇 시연 데이터는 대부분 사람이 로봇을 원격조종하며 모은다. 피규어는 Helix 학습에 약 500시간의 원격조종 데이터를 썼고, 피지컬 인텔리전스는 π0에 7종 로봇 구성과 68개 작업에 걸친 1만 시간 이상을 투입했다. 스킬드 AI는 8월 4분이 넘는 작업 하나의 시연 380회를 모으는 데 원격조종 50~100시간이 든다며, 자사 S1은 영상 한 편으로 비슷한 효과를 낸다고 주장했다.

엔비디아는 11시간 만에 합성 궤적 78만 개를 생성했고 이는 사람 시연 약 6500시간에 해당하며, 실제 데이터와 섞어 GR00T N1 성능을 40% 끌어올렸다고 밝혔다. 한국에서는 LG가 8월 엔비디아와 협력 MOU를 맺으면서 양재 캠퍼스 1만㎡ 데이터 팩토리에서 연말까지 10만 시간의 데이터를 확보하겠다고 밝혔다. 정부도 6월 발표한 AI 로봇 3M 전략에서 10개 업종 데이터 팩토리를 과제로 넣었다.

모델별 공개 학습 데이터 규모
  • Helix
    개발사
    피규어 AI
    데이터 종류
    원격조종 시연
    시간(공개)
    500
  • π0
    개발사
    피지컬 인텔리전스
    데이터 종류
    로봇 시연 데이터
    시간(공개)
    10,000
  • π0.5
    개발사
    피지컬 인텔리전스
    데이터 종류
    모바일 조작(혼합 데이터 일부)
    시간(공개)
    400
  • GR00T N1
    개발사
    엔비디아
    데이터 종류
    합성 궤적(시간 환산)
    시간(공개)
    6,500
  • LBM
    개발사
    도요타 연구소(TRI)
    데이터 종류
    로봇 시연 데이터
    시간(공개)
    1,700
  • GEN-1
    개발사
    제너럴리스트 AI
    데이터 종류
    사람 착용형 기기 기록, 로봇 데이터 없음
    시간(공개)
    500,000

회사 발표와 논문 기준(TRI는 arXiv 프리프린트 2507.05331). Helix와 π0.5는 약, π0와 GEN-1은 이상. GR00T N1은 78만 개 궤적을 11시간에 생성했고 엔비디아는 이를 시연 약 6500시간으로 환산. 생성 1시간당 시연 약 590시간(6500 / 11).

2026년 10월 1일 기준

한국 업체의 모델 전략도 구체화하고 있다. 과기정통부의 K-문샷 사업은 KIST의 KAPEX 휴머노이드를 바탕으로 시각, 촉각, 언어, 행동을 합친 VHLA 모델을 2030년까지 개발하고, LG전자와 LG AI연구원, LG에너지솔루션이 참여한다. LG는 2027년 1분기 엔비디아 Jetson Thor와 Isaac GR00T 기반 이족보행 휴머노이드를 공개할 계획이고, 두산로보틱스는 2027년 에이전틱 로봇 OS 솔루션과 2028년 산업용 휴머노이드를 내놓겠다고 밝혔다.

한국의 VLA 관련 주요 사업과 투자
  • K-문샷 AI 휴머노이드
    주체
    과기정통부, KIST, LG 3사
    규모(억 원)
    504
    시기
    2026~2030
    내용
    VHLA 모델, 전고체 배터리, 20대 실증
  • 휴머노이드 핵심부품 예산
    주체
    기획재정부, 산업부
    규모(억 원)
    620
    시기
    2027 예산안
    내용
    센서, 액추에이터, 배터리
  • M.AX 펀드
    주체
    산업부 M.AX 얼라이언스
    규모(억 원)
    5000
    시기
    목표
    내용
    휴머노이드 의무 투자 비중
  • LG 데이터 팩토리
    주체
    LG
    규모(억 원)
    자료 없음
    시기
    2026년 말
    내용
    1만㎡, 데이터 10만 시간 목표
  • 원익로보틱스 전환우선주
    주체
    국민성장펀드 등
    규모(억 원)
    3500
    시기
    2026-08-28
    내용
    로봇 손, 성장펀드 1500억 원

정부 보도자료와 회사 발표, DART 공시 기준. 금액은 공개 수치이며 M.AX 펀드는 목표액. LG 데이터 팩토리 투자액은 미공개(null).

2026년 10월 1일 기준

돈은 어디로 갔나

스킬드 AI는 2026년 1월 140억 달러 이상의 기업가치로 14억 달러를 유치했고, 피규어 AI는 2025년 9월 투자 후 가치 390억 달러에 10억 달러를, 제너럴리스트 AI는 2026년 6월 4억 달러를 조달했다고 각각 밝혔다. 이 가운데 매출을 공개한 곳은 스킬드뿐으로, 9월 10일 연간 반복매출(ARR) 1억 달러와 유료 고객 60곳 이상을 확보했다고 발표했다.

로봇 모델 개발사의 최근 공개 투자 라운드
  • 스킬드 AI
    라운드
    시리즈C
    금액(백만 달러)
    1400
    투자 후 가치(십억 달러)
    14
    날짜
    2026-01-14
  • 피규어 AI
    라운드
    시리즈C
    금액(백만 달러)
    1000
    투자 후 가치(십억 달러)
    39
    날짜
    2025-09-16
  • 제너럴리스트 AI
    라운드
    그로스
    금액(백만 달러)
    400
    투자 후 가치(십억 달러)
    자료 없음
    날짜
    2026-06-04
  • 제너럴 인튜이션
    라운드
    벤처 라운드
    금액(백만 달러)
    220
    투자 후 가치(십억 달러)
    자료 없음
    날짜
    2026-09-29
  • 다이나 로보틱스
    라운드
    시리즈A
    금액(백만 달러)
    120
    투자 후 가치(십억 달러)
    자료 없음
    날짜
    2025-09-15
  • 제네시스 AI
    라운드
    설립 라운드
    금액(백만 달러)
    105
    투자 후 가치(십억 달러)
    자료 없음
    날짜
    2025-06-30
  • 피지컬 인텔리전스
    라운드
    시리즈B
    금액(백만 달러)
    자료 없음
    투자 후 가치(십억 달러)
    자료 없음
    날짜
    2025-11-20

ROBOTNESS DB의 최신 라운드, 회사와 투자사 발표 기준. 스킬드 AI 기업가치는 140억 달러 이상으로 공시. 스킬드 가치 상승 배수 = 140억 달러 / 2024년 7월 시리즈A 투자 후 가치 15억 달러 = 9.3배. null은 미공개.

2026년 10월 1일 기준

ROBOTNESS 분석

VLA 모델 자체는 공용 계층으로 수렴하고 있으며, 지속적인 가치는 현장에서 쓸모 있는 행동 데이터를 가장 싸게, 계속 만들어 내는 쪽에 쌓인다.

근거는 표에 있다. 백본은 소수의 공개 VLM으로 수렴하고 있고, 20억~70억 파라미터급 공개 VLA는 무료로 내려받을 수 있다. 반면 학습 데이터는 Helix의 원격조종 약 500시간에서 GEN-1의 사람 기록 50만 시간 이상까지 1000배 차이가 난다. 스킬드의 기업가치 140억 달러 이상은 공개 ARR의 약 140배(140억 달러 / 1억 달러)이며, 2024년 7월 시리즈A 당시 15억 달러에서 18개월 만에 9.3배가 됐다. 한국 입장에서 이 구도는 기회다. 조선소와 정유, 가전 라인처럼 데이터가 나오는 현장을 한국 기업이 쥐고 있기 때문이다.

가장 강한 반론은 신뢰성이 여전히 모델 설계의 문제라는 점이다. 구글 딥마인드 자체 집계로 Gemini Robotics 2는 앱트로닉 Apollo 2에서 탁자 위 집기 성공률 68.4%, 바닥 집기 45.7%에 그쳤다. 구조 혁신으로 이 격차를 먼저 메우는 연구소가 데이터 보유량과 무관하게 이길 수 있고, 런웨이나 제너럴리스트의 월드 액션 모델이 지금의 VLA 설계를 과도기로 만들 수도 있다.

강세 시나리오. 합성 데이터와 착용형 기록, 인컨텍스트 학습으로 데이터 비용이 계속 내려가고, 공개 모델이 국내 SI와 중소 제조사로 퍼지며, 현장 로봇을 많이 굴리는 기업이 데이터 우위를 복리로 키운다. LG와 현대차그룹 같은 대기업이 자사 공장을 데이터 공장으로 바꾸면 한국은 휴머노이드 생산 점유율 1%(2025년, 정부 자료)라는 약점을 데이터로 만회할 수 있다.

약세 시나리오. 비정형 작업 성공률이 60~80%대에서 정체하고, 수요처는 기존 티칭 셀과 좁은 AI 조합에 머문다. 100억 달러가 넘는 기업가치가 사업이 아니라 연구 우위에 매겨졌던 것으로 드러나면 국내 정부 과제도 성과 압박을 받는다.

처음 보는 고객 현장에서 고객 데이터 없이 90% 이상 성공률을 보이는 폐쇄형 모델이 나오면 이 판단을 바꾸겠다. 시점이 정해진 신호 세 가지를 지켜본다.

  • LG의 엔비디아 Isaac GR00T 기반 이족보행 휴머노이드 공개, 2027년 1분기 예정.
  • 휴머노이드 센서와 액추에이터, 배터리 예산 620억 원이 담긴 2027년 정부 예산안의 국회 처리, 법정 시한 2026년 12월 2일.
  • 피규어와 엔스케일의 Helix 학습용 Vera Rubin GPU 첫 가동, 2027년 하반기 예정.
핵심 사실
정의
카메라 영상과 자연어 지시를 받아 로봇 모터 명령을 내는 단일 신경망
용어 등장
구글 딥마인드 RT-2, 2023년 7월 28일 arXiv 프리프린트
토큰 방식
RT-2, 동작 8개 차원을 각 256구간으로 분할
플로 방식
π0, 30억 PaliGemma와 3억 액션 전문가, 최대 50Hz
이중 시스템
Helix, 70억 모델 7~9Hz와 8000만 정책 200Hz
공개 모델
OpenVLA(70억), π0와 π0.5(openpi), GR00T N1과 N1.7
원격조종 데이터
Helix 약 500시간, π0 1만 시간 이상
한국 국책 과제
K-문샷 AI 휴머노이드 504억 원, 2026~2030년, KIST와 LG 3사
LG 데이터 목표
양재 데이터 팩토리 10만 시간, 2026년 말
최대 투자
스킬드 AI 시리즈C 14억 달러, 기업가치 140억 달러 이상
출처
ROBOTNESS 인텔리전스
  1. 01

    왜 중요한가

    VLA는 범용 로봇이 소프트웨어 사업이 될지, 현장마다 따로 짜는 SI 사업에 머물지를 가르는 기술이다. 구글 딥마인드 주장대로 새 로봇 적응에 몇 시간과 200개 미만의 예시면 충분하다면, 새 현장 하나를 여는 비용은 엔지니어링 프로젝트에서 며칠짜리 데이터 수집 작업으로 줄어든다. 가치의 무게중심도 SI와 티칭 인력에서 모델 소유자와 현장 데이터를 쥔 쪽으로 이동한다.

    한국에 이 문제가 특히 중요한 이유는 구조 때문이다. 정부 자료로 2025년 한국의 휴머노이드 생산 점유율은 1%로 중국 86%, 미국 4%에 크게 뒤진다. 완제품 물량으로 따라잡기 어렵다면 조선, 정유, 가전, 자동차 공장에서 나오는 작업 데이터와 부품 경쟁력으로 모델 생태계에 자리를 잡는 것이 현실적인 경로다.

  2. 02

    경쟁사 비교

    구글 딥마인드는 가장 강한 백본과 추론 모델을 갖췄지만 로봇을 직접 만들지 않아 현장 데이터는 앱트로닉, 보스턴 다이내믹스 같은 파트너에 의존한다. 엔비디아는 GR00T를 무료로 풀어 Jetson Thor와 시뮬레이션 수요를 키우는 전략이며, LG와 두산로보틱스 모두 엔비디아 스택에 기대고 있다. 피지컬 인텔리전스는 openpi로 연구자 생태계를 장악했고, 스킬드 AI는 ARR 1억 달러로 상용화에서 앞섰다.

    국내 진영은 아직 독자 모델보다 통합에 무게가 실려 있다. KIST 중심 VHLA 모델은 촉각을 더했다는 점이 차별점이지만 2030년이 목표 시점이다. LG는 엔비디아 Isaac GR00T 위에 자사 액추에이터와 센서, 배터리를 얹는 구조를 택했고, 두산로보틱스는 2027년 에이전틱 로봇 OS를 내세운다. 모델 주권보다 부품과 데이터에서 협상력을 확보하는 전략으로 읽힌다.

  3. 03

    밸류에이션 맥락

    공개 수치로 보면 스킬드 AI의 기업가치 140억 달러 이상은 ARR 1억 달러의 약 140배이며, 2024년 7월 시리즈A의 15억 달러 대비 18개월 만에 9.3배다. 피규어 AI의 390억 달러는 공개 매출이 없어 배수 계산이 불가능하다. 반면 상장 추진 중인 애질리티 로보틱스는 S-4에서 2025년 매출 180만 달러를 공시했다. 시장이 하드웨어보다 모델 계층에 훨씬 높은 값을 매기고 있다는 뜻이다.

    국내에서는 원익로보틱스가 8월 국민성장펀드 1500억 원을 포함한 3500억 원 규모 자금을 유치하며 로봇 손이라는 부품 계층에 정책 자금이 몰리는 흐름을 보여줬다. 국내 모델 개발사 가운데 해외 선두와 비교할 만한 기업가치나 매출을 공개한 곳은 아직 없다.

  4. 04

    공급망 파급

    VLA 공급망은 학습용 연산, 로봇 탑재 연산, 데이터 세 갈래다. 학습은 엔비디아 GPU와 구글 TPU가 장악하고 있고, 로봇 탑재 연산도 LG와 화낙, 엔비디아 참조 휴머노이드가 모두 Jetson Thor를 쓴다. 국내 로봇 두뇌가 특정 미국 공급사와 수출 규제에 크게 노출돼 있다는 의미다.

    데이터는 새로운 조달 품목이 되고 있다. LG의 양재 데이터 팩토리, 정부의 10개 업종 데이터 팩토리, 원격조종 장비와 모션캡처 설비가 여기에 속한다. 한국의 강점은 액추에이터와 배터리, 센서 같은 부품을 그룹 내에서 조달할 수 있다는 점이며, 2027년 예산안이 센서와 액추에이터, 배터리에 620억 원을 배정한 것도 이 연결고리를 겨냥한다.

  5. 05

    지켜볼 신호

    첫째는 처음 보는 현장에서의 신뢰성이다. 피규어 Helix 2.5가 밝힌 처음 보는 30개 가정에서의 제로샷 성공률 56%가 현재 공개된 기준선이다. 90%를 넘는 결과가 나오면 판도가 바뀐다.

    둘째는 국내 실증이다. HD현대중공업과 SK에너지, BGF에서 진행 중인 휴머노이드 실증이 2027~2028년 현장 투입으로 이어지는지, LG 휴머노이드가 2027년 1분기 공개 일정을 지키는지가 관건이다. 셋째는 스킬드에 이어 ARR을 공개하는 두 번째 모델 기업의 등장이다.

  6. 06

    애널리스트 시각

    판단: 모델 계층은 데이터 계층보다 빠르게 범용화하고 있으며, 승자는 가장 영리한 액션 헤드가 아니라 현장 배치와 데이터 순환을 가진 기업이다. 확신도 중간.

    높음이 아닌 이유는 구조가 여전히 중요하기 때문이다. 1~3Hz 토큰 방식에서 50Hz 플로 매칭, 200Hz 이중 시스템으로 넘어간 것은 데이터가 아니라 설계의 진보였다. 낮음이 아닌 이유는 공개된 모든 수치가 선두와 후발의 차이를 파라미터 수가 아니라 데이터 양과 적응 비용으로 설명하기 때문이다. 한국 기업에는 독자 모델보다 데이터 공급자와 부품 공급자로서의 위치가 더 확실한 수익원이 될 가능성이 크다.

  7. 07

    따져봐야 할 질문

    LG에는 양재 데이터 팩토리의 10만 시간 데이터가 외부 모델 개발사에도 제공되는지, 아니면 자체 휴머노이드 전용인지 묻고 싶다. KIST와 과기정통부에는 VHLA 모델의 가중치를 공개할 계획인지, 공개한다면 어떤 라이선스인지가 핵심 질문이다.

    두산로보틱스에는 에이전틱 로봇 OS가 엔비디아 GR00T와 Gemini 계열 가운데 어떤 모델을 기본으로 쓰는지, 정부에는 10개 업종 데이터 팩토리의 데이터 소유권과 공유 규칙을 어떻게 정할지를 물어야 한다.