ROBOTNESS
제품4분 분량ROBOTNESS 데스크미국

허깅페이스 '르로봇 0.6' 출시… 월드모델에 엔비디아 GR00T까지 품은 개방형 로봇 플랫폼

허깅페이스가 7월 7일 오픈소스 로봇 학습 라이브러리 르로봇(LeRobot) 0.6.0을 내놨다. 월드모델 정책 3종, 엔비디아 GR00T N1.7을 포함한 시각언어행동 모델 5종, 보상 모델 2종, 시뮬레이션 벤치마크 6종이 추가됐다. 엔비디아는 하루 전 GR00T, 아이작 텔레옵, 아이작 랩 아레나, 젯슨 토르 지원을 르로봇에 넣고 코스모스 3도 곧 통합한다고 밝혔다.

요약

허깅페이스의 로봇 학습 라이브러리 르로봇(LeRobot)이 여러 로봇 두뇌를 한곳에 모은 진열대가 됐다. 허깅페이스는 2026년 7월 7일 르로봇 0.6.0을 공개하고 월드모델 정책 3종, 시각언어행동(VLA) 모델 5종, 보상 모델 2종, 시뮬레이션 벤치마크 6종을 추가했다. 엔비디아는 하루 전 르로봇용 도구 묶음을 발표했다.

엔비디아 기여분은 다섯 가지다. 엔비디아가 '최초의 개방형 상업용 로봇 파운데이션 모델'이라고 부르는 아이작 GR00T N1.7을 르로봇 작업 흐름에서 사후 학습하고 배치할 수 있게 됐다. 오픈소스 데이터 수집 프레임워크 아이작 텔레옵(Isaac Teleop)은 외부 장치로 사람의 시연을 표준 형식으로 수집해 르로봇에 바로 넣는다. 아이작 랩 아레나는 르로봇 환경 허브에 들어가 GR00T, 피지컬인텔리전스의 Pi 모델, SmolVLA 같은 정책을 학습하고 평가할 시뮬레이션 장면을 만들 수 있게 한다. 젯슨 토르 지원은 르로봇의 오픈소스 휴머노이드 리치2(Reachy 2)에 VLA 모델을 배치하는 것이 목표다. 엔비디아는 월드모델 코스모스 3도 곧 르로봇에 들어온다고 밝혔다.

엔비디아는 이번 협력이 자사 로봇 개발자 300만명과 허깅페이스의 AI 개발자 1600만명을 잇는다고 설명했다. 또 자사가 '최대 규모 오픈소스 피지컬 AI 데이터셋'이라고 부르는 자료가 1500만회 넘게 내려받아졌으며 실제와 시뮬레이션 궤적 35만건 이상, 파지 데이터 5700만건을 담고 있다고 밝혔다. 토마 울프 허깅페이스 공동창업자 겸 최고과학책임자는 오픈소스가 첨단 연구를 누구나 연구하고 고쳐 쓰고 발전시킬 수 있는 것으로 바꾸는 길이라고 말했다.

르로봇 0.6의 모델 목록은 폭이 넓다. 월드모델 정책은 Qwen3-VL-2B 기반으로 잠재 공간에서 미래를 예측하는 VLA-JEPA, 24~32GB GPU가 필요한 자기회귀형 영상행동 모델 LingBot-VA, 영상 생성과 동작 전문가를 결합한 약 50억 파라미터의 FastWAM이다. VLA는 엔비디아 Cosmos-Reason2-2B 시각언어모델을 쓰는 GR00T N1.7, 앨런AI연구소(Ai2)의 MolmoAct2(추론에 약 12GB, SO-100과 SO-101 로봇팔에서 제로샷 구동), Qwen2.5-VL-3B 기반 EO-1, 약 4억5000만 파라미터 확산 트랜스포머 Multitask DiT, InternVL3-1B 기반 7억7000만 파라미터 EVO1이다.

르로봇 0.6에 추가된 주요 정책
  • GR00T N1.7
    개발 주체
    엔비디아
    유형
    VLA
    파라미터 또는 백본(십억개)
    3
  • FastWAM
    개발 주체
    자료 없음
    유형
    월드모델(영상+동작 전문가)
    파라미터 또는 백본(십억개)
    5
  • EO-1
    개발 주체
    자료 없음
    유형
    VLA(Qwen2.5-VL-3B 백본)
    파라미터 또는 백본(십억개)
    3
  • VLA-JEPA
    개발 주체
    자료 없음
    유형
    월드모델(Qwen3-VL-2B 백본)
    파라미터 또는 백본(십억개)
    2
  • EVO1
    개발 주체
    자료 없음
    유형
    VLA(InternVL3-1B 백본)
    파라미터 또는 백본(십억개)
    0.77
  • Multitask DiT
    개발 주체
    자료 없음
    유형
    확산 트랜스포머
    파라미터 또는 백본(십억개)
    0.45
  • MolmoAct2
    개발 주체
    앨런AI연구소
    유형
    VLA
    파라미터 또는 백본(십억개)
    자료 없음

허깅페이스 v0.6.0 릴리스 노트와 엔비디아 GR00T N1.7 모델 카드 기준. EO-1, VLA-JEPA, EVO1은 공개된 백본 또는 모델 크기. 개발 주체 미기재는 null.

2026년 10월 1일 기준

보상 모델 두 종은 로봇 학습의 병목인 '시도가 성공했는지 판단하는 문제'를 다룬다. Robometer는 Qwen3-VL-4B 기반 범용 보상 모델로 로봇 궤적 100만건 이상으로 학습했다. TOPReward는 시각언어모델이 '참(True)'이라고 답할 확률을 읽어 별도 학습 없이 시도를 채점한다.

새 벤치마크 6종은 모두 lerobot-eval 명령으로 돌릴 수 있고, LIBERO, Meta-World, 엔비디아 IsaacLab-Arena를 포함해 벤치마크군은 9개로 늘었다. 변형 과제 1만개의 LIBERO-plus, 양팔 과제 50개와 학습 궤적 10만건 이상의 RoboTwin 2.0, 절차 생성 주방 2500곳의 주방 과제 365개 RoboCasa365, 장기 과제 데이터 6660건의 RoboCerebra, 기억 과제 16개의 RoboMME, 지식과 추론을 보는 VLABench다.

르로봇 0.6 신규 시뮬레이션 벤치마크
  • LIBERO-plus
    집계 대상
    LIBERO 변형 과제
    수량
    10,000
  • RoboCasa365
    집계 대상
    주방 과제(생성 주방 2500곳)
    수량
    365
  • RoboTwin 2.0
    집계 대상
    양팔 과제
    수량
    50
  • RoboMME
    집계 대상
    기억 과제
    수량
    16
  • RoboCerebra
    집계 대상
    장기 과제 데이터 에피소드
    수량
    6,660

르로봇 v0.6.0 릴리스 노트 공개 수치.

2026년 10월 1일 기준

내부 기능도 손봤다. 여러 GPU에 걸친 완전 분할 데이터 병렬 학습, 플래그 하나로 허깅페이스 잡스에서 돌리는 클라우드 학습, 최대 2배 빨라진 데이터 로딩, 사람이 개입해 교정하는 lerobot-rollout 명령, 인텔 리얼센스 깊이 카메라 지원, 자동 언어 주석 파이프라인이 추가됐다. 데이터셋 일부를 불러오는 시간은 275초에서 0.06초로 줄었고 기본 의존성은 40% 감소했다. 지원 하드웨어는 SO-100과 SO-101, Koch, OpenArm, reBot, 유니트리 G1 휴머노이드다. 핵심 저자 10명과 커뮤니티 기여자 79명 이상이 참여했다.

국내 연구 현장에도 쓸모가 크다. 대학과 스타트업이 값싼 SO-101 로봇팔이나 유니트리 G1으로 같은 명령 체계에서 여러 공개 모델을 학습하고 비교할 수 있게 됐다. 코스모스 3 도입 기업으로 이름을 올린 삼성전자, LG전자, 두산로보틱스 입장에서도 르로봇에 코스모스 3가 들어오면 사내 실험과 오픈소스 생태계를 잇는 통로가 생긴다. 다만 릴리스 노트에 국내 기관이 개발 주체로 명시된 모델은 없다.

GR00T N1.7 자체는 4월 17일 엔비디아가 얼리액세스를 열며 상업 사용을 지원하는 라이선스를 붙인 모델이다. 허깅페이스 모델 카드에 따르면 파라미터는 30억개이고, 사람, 로봇, 시뮬레이션 데이터를 섞은 13개 데이터셋 2160만 데이터 포인트로 학습했으며 엔비디아 오픈 모델 라이선스로 배포된다. 텐서RT를 쓴 H100 GPU에서 최대 35.9Hz로 추론한다.

경쟁 구도를 보면 엔비디아가 남의 라이브러리에 투자하는 이유가 보인다. 7월 30일 나온 구글 딥마인드 제미나이 로보틱스 2는 동작 모델을 신뢰 테스터에게만 열었다. 8월 18일 S1을 내놓은 스킬드AI는 독점 두뇌를 판다. 피지컬인텔리전스는 2025년 2월 π0을 공개했고 르로봇 환경 허브가 그 모델을 지원한다. 르로봇을 개방형 정책을 학습하고 비교하는 장으로 만들면 개발자가 어떤 경쟁 모델을 시험하든 GR00T, 아이작, 젯슨이 바로 옆에 놓이게 된다.

위험은 파편화와 품질이다. 한 번에 정책 8종이 늘어 선택지는 넓어졌지만 어떤 로봇에 무엇이 맞는지에 대한 안내는 부족하고, 벤치마크도 공장 시험이 아닌 시뮬레이션이다. 허깅페이스는 정책별 사용량을 공개하지 않으며 엔비디아도 코스모스 3 통합 날짜를 밝히지 않았다.

ROBOTNESS 분석

르로봇은 개방형 로봇 모델의 중립 시장이 되고 있고, 엔비디아는 그 시장의 기본 진열대를 자사 스택으로 채우고 있다.

근거는 릴리스 구조에 있다. 허깅페이스는 중립 공간을 제공한다. 엔비디아, 앨런AI연구소, 여러 독립 연구팀의 정책이 같은 벤치마크와 데이터 도구 위에 나란히 놓인다. 엔비디아는 그 안에서 가장 완결된 수직 구조를 공급한다. 데이터는 아이작 텔레옵, 시뮬레이션은 아이작 랩 아레나, 정책은 GR00T N1.7, 배치는 젯슨 토르다.

가장 강한 반론은 오픈소스 라이브러리가 어떤 하드웨어가 이길지를 좀처럼 결정하지 못한다는 점이다. 값싼 SO-101 로봇팔과 일반 GPU로 르로봇을 쓰는 개발자는 젯슨 토르를 사지 않을 수 있고, MolmoAct2나 VLA-JEPA가 커뮤니티 벤치마크에서 GR00T를 앞서면 관심이 엔비디아에서 멀어질 수 있다.

낙관 시나리오에서는 르로봇이 허깅페이스의 트랜스포머스 라이브러리가 언어모델에서 그랬듯 로봇 학습의 표준 학습과 평가 계층이 되고, 엔비디아 도구는 시제품에서 제품으로 가는 가장 쉬운 길이 된다. GR00T는 커뮤니티 미세조정이 쌓이며 가장 많이 쓰이는 개방형 VLA가 된다.

비관 시나리오에서는 현장에서 무엇이 통하는지에 대한 증거보다 정책 목록이 더 빨리 늘고, 기업형 로봇 제조사는 독자 스택을 유지하며, 르로봇은 상업 배치에 영향력이 작은 연구와 교육 도구로 남는다.

주목할 신호:

  • 코스모스 3 통합이 실제로 르로봇 릴리스에 들어가는 시점.
  • 새 RoboCasa365, RoboTwin 2.0 벤치마크에서 GR00T N1.7과 MolmoAct2, VLA-JEPA를 비교한 커뮤니티 결과.
  • 르로봇 기반 학습 파이프라인으로 실제 제품을 내놓는 상업 로봇 제조사의 등장.
핵심 사실
공개일
2026년 7월 7일(르로봇 0.6.0), 엔비디아 발표 7월 6일
추가 정책
월드모델 3종, VLA 5종, 보상 모델 2종
추가 벤치마크
6종, 전체 9개 벤치마크군
엔비디아 추가분
GR00T N1.7, 아이작 텔레옵, 아이작 랩 아레나, 리치2용 젯슨 토르 지원
통합 예정
코스모스 3 월드모델
개발자 규모
엔비디아 로봇 개발자 300만명, 허깅페이스 AI 개발자 1600만명
엔비디아 공개 데이터셋
궤적 35만건 이상, 파지 5700만건, 다운로드 1500만회 이상
GR00T N1.7 규모
30억 파라미터, 엔비디아 오픈 모델 라이선스
지원 로봇
SO-100/101, Koch, OpenArm, reBot, 유니트리 G1
출처
ROBOTNESS 인텔리전스
  1. 01

    왜 중요한가

    로봇 학습에는 언어 AI가 모델 허브와 학습 라이브러리로 구축한 것 같은 공통 도구 체계가 없다. 르로봇 0.6은 이를 만들려는 본격적인 시도다. 같은 명령으로 월드모델, VLA, 보상 모델을 9개 벤치마크군과 저가 로봇팔, 휴머노이드에서 학습, 평가, 배치할 수 있다.

    엔비디아가 GR00T N1.7, 아이작 텔레옵, 아이작 랩 아레나, 젯슨 토르 지원을 자사 아이작 스택뿐 아니라 이 라이브러리에 넣었다는 것은 오픈소스 커뮤니티를 로봇 개발자에게 닿는 핵심 경로로 본다는 뜻이다. 엔비디아가 제시한 300만명과 1600만명이라는 숫자가 그 경로의 규모다.

  2. 02

    경쟁사 비교

    구글 딥마인드와 스킬드AI는 가장 강력한 동작 모델을 닫아두거나 신청제로 운영한다. 개방형 영역은 엔비디아, 앨런AI연구소, 피지컬인텔리전스의 π0, 다수의 학계 모델이 차지하고 있고, 이들이 모두 르로봇에서 만난다.

    릴리스 노트에는 국내 기관이 개발 주체로 명시된 정책이 없다. 국내 기업과 연구기관이 독자 모델을 만들더라도 르로봇 형식으로 공개해 벤치마크에 올리지 않으면 글로벌 개발자의 비교 대상에서 빠질 수 있다.

  3. 03

    밸류에이션 맥락

    두 회사 모두 이번 협력의 금전 조건은 밝히지 않았다. 엔비디아의 셈법은 하드웨어 판매 유도다. 아이작 랩 아레나 시뮬레이션에서 젯슨 토르 배치로 넘어가는 개발자는 모두 잠재 모듈 고객이다.

    허깅페이스에게 로봇은 모델과 데이터셋 호스팅 사업을 데이터가 크고 연산이 무거운 분야로 넓히는 기회다. 플래그 하나로 허깅페이스 잡스에서 학습하는 기능은 로봇 사용자를 위한 유료 경로를 시사하지만, 허깅페이스는 로봇 관련 매출을 공개하지 않았다.

  4. 04

    공급망 파급

    지원 하드웨어 목록(SO-100, SO-101, Koch, OpenArm, reBot, 유니트리 G1)은 개방형 로봇 학습이 저가 로봇팔과 비교적 싼 휴머노이드에서 이뤄지고 있음을 보여준다. 아이작 텔레옵의 표준 형식과 인텔 리얼센스 깊이 카메라, 하드웨어 영상 인코더 지원은 공유 데이터셋으로 들어오는 센서 범위를 넓힌다.

    연산 측면에서는 CUDA 12.8과 파이토치 2.7~2.11을 지원하고 다중 GPU 분할 학습을 추가했다. LingBot-VA 24~32GB, MolmoAct2 추론 약 12GB처럼 실측 VRAM도 공개돼 많은 정책이 워크스테이션 GPU 한 장으로 돌아간다. 국내 대학 연구실의 진입 장벽이 그만큼 낮아진다.

  5. 05

    지켜볼 신호

    첫째, 약속한 코스모스 3 통합이 담긴 르로봇 릴리스가 나오는 시점. 둘째, RoboCasa365, RoboTwin 2.0, LIBERO-plus에서 GR00T N1.7과 MolmoAct2, VLA-JEPA, EVO1을 비교한 공개 결과.

    셋째, 데이터셋 기여자들이 아이작 텔레옵 형식을 채택하는지 여부로, 엔비디아 데이터 표준이 자리 잡는지 알 수 있다. 넷째, 젯슨 토르를 단 리치2에 VLA 모델을 배치한 사례로, 엣지 배치 약속의 실제 시험대다.

  6. 06

    애널리스트 시각

    논지는 르로봇이 개방형 로봇 모델의 중립 시장이 되고 있고, 엔비디아가 자사 스택을 그 안의 기본 경로로 자리매김하고 있다는 것이다. 확신도는 중간이다. 0.6 릴리스의 범위와 엔비디아 기여의 깊이는 두 회사 페이지에 모두 기록돼 있다.

    확신도를 더 높이지 못하는 이유는 오픈소스 라이브러리가 상업용 하드웨어 선택에 미치는 영향이 제한적이고, 정책별 사용 데이터가 공개되지 않았기 때문이다. 커뮤니티 미세조정이 GR00T 쪽으로 눈에 띄게 쏠리거나 르로봇으로 학습한 상업 제품이 나오면 확신도를 높일 수 있다.

  7. 07

    따져봐야 할 질문

    코스모스 3는 언제, 어떤 크기로 르로봇에 들어오는가. 허깅페이스에 올라온 GR00T N1.7 커뮤니티 미세조정은 몇 개이고 경쟁 정책과 비교하면 어떤가.

    허깅페이스는 로봇 모델과 데이터셋 사용 지표를 공개할 것인가. 르로봇으로 양산 정책을 학습하는 상업 로봇 제조사는 어디인가. 국내 기업이 르로봇에 모델을 공개할 계획은 있는가.