ROBOTNESS
产品美国

Hugging Face发布LeRobot 0.6:纳入世界模型与英伟达GR00T N1.7,开源机器人联盟加深

Hugging Face于7月7日发布开源机器人学习库LeRobot 0.6.0,新增3个世界模型策略、5个视觉语言动作模型(含英伟达GR00T N1.7)、2个奖励模型和6个仿真基准。英伟达前一天宣布,将GR00T、Isaac Teleop、Isaac Lab-Arena和Jetson Thor支持引入LeRobot,Cosmos 3也即将接入。

ROBOTNESS 编辑部阅读约 1 分钟

摘要

Hugging Face把旗下LeRobot库变成了多种机器人大脑同台竞争的货架。2026年7月7日发布的0.6.0版本新增3个世界模型策略、5个视觉语言动作(VLA)模型、2个奖励模型和6个仿真基准;英伟达在前一天公布了面向LeRobot的一揽子工具。

英伟达的贡献包括五部分。被英伟达称为“首个开放且可商用的机器人基础模型”的Isaac GR00T N1.7,现在可通过LeRobot工作流进行后训练和部署。开源数据采集框架Isaac Teleop可用标准化格式从外部设备采集人类示范,直接进入LeRobot。Isaac Lab-Arena接入LeRobot环境中心,开发者可搭建仿真场景,用于训练和评估GR00T、Physical Intelligence的Pi模型以及SmolVLA等策略。Jetson Thor支持面向在LeRobot开源人形机器人Reachy 2上部署VLA模型。英伟达还表示,Cosmos 3世界模型即将接入LeRobot。

英伟达称,此次合作连接了其300万机器人开发者与Hugging Face的1600万AI开发者。英伟达还提到其所称“规模最大的开源物理AI数据集”,下载量超过1500万次,包含逾35万条真实与仿真轨迹及5700万次抓取。Hugging Face联合创始人兼首席科学官Thomas Wolf表示,开源是一个领域把前沿研究变成人人可研究、可改造、可在其上构建之物的途径。

0.6版的模型清单相当丰富。世界模型策略包括:基于Qwen3-VL-2B、在潜空间预测未来的VLA-JEPA;需要24至32GB显存的自回归视频动作模型LingBot-VA;以及约50亿参数、结合视频生成与动作专家的FastWAM。五个VLA为:采用英伟达Cosmos-Reason2-2B视觉语言模型的GR00T N1.7;艾伦人工智能研究所的MolmoAct2,推理约需12GB,可在SO-100和SO-101机械臂上零样本运行;以Qwen2.5-VL-3B为底座的EO-1;约4.5亿参数的扩散Transformer模型Multitask DiT;以及以InternVL3-1B为底座、7.7亿参数的EVO1。

LeRobot 0.6新增主要策略
  • GR00T N1.7
    开发方
    英伟达
    类型
    VLA
    参数或底座规模(十亿)
    3
  • FastWAM
    开发方
    无数据
    类型
    世界模型(视频+动作专家)
    参数或底座规模(十亿)
    5
  • EO-1
    开发方
    无数据
    类型
    VLA(Qwen2.5-VL-3B底座)
    参数或底座规模(十亿)
    3
  • VLA-JEPA
    开发方
    无数据
    类型
    世界模型(Qwen3-VL-2B底座)
    参数或底座规模(十亿)
    2
  • EVO1
    开发方
    无数据
    类型
    VLA(InternVL3-1B底座)
    参数或底座规模(十亿)
    0.77
  • Multitask DiT
    开发方
    无数据
    类型
    扩散Transformer
    参数或底座规模(十亿)
    0.45
  • MolmoAct2
    开发方
    艾伦人工智能研究所
    类型
    VLA
    参数或底座规模(十亿)
    无数据

依据Hugging Face v0.6.0发布说明与英伟达GR00T N1.7模型卡。EO-1、VLA-JEPA、EVO1为披露的底座或模型规模;未注明开发方为null。

截至 2026年10月1日

两个奖励模型针对机器人学习的一大瓶颈,即判断一次尝试是否成功。Robometer是基于Qwen3-VL-4B的通用奖励模型,用逾100万条机器人轨迹训练;TOPReward则读取视觉语言模型回答“True”的概率,零样本为尝试打分。

六个新基准都可通过lerobot-eval命令运行,连同LIBERO、Meta-World和英伟达IsaacLab-Arena,基准家族增至九个。其中包括1万个扰动变体的LIBERO-plus,50项双臂任务、逾10万条训练轨迹的RoboTwin 2.0,覆盖2500个程序生成厨房、365项厨房任务的RoboCasa365,含6660个长程任务片段的RoboCerebra,16项记忆任务的RoboMME,以及考察知识与推理的VLABench。

LeRobot 0.6新增仿真基准
  • LIBERO-plus
    统计对象
    LIBERO扰动变体
    数量
    10,000
  • RoboCasa365
    统计对象
    厨房任务(2500个生成厨房)
    数量
    365
  • RoboTwin 2.0
    统计对象
    双臂任务
    数量
    50
  • RoboMME
    统计对象
    记忆任务
    数量
    16
  • RoboCerebra
    统计对象
    长程任务数据片段
    数量
    6,660

LeRobot v0.6.0发布说明披露数字。

截至 2026年10月1日

底层方面,新版加入跨GPU全分片数据并行训练、在Hugging Face Jobs上一键云端训练、最高快2倍的数据加载、支持人工介入纠错的lerobot-rollout命令、Intel RealSense深度相机支持以及自动语言标注流程。加载数据子集的时间由275秒降至0.06秒,基础依赖减少40%。支持的硬件包括SO-100与SO-101机械臂、Koch、OpenArm、reBot和宇树G1人形机器人。版本列出10位核心作者和79位以上社区贡献者。

中国因素在这份清单里很明显。多款新策略以Qwen和InternVL等国产开源视觉语言模型为底座,宇树G1是0.6版发布说明硬件清单中唯一的人形机器人;宇树H2 Plus还是英伟达6月1日发布的GR00T参考人形机器人的底盘。对国内高校和初创企业而言,用低成本SO-101机械臂或G1即可在统一命令体系下训练、比较多种开源模型,门槛进一步降低。

GR00T N1.7本身是英伟达4月17日开放早期访问并加入商用许可的模型。其Hugging Face模型卡显示,参数量30亿,以人类、机器人和仿真混合的13个数据集共2160万个数据点训练,采用NVIDIA Open Model License发布,在H100上借助TensorRT推理频率最高35.9Hz。

从竞争格局看,就能理解英伟达为何投入别家的库。7月30日发布的谷歌DeepMind Gemini Robotics 2只向受信测试者开放动作模型;8月18日推出S1的Skild AI出售专有大脑;Physical Intelligence于2025年2月开源π0,其模型也在LeRobot环境中心的支持之列。把LeRobot做成训练和比较开源策略的场所,开发者无论试用哪家模型,GR00T、Isaac和Jetson都摆在旁边。

风险在于碎片化和质量。一次新增8个策略,选择多了,但哪种适合哪台机器人缺乏指引,基准也是仿真而非工厂测试。Hugging Face未公布各策略使用量,英伟达也未给出Cosmos 3接入日期。

ROBOTNESS 分析

LeRobot正在成为开源机器人模型的中立市场,英伟达则在确保自家技术栈占据这个市场的默认货架。

证据在于版本结构。Hugging Face提供中立场地,英伟达、艾伦人工智能研究所和多个独立研究团队的策略在同一套基准和数据工具上并列;英伟达则在其中提供最完整的垂直链条:数据用Isaac Teleop,仿真用Isaac Lab-Arena,策略用GR00T N1.7,部署用Jetson Thor。

最有力的反方观点是,开源库很少决定哪种硬件胜出。用廉价SO-101机械臂和消费级GPU跑LeRobot的开发者未必会买Jetson Thor;MolmoAct2或VLA-JEPA若在社区基准上胜过GR00T,注意力也会离开英伟达。国产端侧芯片若完成适配,这一点在中国会更突出。

乐观情形:LeRobot像Hugging Face的Transformers库之于语言模型那样,成为机器人学习的标准训练和评估层,英伟达工具成为从原型到产品阻力最小的路径,GR00T凭社区微调成为使用最广的开源VLA。

悲观情形:策略清单扩张快于现场有效性的证据积累,企业级整机厂维持自有技术栈,LeRobot停留在对商业部署影响有限的科研与教育工具层面。

值得关注的信号:

  • Cosmos 3接入实际进入LeRobot版本的时间。
  • 在RoboCasa365、RoboTwin 2.0上GR00T N1.7与MolmoAct2、VLA-JEPA的社区对比结果。
  • 是否有商业机器人厂商宣布以LeRobot训练流程支撑量产产品。
要点
发布日期
2026年7月7日(LeRobot 0.6.0);英伟达7月6日宣布
新增策略
世界模型3个、VLA 5个、奖励模型2个
新增基准
6个,共9个基准家族
英伟达新增
GR00T N1.7、Isaac Teleop、Isaac Lab-Arena、Reachy 2的Jetson Thor支持
即将接入
Cosmos 3世界模型
开发者规模
英伟达300万机器人开发者;Hugging Face 1600万AI开发者
英伟达开源数据集
逾35万条轨迹、5700万次抓取、下载超1500万次
GR00T N1.7规模
30亿参数,NVIDIA Open Model License
支持机器人
SO-100/101、Koch、OpenArm、reBot、宇树G1
来源
ROBOTNESS 情报版
  1. 01

    为何重要

    机器人学习缺少语言AI那样围绕模型中心和训练库建立起来的通用工具链。LeRobot 0.6是建立这种工具链的认真尝试:同一套命令即可在9个基准家族以及低成本机械臂和人形机器人上训练、评估和部署世界模型、VLA和奖励模型。

    英伟达把GR00T N1.7、Isaac Teleop、Isaac Lab-Arena和Jetson Thor支持放进这个库,而不只放在自家Isaac体系内,说明它把开源社区视为触达机器人开发者的主渠道。英伟达给出的300万与1600万开发者数字,就是这条渠道的体量。

  2. 02

    竞争对手分析

    谷歌DeepMind与Skild AI都把最强的动作模型封闭或设置申请门槛,开源领域由英伟达、艾伦人工智能研究所、Physical Intelligence的π0以及大量学术模型占据,它们如今都在LeRobot相遇。

    对中国团队而言,以国产视觉语言模型为底座的策略已进入清单,说明国内开源模型在全球机器人社区有存在感。下一步的问题是国内机构能否以LeRobot格式发布完整策略并在新基准上取得领先,从而与GR00T正面比较。

  3. 03

    估值背景

    双方均未披露合作的财务条款。英伟达的算盘是带动硬件:每位从Isaac Lab-Arena仿真走到Jetson Thor部署的开发者,都是潜在的模组客户。

    对Hugging Face而言,机器人把模型与数据集托管业务延伸到数据量大、算力需求重的领域。Hugging Face Jobs一键训练功能指向面向机器人用户的付费路径,但公司未披露机器人相关收入。

  4. 04

    供应链影响

    支持硬件清单(SO-100、SO-101、Koch、OpenArm、reBot、宇树G1)显示,开源机器人学习主要发生在低成本机械臂和价格相对亲民的人形机器人上。Isaac Teleop的标准格式、Intel RealSense深度相机和硬件视频编码器支持,扩大了进入共享数据集的传感器范围。

    算力方面,新版支持CUDA 12.8和PyTorch 2.7至2.11,加入多GPU分片训练,并公布实测显存需求,例如LingBot-VA需24至32GB,MolmoAct2推理约12GB。许多策略一张工作站显卡即可运行,国内机械臂和数据采集硬件厂商可借此打入全球开发者市场。

  5. 05

    后续看点

    一是兑现Cosmos 3接入的LeRobot版本何时发布。二是在RoboCasa365、RoboTwin 2.0、LIBERO-plus上GR00T N1.7与MolmoAct2、VLA-JEPA、EVO1的公开对比。

    三是数据集贡献者是否采用Isaac Teleop格式,可判断英伟达的数据标准能否落地。四是搭载Jetson Thor的Reachy 2部署VLA模型的案例,这是端侧部署承诺的实际检验。

  6. 06

    分析师观点

    核心判断:LeRobot正在成为开源机器人模型的中立市场,英伟达把自家技术栈定位为其中的默认路径。置信度:中。0.6版的覆盖面与英伟达贡献的深度在双方页面均有记录。

    置信度不更高,是因为开源库对商业硬件选择的影响有限,且各策略的使用数据未公开。若社区微调明显向GR00T集中,或出现用LeRobot训练的商业产品,置信度可上调。

  7. 07

    值得追问的问题

    Cosmos 3何时、以何种规模接入LeRobot?Hugging Face上GR00T N1.7的社区微调有多少,与其他策略相比如何?

    Hugging Face会否公布机器人模型和数据集的使用指标?有哪些商业机器人厂商用LeRobot训练量产策略?国产端侧芯片能否获得LeRobot官方支持?