ROBOTNESS
产品阅读约 1 分钟ROBOTNESS 编辑部美国

英伟达预览GR00T N2:押注先预测视频再行动的世界动作模型

英伟达于2026年3月16日GTC主题演讲中预览基于DreamZero研究的新一代机器人基础模型GR00T N2,称其在新环境新任务中的成功率是领先VLA模型的两倍以上。30亿参数的GR00T N1.7进入商业许可抢先体验,DreamZero的主要实验平台为智元G1。N2计划于2026年底前推出。

英伟达预览GR00T N2:押注先预测视频再行动的世界动作模型 (ROBOTNESS 示意图)
摘要

英伟达于2026年3月16日在GTC大会主题演讲中首次预览新一代机器人基础模型Isaac GR00T N2。首席执行官黄仁勋介绍,该模型采用源自公司DreamZero研究的“世界动作模型”架构。英伟达称,在新环境中执行新任务时,GR00T N2的成功率是领先视觉语言动作(VLA)模型的两倍以上,计划于2026年底前推出。

同场发布的还有多项产品。英伟达宣布30亿参数的人形机器人推理型VLA模型GR00T N1.7进入抢先体验阶段,并提供商业许可,Humanoid、LG电子、NEURA Robotics和Noble Machines正在采用。公司还发布了Cosmos 3,称其为首个将合成世界生成、视觉推理和动作仿真统一起来的世界基础模型;以及基于新物理引擎Newton 1.0和PhysX SDK的Isaac Lab 3.0抢先体验版。英伟达表示,GR00T N2目前在通用机器人策略榜单MolmoSpaces和RoboArena上均排名第一。

GR00T N2的研究基础是2026年2月17日发布在arXiv上的预印本《World Action Models are Zero-shot Policies》,作者包括英伟达研究员Seonghyeon Ye、Joel Jang,以及机器人研究负责人Linxi Fan和Yuke Zhu。DreamZero是一个140亿参数的自回归视频扩散模型。英伟达开发者博客介绍,它以开源模型Wan 2.1图生视频14B为起点,由同一个Transformer同时对视频token和动作token去噪,也就是在预测摄像头下一帧画面的同时生成机器人的下一步动作。

值得注意的是,DreamZero的主要实验平台是智元机器人(AgiBot)的G1移动双臂机器人。预印本显示,在22个环境、约500小时数据上训练后,DreamZero在已见任务上的平均进度为62.2%,预训练VLA基线为27.4%;在未见任务上为39.5%对16.3%。对比基线是英伟达自家的GR00T N1.6和Physical Intelligence的pi0.5。研究团队在GB200上通过GPU并行、缓存、CUDA Graphs、NVFP4量化和加速版“Flash”模型,把推理延迟从5.7秒降到150毫秒,提速38倍,实现7Hz闭环控制。权重和推理代码已在GitHub公开。

智元G1实验:DreamZero与预训练VLA对比
  • 已见任务平均进度(%)
    DreamZero(140亿参数世界动作模型)
    62.2
    预训练VLA基线(GR00T N1.6、pi0.5)
    27.4
    倍数(DreamZero/基线)
    2.27
  • 未见任务平均进度(%)
    DreamZero(140亿参数世界动作模型)
    39.5
    预训练VLA基线(GR00T N1.6、pi0.5)
    16.3
    倍数(DreamZero/基线)
    2.42

数据来自DreamZero预印本(arXiv 2602.15922,2026年2月17日)。倍数=DreamZero进度/基线进度,由ROBOTNESS计算。均为披露值,非估算。

截至 2026年10月1日

跨本体迁移是另一项关键结果。论文称,仅加入12分钟人类第一视角视频或20分钟YAM机械臂视频,未见任务表现即相对提升42%以上;基于智元数据训练的模型只需30分钟自由操作数据就能适配YAM机器人,同时保留零样本能力。

此次发布延续了英伟达2026年1月5日在CES上的布局。当时英伟达开源了支持全身控制的人形机器人VLA模型GR00T N1.6,并推出基于Blackwell架构的Jetson T4000模组,FP4算力1,200 TFLOPS、内存64GB,千片采购单价1,999美元。英伟达称其机器人开发者已达200万。商业逻辑一以贯之:模型开源或低价授权,训练、仿真和端侧推理都跑在英伟达芯片上。

合作伙伴名单显示了生态的广度。英伟达表示,发那科、ABB机器人、安川和库卡这四家装机量合计超过200万台的工业机器人厂商,正把Omniverse库和Isaac仿真集成到虚拟调试工具中。智元正在为工业人形机器人采用GR00T N系列模型,Skild AI和丰田研究院是Cosmos 3的采用方,阿里云则在把英伟达整套物理AI技术栈集成进其人工智能平台PAI。

对中国产业链而言,这一动向有两面。智元的数据和硬件成为英伟达模型研究的基础,说明国产本体在数据采集上具备优势;但若基础模型层由英伟达主导,国内整机厂在“大脑”上的话语权会被削弱。在海外,Skild AI于1月14日以超过140亿美元估值融资14亿美元,Physical Intelligence和谷歌DeepMind的Gemini Robotics系列则坚持VLA路线。

机器人基础模型公司最近披露融资
  • Skild AI
    国家
    US
    成立年份
    2023
    最近披露轮次
    Series C
    金额(美元)
    1,400,000,000
    投后估值(美元)
    14,000,000,000
    公布日期
    2026-01-14
  • Physical Intelligence
    国家
    US
    成立年份
    无数据
    最近披露轮次
    Series B
    金额(美元)
    无数据
    投后估值(美元)
    无数据
    公布日期
    2025-11-20
  • Generalist AI
    国家
    US
    成立年份
    无数据
    最近披露轮次
    Growth
    金额(美元)
    400,000,000
    投后估值(美元)
    无数据
    公布日期
    2026-06-04
  • Dyna Robotics
    国家
    US
    成立年份
    2024
    最近披露轮次
    Series A
    金额(美元)
    120,000,000
    投后估值(美元)
    无数据
    公布日期
    2025-09-15
  • Genesis AI
    国家
    FR
    成立年份
    无数据
    最近披露轮次
    Launch round
    金额(美元)
    105,000,000
    投后估值(美元)
    无数据
    公布日期
    2025-06-30

依据各公司或投资方官方披露(ROBOTNESS公司数据库)。null=未披露。英伟达为上市公司,未列入。

截至 2026年10月1日

成本仍是最大疑问。英伟达此后在开发者博客中披露的自测数据显示,世界动作模型每个动作块的推理耗时为590毫秒和800毫秒,而pi0.5为190毫秒,慢3至4倍;论文中的7Hz控制也是在数据中心级GB200上实现的。榜单排名为英伟达自述,预印本尚未经过同行评审,截至一季度末GR00T N2仍未发布。

ROBOTNESS 分析

英伟达正把机器人基础模型从语言优先的VLA引向视频优先的世界动作模型,而后者每次决策所需算力成倍增加,这一转向对英伟达的生意有利。

证据来自英伟达自己的数据:140亿参数策略在未见任务上的进度是GR00T N1.6和pi0.5的两倍以上,但要以7Hz运行需要GB200和38倍的工程优化。同一篇博客既称DreamZero在RoboArena 2026年4月榜单上以1,750分领先pi0.5的1,622分,也记录了延迟代价。

最有力的反驳是,工厂客户买单的是节拍和可靠性,而非基准分数。如果机器人必须依赖数据中心推理或搭载大得多的计算单元,能在Jetson上高频运行的小型VLA即使泛化较弱,也可能拿下实际部署。

乐观情形。若GR00T N2按时以商业许可发布并能蒸馏到Jetson Thor级硬件,发那科、安川等200万台装机基础将成为现成渠道,国内整机厂则转向在数据和硬件上竞争。

悲观情形。若延迟和成本居高不下,N2将停留在实验室阶段,轻量VLA厂商守住商业市场;英伟达用自己引用的榜单评价自家模型,也会削弱集成商的信任。

值得关注的三个时间节点如下。

  • 2026年12月31日前:GR00T N2是否如约以权重和商业许可形式发布。
  • 2026年内RoboArena月度榜单:DreamZero系策略能否保持第一。
  • 2027年春季GTC:英伟达能否展示在量产人形机器人Jetson模组上运行的世界动作模型。
要点
发布
2026年3月16日GTC主题演讲
GR00T N2状态
预览,2026年底前推出
GR00T N2性能
新环境新任务成功率为领先VLA两倍以上
GR00T N1.7
30亿参数,商业许可抢先体验
中国关联
智元G1为DreamZero主要实验平台;阿里云集成整套技术栈
DreamZero规模
140亿参数视频扩散世界动作模型
控制频率
GB200上延迟5.7秒降至150毫秒,7Hz
未见任务进度
39.5%对16.3%
同时发布
Cosmos 3、Isaac Lab 3.0、Newton 1.0
来源
ROBOTNESS 情报版
  1. 01

    为何重要

    GR00T N2是英伟达这一量级的平台企业首次为世界动作模型制定商业路线图。此前通用机器人策略的商业默认路线是VLA,Physical Intelligence、谷歌DeepMind以及英伟达自己的GR00T N1.6都走这条路。

    英伟达同时提供仿真、合成数据和端侧算力,其模型路线的选择会成为大量中小开发者的默认选项。向视频优先策略的转变,会抬高大规模视频语料和GPU在机器人全生命周期中的价值。

  2. 02

    竞争对手分析

    Physical Intelligence是VLA阵营的标杆。DreamZero论文的外部基线正是pi0.5;据英伟达披露,在RoboArena 2026年4月榜单上pi0.5得分1,622,DreamZero为1,750。Skild AI在1月以超140亿美元估值融资14亿美元,同时又是Cosmos 3的采用方,既是客户也是对手。

    国内方面,智元既为DreamZero提供实验平台,又采用GR00T N模型做工业人形机器人。谷歌Gemini Robotics为闭源模型,英伟达则公开权重,这种开放性对不愿依附竞争对手模型的整机厂具有吸引力。

  3. 03

    估值背景

    英伟达未单独披露机器人业务收入,GTC发布无法直接对应财务数字。估值信号更多体现在模型初创公司:Skild AI在2026年1月的投后估值为140亿美元,Generalist AI在6月融资4亿美元,市场把通用机器人大脑当作独立业务定价。

    若英伟达开源的N2追平甚至超越这些公司的策略模型,其估值中的稀缺性溢价将受到挤压,初创公司的融资逻辑会转向自有数据和落地收入。

  4. 04

    供应链影响

    DreamZero的7Hz控制是在数据中心级GB200上实现的,而装在机器人上的Jetson T4000算力为FP4 1,200 TFLOPS,千片单价1,999美元。两类硬件之间的差距,是N2商用面临的现实供应链问题。

    训练依赖大规模视频和真实机器人数据,例如智元22个环境约500小时的数据。这对国内数据采集工厂、遥操作服务以及基于Cosmos和Physical AI Data Factory蓝图的合成数据需求都是利好。

  5. 05

    后续看点

    确定的时间点是2026年底前推出N2的承诺,若延期或仅以研究许可发布,本身就是信号。英伟达引用的RoboArena和MolmoSpaces排名会随竞品提交而变化。

    国内需关注智元等整机厂是否从GR00T N1.x升级到N2,以及阿里云PAI平台上英伟达物理AI技术栈的实际使用情况。

  6. 06

    分析师观点

    观点:英伟达转向世界动作模型在技术上可信,在商业上对自身有利,成败取决于N2能否压缩到端侧硬件运行。置信度:中等。

    理由:预印本给出了可复现的详细数据并公开权重,支撑了能力主张;但榜单第一为自述,GTC时N2仅为预览,英伟达后续博客也承认其延迟比pi0.5高3至4倍。

  7. 07

    值得追问的问题

    GR00T N2在人形机器人上做闭环控制需要多少端侧算力,英伟达会否公布Jetson Thor实测数据?

    N2是否沿用N1.7的商业许可条款,基于Wan 2.1的模型许可如何处理?

    未见任务上的提升在节拍严格的工厂中还能保留多少?