ROBOTNESS
产品阅读约 1 分钟ROBOTNESS 编辑部美国

英伟达开源40亿参数世界模型Cosmos 3 Edge,在Jetson Thor上直接规划机器人动作

英伟达7月20日在Hugging Face以开放权重发布Cosmos 3 Edge,这是其物理AI模型家族Cosmos 3中最小的一款。该模型参数量40亿,可在Jetson Thor上运行,每次推理生成32个机器人动作,Doosan Robotics、西门子、Agile Robots和Skild AI正在评估。

摘要

英伟达把世界基础模型从数据中心推到了机器人本体上。公司于2026年7月20日在SIGGRAPH大会上发布40亿参数的开放模型Cosmos 3 Edge,称其无需数据中心GPU,即可在Jetson Thor计算机上实时理解场景并输出机器人动作。

Cosmos 3 Edge是Cosmos 3三款模型中最小的一款。英伟达5月31日在GTC台北发布该家族,640亿参数的Super和160亿参数的Nano当即开放,Edge则标注为即将推出。三款模型都采用英伟达所称的“混合Transformer”架构,可理解和生成文本、图像、视频、环境声音和动作。Edge把负责推理的自回归塔与负责预测的扩散塔结合,语言、视频、音频和动作token共享注意力层;其推理部分是一个基于Nemotron的20亿参数模型。

英伟达Cosmos 3模型家族
  • Cosmos 3 Edge
    参数量(十亿)
    4
    开放时间
    2026-07-20
    英伟达定位
    Jetson、RTX PRO、DGX、GeForce RTX实时推理
  • Cosmos 3 Nano
    参数量(十亿)
    16
    开放时间
    2026-05-31
    英伟达定位
    快速视频与动作推理
  • Cosmos 3 Super
    参数量(十亿)
    64
    开放时间
    2026-05-31
    英伟达定位
    最高物理精度,用于机器人与自动驾驶模型后训练

参数量来自英伟达SIGGRAPH 2026博客;日期来自5月31日发布稿与7月20日Edge发布。仅用披露数据。

截至 2026年10月1日

权重已上传Hugging Face,推理和后训练代码在GitHub公开。英伟达称Edge可运行于Jetson模组(包括新的Jetson T2000和T3000),以及RTX PRO、DGX和GeForce RTX GPU。以BF16精度计,模型在Jetson Thor上约占9GB。英伟达技术博客显示,在Jetson AGX Thor T5000上,模型约1.53秒生成一组32个未来动作,每组对应约2.13秒、15Hz的机器人运动。机器人执行动作组前段后即重新规划,新计划在旧计划用完前就已就绪。

视觉分析方面,英伟达称Edge在RTX系统上分析1080p视频最快只需22毫秒,在L40 GPU上约30毫秒,并在同参数级别的视觉分析基准VANTAGE-Bench上排名第一。公司同时发布了Cosmos 3的步数蒸馏版本,把去噪采样从50步减至4步,称推理速度提升25倍且质量损失很小。

机器人控制成绩相对一般,英伟达也如实公布。Edge使用名为Cosmos3-DROID的数据集后训练,包含7.6万条成功的遥操作轨迹、86项任务、564个场景,约350小时,采集平台为Franka Panda机械臂和Robotiq夹爪。在RoboLab闭环评测的120项语言条件操作任务中,Edge成功率为22.9%。基准后训练使用64个节点、每节点4颗GB200,迭代6万次,耗时约68小时。

英伟达列出正在评估Cosmos 3 Edge的机器人企业为Agile Robots、Doosan Robotics、西门子和Skild AI,智慧基础设施视觉智能体领域为Centific、Vaidio和YUAN。5月发布时,英伟达公布的Cosmos 3机器人领域采用方为Agile Robots、Doosan Robotics、LG电子、三星电子和Skild AI,自动驾驶领域为理想汽车。Skild AI与Agile Robots、Black Forest Labs、Generalist、LTX、Runway同为英伟达Cosmos联盟创始成员。

对中国产业链而言,关键一环是本体。英伟达6月1日发布的Isaac GR00T参考人形机器人以宇树科技H2 Plus为底盘,搭载Sharpa Wave触觉灵巧手和Jetson AGX Thor T5000,预计2026年底由宇树供货;宇树科技于8月18日在上交所科创板发布上市相关公告。也就是说,英伟达开放机器人平台的标准本体来自中国厂商。不过,Cosmos 3的机器人采用方名单中没有中国大陆本体企业,自动驾驶领域则有理想汽车。

目标硬件是战略的一部分。Jetson AGX Thor T5000在40至130瓦功耗区间内提供2070 FP4 TFLOPS算力和128GB统一内存。9GB的世界模型装上后,仍有余量运行感知、安全和独立的动作策略。

开放与封闭的路线分歧更加明显。十天后发布的谷歌DeepMind Gemini Robotics 2,其端侧动作模型仅向受信测试者开放;Skild AI通过早期访问申请提供S1。英伟达则免费开放Cosmos 3 Edge和带商用许可的30亿参数GR00T N1.7权重,靠训练和运行所需的Jetson、RTX和数据中心硬件获利。

2026年发布的端侧与机器人基础模型
  • Cosmos 3 Edge
    开发方
    英伟达
    参数量(十亿)
    4
    获取方式
    开放权重(Hugging Face)
    发布日期
    2026-07-20
  • Isaac GR00T N1.7
    开发方
    英伟达
    参数量(十亿)
    3
    获取方式
    开放权重,商用许可
    发布日期
    2026-04-17
  • Gemini Robotics On-Device 2
    开发方
    谷歌DeepMind
    参数量(十亿)
    无数据
    获取方式
    仅限受信测试者
    发布日期
    2026-07-30
  • S1
    开发方
    Skild AI
    参数量(十亿)
    无数据
    获取方式
    早期访问申请
    发布日期
    2026-08-18

参数量以开发方页面或模型卡披露为准,未披露为null。GR00T N1.7日期为英伟达早期访问公告日。

截至 2026年10月1日

通俗地说,世界模型预测场景接下来会变成什么样。Cosmos 3 Edge把这种能力用在两个方向:生成或分析视频,以及预测让场景朝目标变化所需的电机指令。两者都在本体上运行,可省去云端调用的网络时延,摄像头画面也不出现场,这对工厂和公共场所的数据合规都很重要。

局限在英伟达自己的数据里。用256颗GB200训练68小时后闭环成功率仅22.9%,说明Edge是研究和原型开发底座,而非可部署的操作策略。1.53秒的推理时间适合慢速桌面任务,但不足以应对快速动态动作。在已审阅的发布材料中,英伟达未说明Cosmos 3 Edge的商用许可条款,也未公布量产部署案例。

ROBOTNESS 分析

英伟达正把机器人模型层做成标准件,让每家机器人厂商都离不开它的芯片;Cosmos 3 Edge把这一策略从数据中心延伸到机器人自己的计算机。

证据在于产品组合。开放权重、GitHub后训练配方、在常见Franka机械臂上采集的数据集降低了入门成本,而所有公布的指标都跑在英伟达芯片上,从训练用的GB200到推理用的Jetson Thor。评估方名单横跨韩国协作机器人厂商、德国工业集团和美国融资规模最大的机器人大脑初创公司之一。

最有力的反方观点是,22.9%的成功率意味着Edge更像演示而非产品,厂商会用GR00T或自研模型做专用动作策略,Cosmos只用于合成数据。那样的话,Edge模型很难为英伟达带来Jetson之外的增量收入。

乐观情形:厂商在仿真数据和本体推理上都以Cosmos为标准,Jetson Thor成为机器人计算机默认选项,蒸馏模型在一年内缩小成功率差距,新的人形和协作机器人默认搭载英伟达芯片出货。

悲观情形:谷歌、Skild和中国模型开发商在操作能力上超过Cosmos,厂商为推理选择更便宜的芯片,Cosmos只停留在训练环节;开放权重反而帮助对手对标英伟达、缩小差距。国产端侧芯片若在价格上占优,这一情形在中国市场更可能出现。

值得关注的信号:

  • 2026年底前Doosan Robotics、西门子或Agile Robots是否发布在本体上搭载Cosmos 3 Edge的产品。
  • 宇树科技能否在2026年底交付Isaac GR00T参考人形机器人。
  • Cosmos 3 Edge或蒸馏版本在RoboLab闭环评测中能否超过22.9%的基线。
要点
发布日期
2026年7月20日(SIGGRAPH)
参数量
40亿(基于Nemotron的20亿参数推理模块)
Jetson Thor内存占用
BF16约9GB
动作输出
每次推理32个动作,Jetson AGX Thor T5000上约1.53秒
视频分析时延
RTX上1080p最快22毫秒,L40约30毫秒
闭环成绩
RoboLab 120项操作任务成功率22.9%
后训练数据
Cosmos3-DROID,7.6万条轨迹,约350小时
机器人评估方
Agile Robots、Doosan Robotics、西门子、Skild AI
开放方式
Hugging Face开放权重,GitHub代码
来源
ROBOTNESS 情报版
  1. 01

    为何重要

    英伟达把Cosmos 3 Super和Nano定位于数据中心任务,例如机器人和自动驾驶模型的后训练。Edge则把同一家族的模型放到机器人上,在Jetson Thor约9GB内存内同时完成视频分析和动作生成。

    这改变了整机厂的采购逻辑。数据生成(Cosmos Super、Nano)、仿真(Isaac Sim、Isaac Lab)、策略模型(GR00T N1.7)和本体推理(Cosmos 3 Edge)都可由英伟达一家的技术栈覆盖。用得越多,推理芯片换供应商就越难。

  2. 02

    竞争对手分析

    模型能力上最接近的对手是谷歌DeepMind,但走云端优先、封闭路线,Gemini Robotics On-Device 2仅对受信测试者开放。Skild AI用英伟达工具训练自有专有大脑,既是客户也是潜在对手。

    对中国企业而言,英伟达的开放权重可本地部署,契合数据不出境要求,但端侧推理依赖Jetson又带来供应链风险。国内具身智能公司和端侧芯片厂商若能在开源世界模型和国产芯片上形成组合,将是英伟达方案的直接替代。

  3. 03

    估值背景

    Cosmos 3 Edge本身不定价,其价值体现在英伟达硬件需求上。参考人形机器人核心的Jetson AGX Thor T5000提供2070 FP4 TFLOPS和128GB内存,每台在本体上运行Cosmos 3 Edge或GR00T的机器人都需要这一级别的模组。

    合作方资金实力雄厚。Skild AI于2026年1月以逾140亿美元估值融资14亿美元,英伟达旗下NVentures参投;Doosan Robotics为上市公司。它们的采用决定将显示开放模型能否大规模带动硬件销售。

  4. 04

    供应链影响

    据英伟达介绍,Cosmos 3 Edge基准训练用64个4卡GB200节点,耗时约68小时;推理在Jetson Thor模组上运行,并支持新的T2000和T3000。后训练数据采集于Franka Panda机械臂和Robotiq夹爪,这些部件成了复现结果的事实标准硬件。

    Isaac GR00T参考人形机器人采用宇树H2 Plus底盘和Sharpa Wave触觉手。中国本体厂商由此进入英伟达开放机器人平台的核心位置;对国内关节模组、减速器和灵巧手企业来说,借道宇树进入英伟达参考设计,是比直接对接英伟达更现实的路径。

  5. 05

    后续看点

    一是Doosan Robotics、西门子、Agile Robots或Skild AI是否从评估走向在产品中搭载Cosmos 3 Edge。二是RoboLab闭环成绩能否超过22.9%,尤其是蒸馏版本。

    三是宇树制造的GR00T参考人形机器人2026年底交付情况,斯坦福、苏黎世联邦理工、加州大学圣迭戈分校和Ai2已被列为早期采用方。四是Cosmos 3 Edge商用本体部署许可条款是否明确。

  6. 06

    分析师观点

    核心判断:Cosmos 3 Edge与其说是机器人大脑,不如说是拉动硬件销售的工具,把英伟达开放模型策略延伸到机器人本体计算机。对战略的置信度:高;对普及速度的置信度:中。发布材料本身显示,所有训练和推理指标都基于英伟达芯片,评估方也多来自其现有合作伙伴。

    普及速度置信度较低,是因为22.9%的操作成绩距量产质量甚远,且尚无评估方宣布产品出货。我们预计Cosmos 3 Edge将首先用于本体视频分析和数据生成,动作控制要等进一步后训练之后。

  7. 07

    值得追问的问题

    Cosmos 3 Edge在客户机器人上商用部署适用何种许可?在人形机器人而非单一Franka机械臂上表现如何?

    蒸馏模型在Jetson Thor上生成动作(而非仅视频)能快多少?宇树H2 Plus参考机是否会预装Cosmos 3 Edge?国内厂商能否在不依赖Jetson的情况下运行该模型?