ROBOTNESS
产品美国

谷歌DeepMind发布Gemini Robotics-ER 1.6,机器人读表准确率升至93%,波士顿动力Spot率先应用

谷歌DeepMind于2026年4月14日发布基于Gemini 3.0 Flash的具身推理模型Gemini Robotics-ER 1.6,并通过Gemini API和Google AI Studio开放预览。DeepMind称该模型读取工业仪表的成功率为86%,启用放大与代码执行的"智能体视觉"后达93%,而上一代ER 1.5仅为23%。波士顿动力已将这一能力用于Spot机器狗的设施巡检。

ROBOTNESS 编辑部阅读约 1 分钟

谷歌DeepMind发布Gemini Robotics-ER 1.6,机器人读表准确率升至93%,波士顿动力Spot率先应用 (ROBOTNESS 示意图)
摘要

谷歌DeepMind为其机器人推理模型增加了一项工厂现场急需的能力。2026年4月14日,这家Alphabet旗下机构发布专注具身推理的视觉语言模型Gemini Robotics-ER 1.6,并于当天通过Gemini API和Google AI Studio以"gemini-robotics-er-1.6-preview"的名称向开发者开放。最受关注的新功能是仪表读数,即看懂压力表、视镜或温度计并报出数值。

DeepMind自有基准测试显示了提升幅度。在仪表读数评测中,上一代Gemini Robotics-ER 1.5成功率为23%,通用模型Gemini 3.0 Flash为67%;ER 1.6达到86%,使用DeepMind所称的"智能体视觉"后升至93%。公司还表示,新模型在指点、计数以及多视角任务成功判定上均优于ER 1.5。

DeepMind基准测试中各模型仪表读数成功率
  • Gemini Robotics-ER 1.5
    成功率(%)
    23
    较ER 1.5提升(百分点)
    0
  • Gemini 3.0 Flash
    成功率(%)
    67
    较ER 1.5提升(百分点)
    44
  • Gemini Robotics-ER 1.6
    成功率(%)
    86
    较ER 1.5提升(百分点)
    63
  • Gemini Robotics-ER 1.6(智能体视觉)
    成功率(%)
    93
    较ER 1.5提升(百分点)
    70

成功率来自谷歌DeepMind 2026年4月14日发布博客。提升幅度 = 该模型成功率减去ER 1.5成功率。基准由DeepMind定义,未经独立复现。均为披露数字,非估算。

截至 2026年10月1日

所谓智能体视觉,是指模型不一次性作答,而是分步推理。根据DeepMind研究员Laura Graesser和Peng Xu撰写的博客,模型先放大图像看清表盘上的细小刻度,再借助指点和代码执行估算比例与间隔,最后给出读数。涉及的仪表包括圆形压力表、化工视镜、立式液位计、温度计和数字显示器等。

4月20日发布的模型卡显示,ER 1.6以Gemini 3.0 Flash为基础,可输入文本、图像、音频和视频,上下文窗口12.8万token,输出上限6.4万token;在谷歌TPU上以Gemini 3.0训练数据和额外的具身推理数据集训练。DeepMind明确表示,该模型未获准用于医疗、交通等安全攸关场景,或任何故障可能造成人员伤害、财产损失的环境。

现代汽车集团旗下的波士顿动力与DeepMind在该功能上密切合作。Spot四足机器人已能在工业设施内按路线巡检并拍摄设备图像,ER 1.6则让它能读懂所拍内容。波士顿动力副总裁Marco da Silva在DeepMind博客中表示,仪表读数和更可靠的任务推理将使Spot能够完全自主地观察、理解并应对现实问题。

ER系列在DeepMind机器人技术栈中分工明确。Gemini Robotics模型输出电机动作,ER模型负责"思考",包括判断物体位置、安排步骤顺序、确认任务是否完成。开发者可在自有机器人软件中调用ER 1.6并与任意控制器组合,这使其成为DeepMind机器人产品中覆盖面最广的一环。

安全评估是此次发布的重点之一。DeepMind用第二版ASIMOV人本安全基准测试ER 1.6,称其在指点和边界框任务上遵守物理安全约束的能力较ER 1.5大幅提升;与Gemini 3.0 Flash相比,文本安全场景提升6%,视频场景提升10%。

机器人推理模型赛道竞争激烈。英伟达向机器人企业提供Cosmos Reason模型和GR00T策略模型;Physical Intelligence与Skild AI训练将推理和动作合一的端到端模型。DeepMind的优势在于任何开发者都已在使用的商业API渠道,以及与谷歌旗舰Gemini系列的绑定。

对中国产业而言,这一进展值得重视。国内石化、电力、半导体工厂的巡检仍大量依赖人工按路线抄表,巡检机器人企业多采用针对特定仪表训练的专用视觉算法。通用大模型若能在不加装传感器的情况下读懂老旧设备的指针表,将改变巡检机器人的技术路线。阿里通义、字节跳动等国内大模型厂商以及宇树、云深处等四足机器人企业如何跟进,将决定国内是否形成类似的"模型加本体"巡检方案。由于该模型通过境外云端API提供,国内工业用户在数据出境方面也面临现实限制。

悬而未决的是可靠性与责任归属。93%对基准测试而言很高,但对危险设施的安全读数仍显不足,DeepMind自己的模型卡也排除了安全攸关用途。预览版的定价和正式商用时间尚未公布。

ROBOTNESS 分析

仪表读数让Gemini Robotics-ER从研究演示变成可销售的工业巡检组件,而Spot为谷歌提供了可信的首个客户渠道。

证据在于,一项有直接商业价值的任务成功率从23%跃升到86%和93%,且通过开发者已在付费使用的API提供。波士顿动力的公开背书把这一功能与一款已在工业巡检领域有装机基础的产品绑定,谷歌无需自造机器人即可触达付费用户。

最有力的反驳是,巡检客户需要的是经审计的准确率,而非基准分数。针对工厂自有仪表训练的专用视觉模型,或廉价的数字传感器改造,在可靠性和成本上可能胜过通用模型;模型卡本身也排除了安全攸关用途。

乐观情形。ER 1.6成为多家厂商巡检机器人的默认推理层,谷歌将预览版转为收费API产品,仪表读数扩展到泄漏检测、阀门检查等更广泛的维护任务。

悲观情形。运营方只把机器人读数当作参考,责任顾虑让部署停留在试点,主打认证准确率的专业巡检软件商赢得市场。

值得关注的信号。

  • gemini-robotics-er-1.6-preview的正式商用与定价,2026年4月14日发布时尚未公布。
  • 2026年内波士顿动力披露使用该功能的Spot巡检客户。
  • 国内大模型与四足机器人企业是否在2026年推出对标的通用读表巡检方案。
机器人基础模型企业最新披露融资
  • Skild AI
    成立年份
    2023
    最新披露轮次
    C轮
    金额(百万美元)
    1400
    投后估值(十亿美元)
    14
    日期
    2026-01-14
  • Figure AI
    成立年份
    无数据
    最新披露轮次
    C轮
    金额(百万美元)
    1000
    投后估值(十亿美元)
    39
    日期
    2025-09-16
  • Physical Intelligence
    成立年份
    无数据
    最新披露轮次
    B轮
    金额(百万美元)
    无数据
    投后估值(十亿美元)
    无数据
    日期
    2025-11-20
  • 1X Technologies
    成立年份
    2014
    最新披露轮次
    B轮
    金额(百万美元)
    100
    投后估值(十亿美元)
    无数据
    日期
    2024-01-13

依据公司或领投方公告。谷歌DeepMind为Alphabet内部机构,不对外融资。null表示未披露。均为披露数字,非估算。

截至 2026年10月1日

要点
发布日期
2026年4月14日
模型
Gemini Robotics-ER 1.6(gemini-robotics-er-1.6-preview)
基础模型
Gemini 3.0 Flash
开放方式
Gemini API与Google AI Studio预览
上下文
输入12.8万token,输出6.4万token
仪表读数成功率
86%,智能体视觉下93%
ER 1.5仪表读数
23%
首发伙伴
波士顿动力(Spot巡检)
安全基准
ASIMOV第二版
来源
ROBOTNESS 情报版
  1. 01

    为何重要

    多数机器人基础模型新闻关注实验室或家庭中的物体操作。ER 1.6瞄准的是一项狭窄但能收费的工业任务,即巡检中的仪表读数,并与已在销售巡检机器人的伙伴搭档。这是通用机器人模型通向持续工业收入最清晰的路径之一。

    此次发布也体现了谷歌在机器人领域偏好的商业模式。谷歌不造机器人,而是通过Gemini API出售推理能力,由波士顿动力等硬件企业集成,与通用Gemini模型的分发逻辑一致。

  2. 02

    竞争对手分析

    英伟达把Cosmos Reason模型、GR00T策略与Jetson硬件和仿真工具一起供应,意在掌控完整开发栈。Physical Intelligence和Skild AI训练端到端模型,与选定的硬件伙伴合作。

    具体到巡检领域,ER 1.6的对手与其说是基础模型实验室,不如说是成熟的工业视觉厂商和机器人企业的自研软件。瑞士ANYbotics就以ANYmal四足机器人搭配自有分析软件开展工业巡检。国内巡检机器人企业同样面临选择,是接入通用模型,还是坚持自研专用视觉。

  3. 03

    估值背景

    谷歌DeepMind不对外融资,没有直接估值参照。可比对象是独立模型企业,Skild AI最新以140亿美元估值融资14亿美元,Figure AI以390亿美元估值融资10亿美元。

    这些估值的前提是机器人智能成为独立的大市场。谷歌能把机器人推理捆绑进开发者已在使用的API,这迫使独立企业证明其模型在客户愿意付费的任务上表现更好。

  4. 04

    供应链影响

    ER 1.6在谷歌自研TPU上训练,研发不依赖英伟达GPU。部署时模型经API在谷歌云端运行,机器人需要联网;此次发布未提及端侧版本。

    对网络条件差或数据管理严格的工厂而言,云端依赖是实际约束。在中国,境外云API还涉及数据出境合规,这为主打端侧部署的国产模型和计算平台留出了空间。

  5. 05

    后续看点

    预览版的定价与正式商用将显示谷歌如何把机器人推理变现;波士顿动力关于Spot巡检客户的公告将显示该功能能否走出试点。

    还应关注其他机器人厂商是否宣布集成ER 1.6,以及DeepMind是否就仪表读数基准提供第三方验证。

  6. 06

    分析师观点

    核心判断:ER 1.6是谷歌迄今商业指向最明确的机器人发布,巡检是现实的首个市场。置信度:中等。基准提升幅度大、合作伙伴可信,但性能数据均为自报,且模型卡排除了安全攸关用途,巡检市场的一部分从一开始就被排除在外。

    若出现具名工业客户并公布实际运行中的错误率,置信度将上调;若预览版长期未定价、伙伴也未公布部署,则下调。

  7. 07

    值得追问的问题

    剩余7%的读数失败属于哪些类型,模型在不确定时是否会给出低置信提示?谷歌将如何为机器人推理调用定价,与普通Gemini API相比如何?

    波士顿动力是否对所有客户都采用云端ER 1.6,还是为受监管场所洽谈私有部署?DeepMind是否会为网络不稳定的机器人推出端侧ER模型?