ROBOTNESS
研究阅读约 1 分钟ROBOTNESS 编辑部韩国

RSS 2026最佳论文FlashSAC:单张显卡把人形机器人行走训练从数小时压缩到20分钟

由Holiday Robotics、韩国KAIST、KRAFTON、德国达姆施塔特工业大学、瑞典KTH等机构研究人员完成的离策略强化学习方法FlashSAC,获得2026年7月在悉尼举行的RSS 2026杰出论文奖。作者称在单张RTX 5090上训练宇树G1平地行走策略约需20分钟,而主流方法PPO约需3小时。

摘要

据RSS官网获奖页面,离策略强化学习方法FlashSAC获得机器人学会议Robotics: Science and Systems(RSS)2026杰出论文奖。本届会议于2026年7月13日至17日在澳大利亚悉尼举行。论文作者称,该方法训练人形机器人行走控制器的速度约为业界主流方法的十倍,且只需一张消费级显卡。

研究团队

13位作者分别来自Holiday Robotics、韩国科学技术院(KAIST)、KRAFTON、Turing Inc、德国达姆施塔特工业大学、hessian.AI、瑞典皇家理工学院(KTH)、德国人工智能研究中心(DFKI)和德国机器人研究所(RIG)。资深作者包括达姆施塔特工业大学的Jan Peters、KTH的Danica Kragic、KAIST的Jaegul Choo以及Hojoon Lee。论文于2026年4月以arXiv预印本(2604.04539)形式首发,代码发布在GitHub的Holiday-Robot组织下。

关键数据

作者报告,在29自由度的宇树G1人形机器人上,FlashSAC学会平地行走约需20分钟训练,而在机器人运动控制中占主导地位的同策略算法PPO约需3小时。复杂地形和爬楼梯任务中,FlashSAC约需4小时,PPO约需20小时。所有时间均在单张英伟达RTX 5090上测得,训练出的策略随后从仿真迁移到实体机器人。

在IsaacLab、MuJoCo Playground、ManiSkill和Genesis四个GPU仿真器的25项任务中,FlashSAC在15项低维任务上与PPO相当,在包括灵巧操作和人形行走在内的10项高维任务上明显领先,所用仿真步数为5000万步,PPO为2亿步。在DeepMind Control Suite、MyoSuite、HumanoidBench等基于CPU的40项任务中,作者称其在不做任务专门调参的情况下持续超过PPO、XQC、SimbaV2、TD-MPC2和MR.Q。项目页面显示,验证共覆盖10个仿真器、60余项任务。

方法解析

机器人强化学习大致分两类。PPO等同策略方法每次更新后丢弃经验,浪费但稳定。SAC等离策略方法把经验存入回放缓冲区反复利用,理论上更高效,但在关节众多的机器人上容易失稳。FlashSAC保留SAC的数据复用优势,同时解决了稳定性问题。

具体做法有两点。一是像大语言模型那样扩大规模:1024个并行仿真环境,回放缓冲区由常见的100万条扩大到1000万条,网络为6层、250万参数,批量2048,更新频率极低,每1024步数据只做2次梯度更新。二是通过多层归一化约束权重、特征和梯度的幅度,防止训练滑入不稳定区域。固定的探索目标和重复噪声机制,则让仿真机器人尝试更长、更平滑的动作。

竞争格局

由于结果可预期,PPO一直是多数人形机器人企业仿真到真机行走训练的默认选择。TD-MPC2、SimbaV2、MR.Q等更快的替代方案在基准测试中有所斩获,但在完整人形机器人上落地的案例很少。FlashSAC的卖点是在真实硬件上弥合了这一差距。所用仿真器之一英伟达IsaacLab是人形机器人企业最常用的训练环境,因此可直接接入现有流程。

对中国产业的意义

实验平台选用宇树G1,再次印证宇树在全球研究界的标准平台地位。宇树已于2026年8月在上交所科创板上市,其整机在海外实验室的普及度正转化为生态影响力。对国内整机厂而言,训练时间就是工程时间:一天才能训完的行走控制器缩短到20分钟,意味着每周可测试的设计、奖励函数和硬件改动大幅增加。只需一张显卡而非集群,也降低了初创公司和高校团队的门槛。该算法在国产算力上的表现仍有待验证。

风险与疑问

数据为作者自测,且标注为近似值。训练时间对比取决于PPO的调参质量,两种方法的步数预算也不同。真机验证仅限宇树G1一个平台和行走任务。在接触密集的真实操作任务中提速能否保持,尚未得到证明。

ROBOTNESS 分析

FlashSAC是迄今为止离策略强化学习可取代PPO成为机器人本体训练行业默认方法的最有力证据,它把竞争优势从算力预算转向迭代速度。

证据包括:真机平地行走训练时间缩短约九成,复杂地形缩短约八成;优势集中在高维任务;无需逐任务调参即覆盖60余项任务;并获得该领域最严格会议奖项的认可。

最有力的反驳是,PPO的吸引力从来不只是速度,而是可预期性。叠加多种归一化技巧的离策略方法,在更换机器人、奖励或仿真器时可能表现脆弱。

乐观情形:代码已开源,人形机器人和灵巧手厂商数月内即可替换使用,开发周期缩短、GPU开支下降。离策略学习进一步延伸到真机微调,在数据最昂贵的环节发挥作用。

悲观情形:复现显示在PPO充分调参后优势缩小,该方法停留在学术热点,企业量产控制器仍用PPO。真实操作任务结果不及仿真。

值得关注的信号:

  • CoRL 2026等场合在其他人形机器人上的独立复现结果
  • FlashSAC是否被纳入IsaacLab或MuJoCo Playground官方示例
  • 2026年至2027年初是否有国内外整机厂在技术报告中采用FlashSAC
FlashSAC与PPO在宇树G1上的训练时间(单张RTX 5090)
  • 平地行走
    FlashSAC(分钟)
    20
    PPO(分钟)
    180
    PPO/FlashSAC(倍)
    9
  • 复杂地形与楼梯
    FlashSAC(分钟)
    240
    PPO(分钟)
    1200
    PPO/FlashSAC(倍)
    5

作者报告的近似训练时间(约20分钟对约3小时,约4小时对约20小时)。倍数 = PPO时间 / FlashSAC时间。GPU仿真基准中FlashSAC用5000万步,PPO用2亿步。

截至 2026年10月1日

要点
奖项
RSS 2026杰出论文奖
会议
2026年7月13日至17日,悉尼
预印本
arXiv 2604.04539(2026年4月)
机器人
宇树G1,29自由度
平地行走
约20分钟(PPO约3小时)
复杂地形与楼梯
约4小时(PPO约20小时)
硬件
单张英伟达RTX 5090
覆盖范围
10个仿真器,60余项任务
代码
GitHub开源(Holiday-Robot/FlashSAC)
来源
ROBOTNESS 情报版
  1. 01

    为何重要

    当前量产人形机器人的行走控制器大多在大规模并行仿真中用PPO训练。这是为稳定性而非效率做出的选择,并决定了企业的GPU预算和工程排期。FlashSAC以开源代码证明,一种复用数据的方法在完整人形机器人上可以既快又稳,动摇了这一前提。

    获奖本身也是信号。RSS今年只评出一篇杰出论文,并选择了训练算法论文而非硬件或系统论文,表明学界把机器人本体训练效率视为核心瓶颈。

  2. 02

    竞争对手分析

    在强化学习内部,FlashSAC的对手是SimbaV2、XQC、TD-MPC2、MR.Q以及GPU仿真器中的PPO。TD-MPC2等基于模型的方法以更高的单步算力换取样本效率,FlashSAC则押注低成本的大批量更新。

    在产业层面,快速强化学习的替代路线是示范数据学习和大型VLA。两者互补:VLA负责任务理解,强化学习控制器负责平衡和接触。能把两者结合的企业,比单纯依赖遥操作数据的企业更具优势。国内不少整机厂正大规模采集遥操作数据,训练效率的提升会改变数据与算法投入的配比。

  3. 03

    估值背景

    FlashSAC本身没有直接标价,其经济价值体现在成本上。复杂地形训练从约20小时GPU时间降到约4小时,同样硬件可多跑约5倍实验。

    对投资者而言,依靠算力规模训练运动控制的企业护城河被削弱,工程能力强的小团队受益。游戏公司KRAFTON出现在作者单位中,也说明非机器人领域的资本正在进入具身智能研究。

  4. 04

    供应链影响

    该方法运行在单张消费级RTX 5090以及IsaacLab、MuJoCo Playground、ManiSkill、Genesis等通用仿真器上。对英伟达的依赖不变,但需求可能从数据中心集群转向工作站。

    机器人端,低成本、普及度高的宇树G1成为验证平台,强化了宇树作为全球研究标准机型的地位,也有利于其关节电机和整机供应链。高维灵巧手训练加速,可能带动此前受制于控制复杂度的灵巧手需求,国内灵巧手厂商可从中受益。

  5. 05

    后续看点

    关注CoRL 2026及arXiv上的独立复现,尤其是真实灵巧手操作结果。若英伟达或MuJoCo团队把FlashSAC纳入官方示例,它将成为事实上的默认选项。

    同时关注托管代码的Holiday Robotics是否发布产品或融资消息,KAIST和KRAFTON的后续研究,以及国内整机厂和高校是否在国产GPU上复现该方法。

  6. 06

    分析师观点

    核心判断:FlashSAC有望在一年内成为机器人强化学习的标准基线,并可能在部分高维本体的量产流程中取代PPO。置信度:中。

    置信度为中,是因为提速数据为作者自测的近似值,真机验证只覆盖一款人形机器人的行走任务。开源代码、60余项任务的广泛验证以及RSS评审委员会的认可,支撑了这一判断。

  7. 07

    值得追问的问题

    迁移到新机器人时,FlashSAC对众多归一化设计有多敏感?在相同步数预算、精细调参的PPO面前,速度优势是否仍在?

    该方法能否用于每个样本都很昂贵的真机微调?在真实灵巧手而非仿真中表现如何?在国产GPU上能否获得相近的训练速度?