Hugging Face
开源AI平台,机器人学习库LeRobot开发方。
- 什么是VLA(视觉-语言-动作)模型,谁在研发
VLA(视觉-语言-动作)模型是一种把摄像头画面和自然语言指令一并读入、直接输出机器人下一步电机指令的单一神经网络,做法是在能看懂图像的视觉语言模型上再用机器人示范数据训练。谷歌DeepMind、Physical Intelligence、英伟达、Figure AI与Skild AI处于前列,智元机器人代表中国阵营,竞争焦点正从模型结构转向动作数据的获取成本。
提及 - Hugging Face发布LeRobot 0.6:纳入世界模型与英伟达GR00T N1.7,开源机器人联盟加深
Hugging Face于7月7日发布开源机器人学习库LeRobot 0.6.0,新增3个世界模型策略、5个视觉语言动作模型(含英伟达GR00T N1.7)、2个奖励模型和6个仿真基准。英伟达前一天宣布,将GR00T、Isaac Teleop、Isaac Lab-Arena和Jetson Thor支持引入LeRobot,Cosmos 3也即将接入。
主体 - 英伟达推出科研用参考人形机器人,宇树H2 Plus本体搭配Sharpa灵巧手与Jetson Thor
英伟达于2026年6月1日在GTC台北发布面向学术研究的Isaac GR00T参考人形机器人,采用宇树科技H2 Plus本体、两只22自由度的Sharpa Wave触觉灵巧手和Jetson AGX Thor T5000计算模组。该机将于2026年底由宇树供货,价格未披露。
提及 - 英伟达预览GR00T N2:押注先预测视频再行动的世界动作模型
英伟达于2026年3月16日GTC主题演讲中预览基于DreamZero研究的新一代机器人基础模型GR00T N2,称其在新环境新任务中的成功率是领先VLA模型的两倍以上。30亿参数的GR00T N1.7进入商业许可抢先体验,DreamZero的主要实验平台为智元G1。N2计划于2026年底前推出。
合作方