产业
什么是VLA(视觉-语言-动作)模型,谁在研发
VLA(视觉-语言-动作)模型是一种把摄像头画面和自然语言指令一并读入、直接输出机器人下一步电机指令的单一神经网络,做法是在能看懂图像的视觉语言模型上再用机器人示范数据训练。谷歌DeepMind、Physical Intelligence、英伟达、Figure AI与Skild AI处于前列,智元机器人代表中国阵营,竞争焦点正从模型结构转向动作数据的获取成本。
每一笔融资、每一次发布、每一篇论文,随报道即时呈现。
VLA(视觉-语言-动作)模型是一种把摄像头画面和自然语言指令一并读入、直接输出机器人下一步电机指令的单一神经网络,做法是在能看懂图像的视觉语言模型上再用机器人示范数据训练。谷歌DeepMind、Physical Intelligence、英伟达、Figure AI与Skild AI处于前列,智元机器人代表中国阵营,竞争焦点正从模型结构转向动作数据的获取成本。
韩国产业通商部5月29日公布M.AX联盟AI机器人分会成立一年成果:成员约280家,正与HD现代重工、SK能源和BGF推进行业专用人形机器人示范。部门还介绍了本土机器人基础模型、时速13公里的人形机器人下肢平台,以及设有人形机器人强制投资比例、目标5000亿韩元的专项基金。
2026北京亦庄人形机器人半程马拉松4月19日举行,超过100支人形机器人队伍参赛,来自13个省份,较上年的5省明显扩容;自主导航参赛比例约占40%。北京市政府披露,齐天大圣队“闪电”以50分26秒夺冠,人类男子冠军成绩为1小时07分47秒。