产业
什么是VLA(视觉-语言-动作)模型,谁在研发
VLA(视觉-语言-动作)模型是一种把摄像头画面和自然语言指令一并读入、直接输出机器人下一步电机指令的单一神经网络,做法是在能看懂图像的视觉语言模型上再用机器人示范数据训练。谷歌DeepMind、Physical Intelligence、英伟达、Figure AI与Skild AI处于前列,智元机器人代表中国阵营,竞争焦点正从模型结构转向动作数据的获取成本。
每一笔融资、每一次发布、每一篇论文,随报道即时呈现。
VLA(视觉-语言-动作)模型是一种把摄像头画面和自然语言指令一并读入、直接输出机器人下一步电机指令的单一神经网络,做法是在能看懂图像的视觉语言模型上再用机器人示范数据训练。谷歌DeepMind、Physical Intelligence、英伟达、Figure AI与Skild AI处于前列,智元机器人代表中国阵营,竞争焦点正从模型结构转向动作数据的获取成本。