ROBOTNESS
新闻

Wire

每一笔融资、每一次发布、每一篇论文,随报道即时呈现。

1 篇报道
6小时前
产业US

什么是VLA(视觉-语言-动作)模型,谁在研发

VLA(视觉-语言-动作)模型是一种把摄像头画面和自然语言指令一并读入、直接输出机器人下一步电机指令的单一神经网络,做法是在能看懂图像的视觉语言模型上再用机器人示范数据训练。谷歌DeepMind、Physical Intelligence、英伟达、Figure AI与Skild AI处于前列,智元机器人代表中国阵营,竞争焦点正从模型结构转向动作数据的获取成本。