Vision-Language-Action Model
一种让机器人理解看到的画面和听到的指令后,直接生成动作命令的人工智能结构
简单来说
Vision-Language-Action 模型(VLA)是一个前后连贯的系统,它让机器人先同时理解摄像头看到的画面和人用语音或文字给出的指令,然后直接计算出四肢该如何移动。
打个比方,这就像一名导游。导游用眼睛观察周围景色(视觉),听懂客人说的话(语言),然后真正带路走过去(行动)。VLA 也是同样的道理:摄像头看到一个杯子,接到"把杯子拿起来"的指令后,就能一次性算出手臂各关节需要转动多少度。
这类模型通常是在已经预先训练好、能理解图片和文字的现有人工智能之上,再加装一个负责身体动作的新模块而成。不过有观点指出,这种方式虽然擅长用语言描述画面,但在预测物体被抓握时如何受压变形等物理变化方面较弱。因此,最近也出现了尝试用视频代替文字来预先学习物理现象的模型。
在报道中是这样出现的
文章中提到:"现有的 Vision-Language-Action(VLA)模型是在预训练的视觉-语言模型上添加动作模块的方式。"这里容易产生的误解是,认为 VLA 是驱动机器人的唯一方法。实际上它只是多种方案中的一种,在这篇文章中,NVIDIA 就提出了另一种思路,即用视频而非语言来学习物理现象。
