Multimodal Grounding
一种AI方式,把语言或文字传达的信息与图像、声音、动作等其他形式的信息连接起来,准确指出其实际所指的对象。
简单来说
多模态锚定是让AI把用语言或文字说明的内容,和图像、声音、手势等其他形式的信息结合在一起,从而清楚地指出这些内容实际指向的是什么对象。
想象一下问路的场景就容易理解。如果有人在电话里说“从左边数第二个门进去”,听的人就得在脑子里把这句话重新转换成眼前的实际空间才能明白。但如果站在旁边的人直接用手指指出那个门,这个转换过程就完全不需要了。多模态锚定就是要让AI更像是站在旁边用手指点给你看的人——不只是说出话来,还用别的方式把话所指的对象一并展示出来,省去用户把语言翻译成空间或物体的功夫。
这种方式变得重要,是因为AI处理的对象正在从屏幕上的文字,扩展到真实空间、实物或屏幕上的界面元素。像智能眼镜、机器人,或直接操作屏幕的程序这类语言和现实之间差距较大的场景中,仅靠语言很容易产生误解。因此多个研究机构都在尝试把语言与视觉、动作信息结合起来,缩小这种差距。
在报道中是这样出现的
文章提到“把视觉信息与语言绑在一起传达的多模态锚定研究正在多个实验室进行”,并以谷歌研究院的手势智能体AgentHands为例加以说明。容易被误解的一点是:多模态锚定并不是某个特定产品或功能的名称,而是泛指把语言与其他形式的信息连接到实际对象上的整个研究方向。
亲手试一试
找一个可以上传图片的聊天机器人,上传一张照片,然后这样问它:
请具体指出这张照片里电源按钮的确切位置。
对比一下回答是像“在右下方”这样笼统含糊,还是像“在扬声器图标右边,正好在插孔上方”这样结合照片中其他元素精准指出位置。回答越接近后者,说明多模态锚定做得越好。
