Video Language Model
能够理解视频中的场景、人物与动作,并用自然语言描述或检索这些内容的AI模型
简单来说
视频语言模型是一种能够观看视频并理解其中内容的AI。可以把它想象成过去有人从头到尾看完一段录像,一边记笔记记录什么内容出现在哪里——现在这个模型能自动扫描视频,替人完成这项工作。
举例来说,输入一段视频后,这个模型会把画面切分成不同场景,并用自然语言描述每个场景中出现了谁、发生了什么动作、出现了什么物体。这样一来,即使事先没有人手动打标签,之后也可以直接用语言搜索——比如楼梯、奔跑的人群、雨中的足球射门——立刻找到对应的场景。它也被用来自动标记暴力、血腥等需要过滤的画面。
在电视台或媒体公司这类堆积如山的影像资料库里,这类模型能把仓库里的录像变成可检索的数据。
在报道中是这样出现的
文章介绍,Twelve Labs的视频语言模型Pegasus会将视频按场景切分,并依照合规分类自动标记涉及暴力、血腥、毒品等内容的场景。这里容易让人混淆的一点是,该模型不只是单纯识别画面本身,还会结合对白内容与音频信号来综合判断场景的含义。也就是说,它不只是看画面,而是对整段视频进行综合理解,并用自然语言表达出来。
亲手试一试
在视频搜索或档案工具中输入自然语言提问,可以直观体会视频语言模型的工作方式。
- 打开一个具备视频搜索功能的工具。
- 不使用标签,而是输入描述情境的句子,例如:身穿白色球衣的选手在雨中从左向右射门的场景。
- 查看搜索结果中的场景与实际条件的匹配程度。
- 逐一增加条件,将其变成更复杂的句子,比较搜索准确度会如何变化。
