METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

AI 术语词典ㅂ报道中常见的技术词

Video Language Model

能够理解视频中的场景、人物与动作,并用自然语言描述或检索这些内容的AI模型

简单来说

视频语言模型是一种能够观看视频并理解其中内容的AI。可以把它想象成过去有人从头到尾看完一段录像,一边记笔记记录什么内容出现在哪里——现在这个模型能自动扫描视频,替人完成这项工作。

举例来说,输入一段视频后,这个模型会把画面切分成不同场景,并用自然语言描述每个场景中出现了谁、发生了什么动作、出现了什么物体。这样一来,即使事先没有人手动打标签,之后也可以直接用语言搜索——比如楼梯、奔跑的人群、雨中的足球射门——立刻找到对应的场景。它也被用来自动标记暴力、血腥等需要过滤的画面。

在电视台或媒体公司这类堆积如山的影像资料库里,这类模型能把仓库里的录像变成可检索的数据。

在报道中是这样出现的

文章介绍,Twelve Labs的视频语言模型Pegasus会将视频按场景切分,并依照合规分类自动标记涉及暴力、血腥、毒品等内容的场景。这里容易让人混淆的一点是,该模型不只是单纯识别画面本身,还会结合对白内容与音频信号来综合判断场景的含义。也就是说,它不只是看画面,而是对整段视频进行综合理解,并用自然语言表达出来。

亲手试一试

在视频搜索或档案工具中输入自然语言提问,可以直观体会视频语言模型的工作方式。

  1. 打开一个具备视频搜索功能的工具。
  2. 不使用标签,而是输入描述情境的句子,例如:身穿白色球衣的选手在雨中从左向右射门的场景。
  3. 查看搜索结果中的场景与实际条件的匹配程度。
  4. 逐一增加条件,将其变成更复杂的句子,比较搜索准确度会如何变化。

相关词条

出现过这个词的报道

浏览全部词条