moment retrieval
在长视频中准确找出某个场景从第几秒开始、到第几秒结束的任务
简单来说
moment retrieval(时刻检索)是指在长视频中准确找出想要的场景具体出现在第几分第几秒的任务。
这就像不用把一部两小时的电影从头看到尾,只需问一句"主角把雨伞掉在地上的画面出现在几分几秒",就能直接得到答案一样。以前的方式要理解视频,必须像逐秒拍照一样把整段视频从头到尾都看一遍;而要做好这项任务,则需要在不看完整段视频的情况下,只挑出所需片段并准确定位其时间点。
视频越长,从头到尾全部扫一遍所需的时间和成本就越高。如果只需要在几个小时的录像中找出某一个瞬间,却要分析整段视频,就是一种浪费。因此,这项任务通常与"只挑选视频中必要部分进行查看"的能力搭配使用,从而在降低成本的同时,不错过想要找的那个瞬间。
在报道中是这样出现的
文章中提到:"像按秒定位特定瞬间的moment retrieval(时刻检索)、快速动作的精确计数、异常行为检测这类以往方式成本过高的任务,现在已经变得可行。"容易误解的一点是——moment retrieval并不是某个新AI模型的名字,而是指在视频中找出所需场景所在时间段这一任务本身。
亲手试一试
在支持上传视频文件的多模态聊天机器人中上传一段长视频,并按以下方式提问,就能体验moment retrieval。
- 向聊天机器人上传一段时长超过10分钟的视频文件。
- 提问:"请告诉我这段视频中[某个特定场景或台词]出现在第几分第几秒。"
- 比较一下回答给出的是精确的时间点,还是只是一个大致的区间。
