Multimodal Media Embedding
一种把视频、声音、文字等不同形式的内容转换成统一数字坐标,从而能够按语义进行比较和检索的技术。
简单来说
多模态媒体嵌入(Multimodal Media Embedding)是一种把视频、声音、文字等不同形式的内容,转换成计算机可以互相比较的一组数字坐标的技术。
设想一下:广播公司仓库里堆满了录像带,里面到底录了什么,只有负责人手写在笔记本上才知道。一旦这个人离职,就没人清楚内容是什么了。这项技术相当于替代了那个负责人:它会扫描视频中的画面、人物说的话,乃至背景声音,然后把每个瞬间的特征压缩成一个坐标,就像指纹一样。照片、视频、声音尽管形式不同,最终都落在同一个坐标系上,因此可以通过计算来比较它们彼此有多相似。
一旦生成了坐标,即便没有人提前打好标签,也能进行检索。如果有人输入一句话,比如“楼梯”或“雨天投篮的画面”,这句话也会用同样的方式转换成坐标,系统就会找出坐标最接近的那些瞬间。正是这种坐标转换,才让按语义搜索(而不是靠标签搜索)变得可能。
在报道中是这样出现的
文章介绍称,Twelve Labs 的多模态媒体嵌入模型 Marengo 驱动着这种基于语义的搜索。容易让人误解的一点是,这项技术本身并不是搜索框或服务本身。它只是把内容转换成坐标的底层工作,真正的搜索是由另一个比较这些坐标的系统来完成的。
亲手试一试
在使用带有视频搜索功能的服务时,试着不用标签或关键词,而是直接输入描述情景的完整句子来搜索。比如输入像“雨天里从左向右投篮的白衬衫球员”这样具体的描述,看看即使没有人提前打标签,结果是否依然能出来。这样你就能切身感受到这项技术究竟在做什么。
