METAL for iPhone
下载 METAL, 每天发现最新 AI 报道。
iPhone 应用 · 免费下载
也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。
AI 术语词典/ㅁ/使用中会遇到的词
Multimodal
不仅能理解文字,还能同时理解和生成图像、声音、视频的能力。
模态(modality)指信息呈现的形式——文字、图像、声音、视频。多模态就是指一个模型能同时处理这几种形式。
早期的语言模型只能读文字、写文字,就像一个没有眼睛和耳朵、只能靠书信交流的笔友。多模态模型可以看懂一张照片里的内容,听懂说话并用语音回应,还能理解夹杂着表格和图表的文档。
如今的主力模型(最新版GPT、Claude、Gemini)默认都是多模态的。这也是为什么「拍一张冰箱照片就能获得菜谱推荐」成为可能,也是新模型发布时「语音对话」「屏幕理解」演示必不可少的原因。
「强调了涵盖图像、语音、视频的多模态性能」——意思是文字之外的能力,尤其是「看和听」的能力,已成为产品的卖点。