Multimodal agent
不仅通过文本,还能交换图像、音频、视频、3D模型等多种形式资料来完成实际任务的AI智能体
简单来说
多模态智能体就像一个能力全面的助手,它不只是靠文字交流,还能看照片、听声音、制作视频,甚至处理立体模型。过去的聊天机器人只会用句子回答问题,而这种助手能同时调动多种感官:听鸟鸣辨别种类、看心脏超声影像判断是否异常、根据厨房照片画出家具布局图。
问题在于,这类结果并没有唯一的标准答案。不能像数学题那样核对数字,也不能像代码那样运行后判断通过或失败。因此在评估这种能力时,有时会让人或其他智能体把不同结果放在一起对比打分,判断哪一方更好。
归根结底,多模态智能体就是被设计出来处理那些混合了多种形式资料、单靠文本无法解决的实际工作的AI。
在报道中是这样出现的
Meta AI在介绍新的评分框架时表示,这是"在衡量多模态智能体实际带来的实用价值方面又向前迈进一步"的尝试。容易被误解的一点是,这并不是新模型发布的公告,而是公开了用来衡量多模态智能体能力的评分标准本身。
亲手试一试
- 在Meta AI开发者页面的任务查看器中,浏览鸟类声音分析、心脏超声判读、3D建模等任务列表。
- 选择一个任务,查看它的三个组成部分——指令(instruction)、输入资料(图像、音频、YAML)、评分标准(rubric)——是如何构成的。
- 把同一条指令分别输入两三个不同的AI聊天机器人,并排比较它们的结果(图像描述、表格、摘要等)。自己判断哪一方更好地遵循了指令,就能体会到没有标准答案的评估为何如此困难。
