图片:@AIatMeta (X)(视频截图)
摘要
- Meta于9月23日在Meta Connect 2026上发布Muse Realtime Avatar,这一实时模型可把Muse的声音变成可互动的虚拟形象。
- Meta把40步的教师模型蒸馏成2步的学生模型,计算量降至原来的六十分之一,模型以每秒25帧输出448x768视频,延迟约870毫秒。
- 在Meta自己的评测中,整体偏好度对Runway Characters为78%,对HeyGen LiveAvatar为88%。
Meta于美国时间9月23日在年度活动Meta Connect 2026上发布了Muse Realtime Avatar,这是一款为个人AI智能体Muse加上面孔和肢体语言的实时视频模型。首席执行官马克·扎克伯格在主题演讲台上亲自介绍了它。该模型由Meta超级智能实验室打造,可把Muse的语音模型Muse Realtime Voice变成有表情、能互动的虚拟形象。据Meta介绍,它首先用于Muse应用中的实时对话。
虚拟形象的外观来自用户选择的参考图像。根据Meta的研究博客,人物照片会以细微的表情回应,全身插画会在说话时做手势、变换姿势,动物和日常物品也能在保留各自特征的同时拥有表情。公司表示,即使对话来回多轮,虚拟形象的外貌和习惯动作也会逐帧保持一致。
扎克伯格在台上说:“我们训练了一个全新的最先进实时模型,在你和Muse对话时为它生成欢快的动画。”他还说:“正是这些细节成就了体验。”在Meta发布于X的2分2秒演示视频中,头戴月桂冠、身披托加袍的虚拟形象阿格里帕向观众打招呼后,与扎克伯格讨论了一款可挂在钥匙扣上的小设备Project Charm的表面材质和部件布局。Meta同日预告了专为与Muse对话打造的口袋大小设备Muse Charm,并表示将在今年晚些时候公布更多细节。
这项技术的核心是让声音和视频共享同一数据流的结构。据Meta介绍,Muse Realtime Voice输出的语音标记同时包含说了什么和怎么说;在音频解码器把这些标记转成声音的同时,Muse Realtime Avatar接收同样的标记生成视频。公司解释说,共享同一数据流让声音、口型和表情保持同步。该模型是由音频驱动的扩散Transformer,以短片段为单位生成视频,只把每个片段的最新结果作为下一片段的动作上下文传下去,因此对话再长,计算量也保持有界。

速度来自蒸馏。Meta表示,它把每个片段需要40步扩散加三路无分类器引导、共运行120次模型的大型教师模型,压缩成无需引导、两步即可完成的学生模型。计算量降至六十分之一,而人工评审的偏好度为学生45%、教师55%,接近各半。公司解释说,让学生用自己生成的上下文进行训练的自强制技术,可防止长对话中误差累积导致画面走样。
Meta还公布了与商用虚拟形象服务的比较结果。评审员在Runway的Runway Characters和HeyGen的HeyGen LiveAvatar各自产品的实时通话界面中,以相同的形象各进行2到3分钟对话,然后比较体验。在整体偏好度上,Muse Realtime Avatar对Runway Characters为78%,对HeyGen LiveAvatar为88%。分项来看,面部表现力为93%和92%,口型同步为78%和94%;Meta表示,与Runway Characters在习惯动作上的比较为56%,在统计上与持平无法区分。

服务指标同样具体。据Meta介绍,该模型以每秒25帧输出448x768竖屏视频,从用户说完话到收到声画同步回应的第一个字节约需870毫秒。在一块NVIDIA GB200上运行单个会话时,每个生成步骤可在20毫秒内生成8帧,相当于320毫秒的播放时长。公司表示,借助4位量化感知训练以及与NVIDIA合作的优化,服务容量比两步BF16基准提升8倍,一块GB200可同时承载12个实时会话。
作为安全措施,Meta加入了水印。公司表示,Muse Realtime Avatar会用自家的Meta Video Seal技术在生成的整段视频中嵌入不可见且难以去除的水印,且不增加延迟。Meta注明,博客中的示例展示的是模型能力,并非都是Muse应用中可用的虚拟形象;Muse仅供18岁以上用户使用。公司没有说明虚拟形象何时进入应用。
虚拟形象只是当天众多Muse发布中的一项。Meta还同时发布了通过描述来设计声音的语音模式、未来几个月内在AI眼镜上喊名字即可唤醒的Muse、Muse专属电子邮件地址、可在Mac上直接操作应用的计算机使用功能,以及与沃尔玛、百思买、丝芙兰等零售商的购物连接。据报道,扎克伯格在主题演讲中说“我们所打造的一切的核心是Muse”,并表示将“免费提供大量标记的Muse,预计随着时间推移,通过从交易中收取少量费用来获利”。
Muse上线才几周。METAL曾报道Meta于9月初推出个人智能体Muse,而Meta在此次发布中写道,上线后的反响“令人惊叹”。在应用、WhatsApp、网页和Mac桌面版之后,Meta正把接触Muse的渠道扩展到眼镜和专用设备。
综合METAL查看的演示视频和研究博客来看,Meta要卖的与其说是模型性能,不如说是存在感。一张能在870毫秒内配合表情和口型作答的面孔,让智能体感觉不再像工具,而更像对话的另一方;Meta则把这张面孔放在了免费标记加交易手续费的商业模式之上。比较评测由Meta自行设计,应用上线时间也尚未确定,但每块GB200承载12个会话的数字,可以解读为面向数十亿用户推广的算盘已经打好。




评论