每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

阿里巴巴发布Wan-Animate-2,新增实时流式生成

开源角色动画模型升级,新增多人物、文本控制镜头功能

이미지: METAL LAB 생성

摘要

  • Wan官方账号于8月11日(UTC)发布了开源角色动画模型的后续版本Wan-Animate-2
  • 官方列出了四项升级内容:高保真角色动画、多角色、文本指令镜头视角、实时流式生成
  • 权重、演示和文档同步公开,以可直接下载运行的形式发布
原文视频
모델명
Wan-Animate-2
발표 주체
Wan 공식 계정(@Alibaba_Wan)
발표 시점
2026년 8월 11일(UTC)
성격
오픈소스 캐릭터 애니메이션 모델의 대규모 업그레이드
핵심 기능
고충실도 캐릭터 애니메이션, 다중 캐릭터 애니메이션
제어 방식
텍스트로 카메라 시점 지정
생성 방식
실시간 스트리밍 생성
공개 자료
가중치(weights), 데모, 문서

不是一个人,而是多个人同时在同一画面中表演。摄像机角度用句子来指示。生成的视频也无需等待全部完成。这些正是阿里巴巴视频模型系列Wan于8月11日(UTC)通过官方账号发布的Wan-Animate-2所展示的内容。

新增了什么

Wan方面提出的升级共有四项。公告篇幅很短。仅列出了项目条目,基准测试分数或参数规模等具体数值并未包含在此次发布中。不过官方表示已同步公开权重、演示和文档——也就是说,这不是仅有论文的预告,而是现在就能下载运行的正式发布。

项目原文表述含义
高保真High Fidelity Character Animation角色的面部、服装、细节在每一帧中都保持不变形
多人物Multi-Character Animation一个场景中同时驱动两个以上角色
摄像机控制Text-Controlled Camera Viewpoint用句子指示视角、角度
实时Real-Time Streaming Generation无需等待生成完成即可流式输出

角色动画为何棘手

Wan-Animate系列所做的事,不同于用一行文字重新生成视频。它接收一张静态角色图像和一段真人实际动作的参考视频,将其中的动作和表情移植到角色身上。这相当于动画师手工完成的重定向(retargeting)工作。

难点在于一致性。脸部可能在几帧之后微妙地变成另一个人,衣服的花纹可能悄然改变,手指也可能糊成一团。当登场人物增加到两人以上时,难度会再度跳升。模型开始搞不清哪只手臂属于谁,两人重叠的瞬间边界就会崩溃。这正是"多角色"被单独列为一个项目加以强调的原因。

实时流式生成则是另一回事。视频生成通常需要在提交请求后等待数十秒到数分钟。如果能做到边生成边输出,就能为直播主播的虚拟形象或实时角色演出等场景打开应用空间。不过此次发布并未说明是在多少帧率、多高分辨率下实现"实时"。

与Wan3.0的定位不同

虽同属Wan系列,但角色有所区分。8月6日(UTC)以公开测试版发布的Wan3.0,主打原生生成30秒长视频,并支持文本、图像、语音、视频乃至文档和幻灯片作为参考输入的Omni-Reference功能,是一款覆盖面广的通用生成器。

而Wan-Animate-2则处于另一端,更接近于让特定角色按照特定表演动作运动的专用工具。对创作者而言,这正是需要更强控制权的那类工作。

开放权重一方的策略

视频生成竞争正沿着两条路径展开。一条是仅通过API和网页服务使用的封闭形态,另一条是开放权重、让任何人都能在自己设备上运行和修改的开放形态。中国的研究机构一直在积极推进后者,而Wan正是这一趋势的代表之一。

一旦权重公开,微调和工作流工具就会随之涌现。针对特定角色进行追加训练、嵌入本地流水线、与其他模型拼接组合等实验,会在社区中以天为单位持续涌现。这也是即便封闭模型在质量上领先,开放模型往往能更早渗透进实际制作现场的原因。

这会带来什么改变

对于制作网络漫画、虚拟角色或短视频广告的人来说,这意味着有机会摆脱过去那种靠拼接单人镜头来搭建场景的方式。如果能一次性生成两个人物面对面对话的镜头,整个剪辑流程本身就会缩短。用句子指示镜头角度的功能,也让人无需绘制分镜就能尝试改变视角。

不过,简短的发布文案与实际质量之间的差距,向来是由社区来填补的。Wan-Animate-2究竟能撑到什么程度,几天之内运行公开权重的结果就会给出答案。目前可以确认的只有一点——用于驱动角色的工具,正试图从等待渲染转向边生成边输出。