
이미지: METAL LAB 생성
摘要
- Wan官方账号于8月11日(UTC)发布了开源角色动画模型的后续版本Wan-Animate-2
- 官方列出了四项升级内容:高保真角色动画、多角色、文本指令镜头视角、实时流式生成
- 权重、演示和文档同步公开,以可直接下载运行的形式发布
- 모델명
- Wan-Animate-2
- 발표 주체
- Wan 공식 계정(@Alibaba_Wan)
- 발표 시점
- 2026년 8월 11일(UTC)
- 성격
- 오픈소스 캐릭터 애니메이션 모델의 대규모 업그레이드
- 핵심 기능
- 고충실도 캐릭터 애니메이션, 다중 캐릭터 애니메이션
- 제어 방식
- 텍스트로 카메라 시점 지정
- 생성 방식
- 실시간 스트리밍 생성
- 공개 자료
- 가중치(weights), 데모, 문서
不是一个人,而是多个人同时在同一画面中表演。摄像机角度用句子来指示。生成的视频也无需等待全部完成。这些正是阿里巴巴视频模型系列Wan于8月11日(UTC)通过官方账号发布的Wan-Animate-2所展示的内容。
新增了什么
Wan方面提出的升级共有四项。公告篇幅很短。仅列出了项目条目,基准测试分数或参数规模等具体数值并未包含在此次发布中。不过官方表示已同步公开权重、演示和文档——也就是说,这不是仅有论文的预告,而是现在就能下载运行的正式发布。
| 项目 | 原文表述 | 含义 |
|---|---|---|
| 高保真 | High Fidelity Character Animation | 角色的面部、服装、细节在每一帧中都保持不变形 |
| 多人物 | Multi-Character Animation | 一个场景中同时驱动两个以上角色 |
| 摄像机控制 | Text-Controlled Camera Viewpoint | 用句子指示视角、角度 |
| 实时 | Real-Time Streaming Generation | 无需等待生成完成即可流式输出 |
角色动画为何棘手
Wan-Animate系列所做的事,不同于用一行文字重新生成视频。它接收一张静态角色图像和一段真人实际动作的参考视频,将其中的动作和表情移植到角色身上。这相当于动画师手工完成的重定向(retargeting)工作。
难点在于一致性。脸部可能在几帧之后微妙地变成另一个人,衣服的花纹可能悄然改变,手指也可能糊成一团。当登场人物增加到两人以上时,难度会再度跳升。模型开始搞不清哪只手臂属于谁,两人重叠的瞬间边界就会崩溃。这正是"多角色"被单独列为一个项目加以强调的原因。
实时流式生成则是另一回事。视频生成通常需要在提交请求后等待数十秒到数分钟。如果能做到边生成边输出,就能为直播主播的虚拟形象或实时角色演出等场景打开应用空间。不过此次发布并未说明是在多少帧率、多高分辨率下实现"实时"。
与Wan3.0的定位不同
虽同属Wan系列,但角色有所区分。8月6日(UTC)以公开测试版发布的Wan3.0,主打原生生成30秒长视频,并支持文本、图像、语音、视频乃至文档和幻灯片作为参考输入的Omni-Reference功能,是一款覆盖面广的通用生成器。
而Wan-Animate-2则处于另一端,更接近于让特定角色按照特定表演动作运动的专用工具。对创作者而言,这正是需要更强控制权的那类工作。
开放权重一方的策略
视频生成竞争正沿着两条路径展开。一条是仅通过API和网页服务使用的封闭形态,另一条是开放权重、让任何人都能在自己设备上运行和修改的开放形态。中国的研究机构一直在积极推进后者,而Wan正是这一趋势的代表之一。
一旦权重公开,微调和工作流工具就会随之涌现。针对特定角色进行追加训练、嵌入本地流水线、与其他模型拼接组合等实验,会在社区中以天为单位持续涌现。这也是即便封闭模型在质量上领先,开放模型往往能更早渗透进实际制作现场的原因。
这会带来什么改变
对于制作网络漫画、虚拟角色或短视频广告的人来说,这意味着有机会摆脱过去那种靠拼接单人镜头来搭建场景的方式。如果能一次性生成两个人物面对面对话的镜头,整个剪辑流程本身就会缩短。用句子指示镜头角度的功能,也让人无需绘制分镜就能尝试改变视角。
不过,简短的发布文案与实际质量之间的差距,向来是由社区来填补的。Wan-Animate-2究竟能撑到什么程度,几天之内运行公开权重的结果就会给出答案。目前可以确认的只有一点——用于驱动角色的工具,正试图从等待渲染转向边生成边输出。


