摘要
- LTX.io宣布,实时对话虚拟人"Reactor(@reactorworld)"采用LTX技术,实现逐帧即时流式生成画面
- 关键在于并非播放预先制作好的视频,而是在生成回答的过程中画面不会卡顿
- LTX于8月11日发布开放权重视频模型LTX-2.5,此前曾展示在RTX GPU上6.8秒内生成10秒片段的速度
卡顿的虚拟人不是真正的虚拟人
对话式AI虚拟人在思考答案时画面突然静止的场景,并不陌生。人一开口,虚拟人便僵住几秒钟再重新动起来,这个间隙正是"恐怖谷(uncanny valley)"——与人相似但又不完全相同,反而让人感到别扭的区间。视频生成初创公司LTX于8月14日通过X宣布,已推出能消除这一间隙的实时对话虚拟人。作为应用案例被提及的是对话式虚拟人服务"Reactor(@reactorworld)"。
何为逐帧实时流式传输
LTX方面解释称:"LTX是按帧对视频进行流式传输,而不是预先渲染完成后再播放。"一般的视频生成AI会先整体计算出数秒长度的片段,再展示给用户——这段计算时间正是用户所感受到的"卡顿"。LTX所强调的正是彻底去除了这种"先计算、后播放"的结构。由于即便在生成回答的过程中,画面也会持续以帧为单位不断输出,因此虚拟人看起来就像在真正进行实时对话一样。据称Reactor正利用这一速度打造学习体验(learning experiences),但此次发布并未透露具体的服务形式或面向的年龄段、科目等信息。
背景:LTX-2.5的速度是基础
正如METAL LAB此前于8月12日报道的那样,LTX于8月11日发布了开放权重视频生成模型LTX-2.5,降低了显存需求,使其能够在消费级NVIDIA RTX显卡及DGX Spark上本地运行。当时的本地基准测试(基于2x GB200)显示,10秒片段仅需6.8秒即可生成,相比通过API生成同一片段所需的23.7秒快出3倍以上。此次公布的实时虚拟人功能,可以看作是这一速度优势转化为实际应用案例的结果。相比整体计算后再输出片段的方式,即时推送帧的方式对于对话式服务而言明显更具优势。
虚拟人响应方式对比
| 方式 | 处理流程 | 体感延迟 |
|---|---|---|
| 传统方式(预渲染) | 整体计算片段 → 播放 | 70 |
| LTX帧流式传输 | 逐帧计算与播放同步进行 | 15 |
表格中的柱状数值是此次发布中所强调的相对体感延迟程度的概念性比较,并非公开的具体基准测试数值。
Reactor想做什么
据称Reactor正将LTX技术用于构建学习体验。对于语言学习或辅导等实时互动至关重要的教育服务而言,对话不间断的虚拟人所带来的体验差异尤为明显——因为这能防止学习者在等待回答期间注意力分散。不过,Reactor的服务是否已上线、如何使用、收费方案等具体使用条件,本次推文中并未涉及。
这意味着什么变化
这一信号表明,视频生成AI正在从"先做完再展示"的工具转向"边展示边持续生成"的工具。此前,对话式虚拟人大多是先生成文本或语音回应,再在此基础上叠加视频;而像LTX这样能够实时推送帧本身的技术一旦成熟,其应用范围将不局限于虚拟人,还可能扩展到直播、远程咨询、视频教育等延迟直接决定体验质量的各类服务。考虑到LTX-2.5是以开放权重形式发布的,类似Reactor这样的案例,也有可能带动更多开发者展开相应应用。




评论