每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

LTX,逐帧实时流式传输实现"无卡顿虚拟形象"

无需预渲染、按每秒帧数直接推流的LTX技术,应用于学习用对话虚拟形象"Reactor"

실내에서 흰 티셔츠를 입은 남성이 인터뷰하는 모습

이미지: X — 미디어·생성AI

摘要

  • LTX.io宣布,实时对话式虚拟形象"Reactor(@reactorworld)"通过LTX技术实现逐帧即时流式传输视频
  • 关键不在于播放预先制作好的视频,而是在生成回答的过程中画面不会停顿
  • LTX曾在8月11日发布开放权重视频模型LTX-2.5,展示了在RTX GPU上6.8秒内生成10秒视频片段的速度
原文视频
발표 계정
LTX.io (X, 2026-08-14)
적용 사례
Reactor (@reactorworld)
핵심 기술
프레임 단위 실시간 스트리밍, 사전 렌더링 없음
용도
학습(러닝) 경험 구축
배경 모델
LTX-2.5, 2026년 8월 11일 공개
온프레미스 생성 속도
10초 클립을 6.8초에 생성
API 생성 속도
10초 클립에 23.7초

会卡顿的虚拟形象不是真的

对话式AI虚拟形象在思考答案时画面短暂僵住的场景并不陌生。人一开口说话,虚拟形象就会静止几秒钟然后再动起来,这个间隙正是"恐怖谷(uncanny valley)"——与人相似但又不完全相同,反而让人觉得别扭的区间。视频生成初创公司LTX于8月14日通过X宣布,已推出一款能消除这一间隙的实时对话虚拟形象。作为应用案例被提及的是对话式虚拟形象服务"Reactor(@reactorworld)"。

何谓逐帧实时流式传输

LTX方面解释称:"LTX是逐帧流式传输视频,而不是预先渲染完成后再播放。"一般的视频生成AI会先整体计算出几秒钟的片段,然后再展示给用户——这段计算时间就是用户感受到的"卡顿"。LTX强调的是彻底取消了这种"计算后播放"的结构。由于即便在生成回答的过程中,画面也会按帧持续流出,因此虚拟形象看起来像是在真正进行实时对话。据提及,Reactor正利用这一速度打造学习体验(learning experiences),但此次发布中并未确认具体的服务形态或目标年龄段、科目等信息。

背景:LTX-2.5的速度是基础

正如METAL LAB在8月12日报道的那样,LTX于8月11日发布了开放权重视频生成模型LTX-2.5,降低了VRAM需求,使其能够在普通消费级NVIDIA RTX显卡和DGX Spark上本地运行。当时在本地部署基准测试中(以2块GB200为基准),生成10秒片段仅需6.8秒,相比通过API生成同样片段需要23.7秒,速度快了3倍以上。此次公开的实时虚拟形象功能,可以说是这种速度优势转化为实际应用案例的结果。相比整体计算后输出片段的方式,即时逐帧推流的方式显然更适合对话式服务。

虚拟形象响应方式对比

方式处理流程感知延迟
传统方式(预渲染)计算整个片段 → 播放70
LTX帧流式传输逐帧计算与同步播放15

表格中的条形图是此次发布中强调的相对感知延迟程度的概念性比较,并非公开了具体的数值基准测试结果。

Reactor想做什么

据提及,Reactor正在将LTX技术用于构建学习体验。对话不间断的虚拟形象,在语言学习或辅导等实时互动至关重要的教育服务中,体感差异尤为明显——因为可以防止学习者在等待回答时注意力分散。不过,此次推文中并未涉及Reactor的服务上线情况、使用方式、资费方案等具体使用条件。

这意味着什么变化

这是一个信号,表明视频生成AI正从"先做完再展示"的工具转向"边展示边持续生成"的工具。此前,对话式虚拟形象大多是先生成文字或语音回答,再据此叠加视频;而如果能像LTX这样将帧本身进行实时流式传输,那么不仅是虚拟形象,直播、远程咨询、视频教育等延迟即品质的服务领域也都有了应用空间。考虑到LTX-2.5是以开放权重形式发布的,Reactor这样的案例也有可能带动其他开发者的应用跟进。