METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

LTX-2.5,个人PC上一张RTX显卡即可运行的开放视频生成模型公开

6.8秒生成10秒视频片段的开放权重世界模型,针对NVIDIA GPU优化

LTX-2.5,个人PC上一张RTX显卡即可运行的开放视频生成模型公开

摘要

  • LTX公开了开放权重视频生成世界模型LTX-2.5
  • 降低了VRAM需求,使其能在NVIDIA RTX GPU和DGX Spark上本地运行
  • 在本地部署基准测试中以6.8秒生成10秒片段的速度超越了闭源模型
Introducing LTX-2.5 — 공식 발표 영상 (출처: LTX)

制作一段视频所需要的,不再是摄制团队、渲染农场或云端账单,而是桌上的一张显卡——这样的时刻已经到来。LTX公开了开放权重视频生成世界模型LTX-2.5。这是一款顺应从社交短片、广告素材到电影预可视化都从云端转向本地GPU这一趋势而推出的模型。

一张RTX显卡取代一间工作室

LTX表示,该模型经过优化,可在NVIDIA RTX GPU和NVIDIA DGX Spark上本地运行。通过降低VRAM需求,让创作者可以在已有的硬件上运行最前沿级别的世界模型。最大的变化在于"原生多镜头"生成。该模型能将多个连续镜头的序列渲染成一个连贯的结果,让角色的外观在各个镜头之间保持一致。据介绍,这解决了早期开放模型因画面断裂而难以用于实际营销活动的问题。此外,更精细的Gemma 4语言主干模型以及在高速运动场景中减少残影的新解码器也被加入其中,据报道使生成结果在无需后期制作的情况下也接近可用水准。

整个流程都可以在ComfyUI中,仅用一张消费级RTX显卡完成。品牌角色或标志性风格可以通过LoRA微调——即保持大模型不变,只训练小型校正层以适配特定风格的方式——快速固定下来。既不需要工作室,也不需要云端,更没有IP流出设备之外的风险。

速度带来的差异

本地运行要发挥意义,离不开速度的支撑。根据LTX公开的图生视频基准测试,生成10秒片段所需时间如下。

模型/方式生成时间相对速度
LTX-2.5(本地部署,2x GB200)6.8秒2
LTX-2.5(LTX API)23.7秒6
Omni Flash·Grok 1.5·Veo 3.152~70秒15
Seedance 2.0196秒49
FLUX 3259秒65
Seedance 2.5317秒80
Kling 3.0 Pro398秒100

以本地部署为基准,生成时间甚至比片段本身的播放时长还要短。据计算,该速度比最快的闭源替代方案快7.6倍,比最慢的方案快约58倍。这样的速度差距,实际上让"整夜批量生成数十个版本、第二天挑选"这种工作方式成为可能。此次报道的核心论点是,广告素材通常在7至10天内就会出现审美疲劳,问题不在于缺乏创意,而在于缺乏制作这些创意所需的时间和成本。

世界模型的概念

如果说大语言模型是被训练来预测下一个词,那么世界模型则是被训练来预测下一个瞬间。它生成环境,并模拟其中的物体和人物如何运动,让用户能够在其中进行行动。这一结构不仅用于电影、广告、游戏,也被用于仓库或工厂中移动机器人的模拟。8月8日公开的NVIDIA开放世界模型Cosmos 3同样结合了视觉推理与行动预测,指向了同一个方向。而LTX-2.5的不同之处在于,它进一步将实际创作现场的视频制作流程压缩到了一张本地GPU的规模。

NVIDIA的8月"本地AI"系列

LTX-2.5是NVIDIA整个8月持续推进的"本地AI"系列中的一环。同日公布的开放模型Nemotron 3.5 Lightning是一款面向常驻运行代理的300亿参数规模MoE(混合专家)模型,同时还发布了开源库NeMo Switchyard,可在工作流的每个环节将任务路由至最优模型。这些发布传递出一个共同的信息:从RTX PC、工作站,到数据中心、云端,开放模型正在不断扩大硬件选择的自由度。

这意味着什么改变

此次发布的实质意义在于,个人创作者或小型团队如今能够在一天之内产出与全职制作团队相当的成果量。无需按片计费或消耗积分,GPU可以在夜间生成多个版本,第二天早上打开文件夹挑选即可。测试十种不同的营销切入点、针对五个市场进行本地化调整,这样的工作已经不再需要预约工作室,而是变成了桌上一张显卡就能完成的事。

评论