
요약
- LTX가 오픈 웨이트 영상 생성 월드모델 LTX-2.5를 공개했다
- NVIDIA RTX GPU와 DGX Spark에서 로컬 구동이 가능하도록 VRAM 요구량을 낮췄다
- 온프레미스 벤치마크에서 10초 클립을 6.8초에 생성해 폐쇄형 모델들을 앞질렀다
- 모델명
- LTX-2.5 (개발사 LTX)
- 공개일
- 2026년 8월 11일
- 지원 하드웨어
- NVIDIA RTX GPU, NVIDIA DGX Spark
- 생성 속도(온프레미스, 2x GB200)
- 10초 클립을 6.8초에 생성
- 생성 속도(LTX API)
- 10초 클립에 23.7초
- 언어 백본
- Gemma 4
- 동시 공개
- NVIDIA Nemotron 3.5 Lightning (같은 날)
- 통합 도구
- ComfyUI 데이 원 지원, LoRA 파인튜닝 지원
영상 하나를 만드는 데 필요한 것이 카메라 크루도, 렌더팜도, 클라우드 청구서도 아닌 책상 위 그래픽카드 한 장이 되는 순간이 왔다. LTX가 오픈 웨이트 영상 생성 월드모델 LTX-2.5를 공개했다. 소셜 클립, 광고 소재, 영화 사전 시각화까지 클라우드에서 로컬 GPU로 옮겨가는 흐름 위에 놓인 모델이다.
RTX 한 장이 스튜디오를 대체한다
LTX는 이 모델을 NVIDIA RTX GPU와 NVIDIA DGX Spark에서 로컬로 돌리는 데 맞춰 최적화했다고 설명했다. VRAM 요구량을 낮춰 창작자가 이미 가진 하드웨어에서 최전선급 월드모델이 돌아가게 만들었다는 것이다. 가장 큰 변화는 '네이티브 멀티샷' 생성이다. 여러 샷으로 이어지는 시퀀스를 하나의 일관된 결과물로 렌더링해, 캐릭터의 외형을 샷마다 그대로 유지한다. 초기 오픈 모델들이 캠페인에 쓰기 어려웠던 이유였던 화면 깨짐 현상을 잡았다는 설명이다. 여기에 더 정교해진 Gemma 4 언어 백본과 고속 모션에서 잔상을 줄이는 새 디코더가 더해져 결과물이 후반 작업 없이도 쓸 만한 수준에 가까워졌다고 보도됐다.
작업 전체가 ComfyUI 안에서, 소비자용 RTX GPU 한 장으로 끝난다. 브랜드 캐릭터나 시그니처 스타일은 LoRA 파인튜닝 — 큰 모델은 그대로 두고 작은 보정 레이어만 학습시켜 특정 스타일에 맞추는 방식 — 으로 빠르게 고정할 수 있다. 스튜디오도, 클라우드도, 기기 밖으로 나가는 IP도 없다.
속도가 만드는 차이
로컬 구동이 의미를 가지려면 속도가 뒷받침돼야 한다. LTX가 공개한 이미지-투-비디오 벤치마크에 따르면 10초 클립 생성 시간은 다음과 같다.
| 모델/방식 | 생성 시간 | 상대 속도 |
|---|---|---|
| LTX-2.5 (온프레미스, 2x GB200) | 6.8초 | 2 |
| LTX-2.5 (LTX API) | 23.7초 | 6 |
| Omni Flash·Grok 1.5·Veo 3.1 | 52~70초 | 15 |
| Seedance 2.0 | 196초 | 49 |
| FLUX 3 | 259초 | 65 |
| Seedance 2.5 | 317초 | 80 |
| Kling 3.0 Pro | 398초 | 100 |
온프레미스 기준으로는 클립 자체의 재생 시간보다 생성 시간이 더 짧다. 가장 빠른 폐쇄형 대안보다 7.6배, 가장 느린 대안보다는 약 58배 빠르다는 계산이 나온다. 이 정도 속도차는 밤새 배치로 수십 개 버전을 뽑아두고 다음 날 고르는 작업 방식을 실제로 가능하게 만든다. 광고 소재는 대개 7~10일 안에 피로도가 쌓이는데, 아이디어가 부족해서가 아니라 그만큼 만들 시간과 비용이 부족해서였다는 게 이번 보도의 핵심 논지다.
월드모델이라는 개념
대형언어모델이 다음 단어를 예측하도록 학습된다면, 월드모델은 다음 순간을 예측하도록 학습된다. 환경을 생성하고 그 안에서 사물과 사람이 어떻게 움직이는지 시뮬레이션하며, 사용자가 그 안에서 행동할 수 있게 한다. 이 구조는 영화·광고·게임뿐 아니라 창고나 공장에서 움직이는 로봇의 시뮬레이션에도 쓰인다. 지난 8월 8일 공개된 NVIDIA의 오픈 월드모델 Cosmos 3도 비전 추론과 행동 예측을 결합해 같은 방향을 가리키고 있었다. LTX-2.5는 여기에 더해 실제 창작 현장의 영상 제작 파이프라인을 로컬 GPU 한 장 규모로 압축했다는 점에서 결이 조금 다르다.
엔비디아의 8월 로컬 AI 시리즈
LTX-2.5는 NVIDIA가 8월 한 달 내내 진행하는 '로컬 AI' 시리즈의 축 중 하나다. 같은 날 공개된 오픈 모델 Nemotron 3.5 Lightning은 항시 구동되는 에이전트를 겨냥한 30B 규모 MoE(전문가 혼합) 모델이며, 워크플로 단계마다 최적 모델로 라우팅해주는 오픈소스 라이브러리 NeMo Switchyard도 함께 소개됐다. 공통된 메시지는 하나다. RTX PC부터 워크스테이션, 데이터센터, 클라우드까지 오픈 모델이 하드웨어 선택권을 넓혀가고 있다는 것이다.
그래서 무엇이 달라지나
1인 창작자나 소규모 팀이 풀타임 제작 크루와 맞먹는 산출량을 하루 만에 낼 수 있게 됐다는 게 이번 공개의 실질적 의미다. 클립 하나당 과금이나 크레딧 소모 없이 GPU가 밤새 여러 버전을 만들어두면, 아침에 폴더를 열어 고르기만 하면 된다. 열 개의 후크를 테스트하고 다섯 개 시장에 맞춰 로컬라이즈하는 작업이 스튜디오 예약이 아니라 책상 위 그래픽카드 한 장의 일이 됐다는 뜻이다.





댓글