METAL for iPhone

AI 뉴스, 이제 앱에서 읽으세요.

METAL 앱을 다운로드하고 매일 새로운 AI 기사를 만나보세요.

App Store에서 다운로드

iPhone용 앱 · 무료 다운로드

iPhone의 App Store에서도 ‘메탈 AI 매거진’을 검색할 수 있습니다.

METAL

AI 용어사전ㅂ기사에 자주 나오는 기술 용어

비디오-액션 모델

video-action model

영상을 만들면서 그 안에서 일어나는 움직임과 행동까지 함께 예측하도록 학습된 AI 모델.

쉽게 말하면

비디오-액션 모델은 화면에 그럴듯한 영상을 그려내는 것에서 그치지 않고, 그 장면 속 물체나 로봇이 다음에 어떻게 움직여야 하는지까지 같이 예측하는 모델이다. 보통의 영상 생성 AI가 예쁜 그림을 연속으로 이어붙이는 화가라면, 비디오-액션 모델은 그 그림을 그리면서 동시에 '이 손은 다음에 어느 방향으로 움직인다'는 동작 계획까지 함께 짜는 안무가에 가깝다.

이런 모델이 중요한 이유는 로봇이나 자율주행차처럼 실제로 몸을 움직여야 하는 기계를 학습시킬 때다. 영상 속 세상이 어떻게 변할지 예측하는 능력과, 그 변화를 만들어내려면 어떤 동작을 해야 하는지 예측하는 능력이 한 모델 안에 같이 들어 있으면, 로봇에게 별도의 동작 데이터를 일일이 가르치지 않아도 영상만 보고 행동을 유추하게 만들 수 있다.

최근에는 이미지·영상·소리를 한 번에 만드는 멀티모달 모델들이 여기에 더해 행동 예측까지 같은 틀 안에서 학습하는 사례가 나오고 있다. 영상, 소리, 움직임을 따로따로 만드는 대신 하나의 아키텍처가 셋을 동시에 이해하도록 훈련시키는 식이다.

기사에서 이렇게 나와요

기사는 블랙포레스트랩스의 FLUX 3를 두고 "이미지·영상·오디오·행동 예측을 하나의 아키텍처에서 함께 학습했다"고 설명한다. 여기서 말하는 '행동 예측'이 비디오-액션 모델의 핵심 개념이다. 다만 실제로 8월 4일 열린 것은 텍스트·이미지에서 영상을 만드는 기능뿐이고, 행동 예측을 활용하는 로보틱스 협업 모델은 별도의 기술 블로그로만 소개됐다는 점을 헷갈리지 말아야 한다. 즉 FLUX 3라는 큰 모델의 설계 안에 비디오-액션 모델적 요소가 들어 있는 것이지, 지금 API로 부를 수 있는 FLUX 3 비디오 자체가 로봇을 조종하는 기능은 아니다.

함께 볼 용어

이 용어가 나온 기사

ㄱㄴㄷ 전체 찾아보기