METAL for iPhone

AI 뉴스, 이제 앱에서 읽으세요.

METAL 앱을 다운로드하고 매일 새로운 AI 기사를 만나보세요.

App Store에서 다운로드

iPhone용 앱 · 무료 다운로드

iPhone의 App Store에서도 ‘메탈 AI 매거진’을 검색할 수 있습니다.

METAL

AI 용어사전ㄷ기사에 자주 나오는 기술 용어

단일 스트림 옴니 트랜스포머

single-stream omni transformer

영상과 소리를 각각 따로 만들지 않고 하나의 신경망이 한 번에 함께 만들어내는 구조다.

쉽게 말하면

단일 스트림 옴니 트랜스포머는 영상과 소리를 하나의 인공지능이 동시에 만들어내는 구조를 말한다. 지금까지 AI 영상은 대개 세 단계를 거쳤다. 화면을 그리는 도구, 목소리를 만드는 도구, 그리고 입 모양을 목소리에 맞추는 도구가 따로 있었고 이걸 순서대로 이어 붙였다. 단일 스트림 옴니 트랜스포머는 이 세 도구를 하나로 합친 것이다.

비유하자면 이렇다. 원래 방식은 배우가 무성영화를 찍고, 성우가 나중에 목소리를 녹음하고, 편집자가 입 모양에 맞춰 더빙을 끼워 맞추는 과정과 비슷하다. 단일 스트림 옴니 트랜스포머는 배우가 노래하며 동시에 연기하는 실황 촬영에 가깝다. 화면과 소리가 처음부터 한 번의 작업으로 함께 태어나기 때문에, 나중에 맞출 필요가 없다.

그래서 이 구조로 만든 영상은 입을 맞추는 후처리 없이도 말소리와 입 모양이 자연스럽게 들어맞는다. 대신 영상용 신경망과 음성용 신경망을 하나로 합쳐야 하니 만들기는 더 어렵다.

기사에서 이렇게 나와요

기사는 미니맥스(MiniMax) H3를 두고 "본체는 33B 규모 단일 스트림 옴니 트랜스포머다. 영상 latent와 오디오 latent를 같은 트랜스포머가 동시에 예측한다"고 설명한다. 흔한 오해는 이걸 "영상 모델에 오디오 모듈을 덧붙였다"로 읽는 것이다. 실제로는 두 개의 별도 모델이 아니라, 하나의 신경망이 영상과 소리를 함께 계산해 내놓는 구조다.

함께 볼 용어

이 용어가 나온 기사

ㄱㄴㄷ 전체 찾아보기