단일 스트림 옴니 트랜스포머
single-stream omni transformer
영상과 소리를 각각 따로 만들지 않고 하나의 신경망이 한 번에 함께 만들어내는 구조다.
쉽게 말하면
단일 스트림 옴니 트랜스포머는 영상과 소리를 하나의 인공지능이 동시에 만들어내는 구조를 말한다. 지금까지 AI 영상은 대개 세 단계를 거쳤다. 화면을 그리는 도구, 목소리를 만드는 도구, 그리고 입 모양을 목소리에 맞추는 도구가 따로 있었고 이걸 순서대로 이어 붙였다. 단일 스트림 옴니 트랜스포머는 이 세 도구를 하나로 합친 것이다.
비유하자면 이렇다. 원래 방식은 배우가 무성영화를 찍고, 성우가 나중에 목소리를 녹음하고, 편집자가 입 모양에 맞춰 더빙을 끼워 맞추는 과정과 비슷하다. 단일 스트림 옴니 트랜스포머는 배우가 노래하며 동시에 연기하는 실황 촬영에 가깝다. 화면과 소리가 처음부터 한 번의 작업으로 함께 태어나기 때문에, 나중에 맞출 필요가 없다.
그래서 이 구조로 만든 영상은 입을 맞추는 후처리 없이도 말소리와 입 모양이 자연스럽게 들어맞는다. 대신 영상용 신경망과 음성용 신경망을 하나로 합쳐야 하니 만들기는 더 어렵다.
