혼합 트랜스포머 아키텍처
Mixture of Transformers Architecture
영상·언어·행동처럼 서로 다른 데이터를 각각 전담하는 트랜스포머 여러 개를 한 모델 안에 묶어 함께 작동시키는 설계 방식.
쉽게 말하면
혼합 트랜스포머 아키텍처란 한 AI 모델 안에 여러 개의 처리 담당 부품을 두고, 데이터 종류에 따라 다른 부품이 일을 나눠 맡게 만든 설계 방식이다. 비유하자면 종합병원과 비슷하다. 내과, 외과, 영상의학과 의사가 한 건물 안에서 각자 전문 분야를 진료하면서도 환자 한 명을 두고 협진하듯이, 이 구조는 영상을 보는 부분과 글을 이해하는 부분, 다음 행동을 예측하는 부분을 따로 두고 필요할 때마다 서로 정보를 주고받게 한다.
왜 이렇게 나눌까. 로봇 팔의 움직임, 자율주행차가 보는 도로 상황, 카메라 영상 정보는 성질이 워낙 달라서 한 가지 방식으로만 처리하면 어느 하나는 어설퍼지기 쉽다. 각 분야를 잘하는 부품을 따로 훈련시키고 한 모델 안에 합쳐두면, 하나의 모델이 장면을 이해하고, 앞으로 벌어질 일을 그려보고, 로봇이 다음에 할 행동을 정하는 일을 동시에 감당할 수 있게 된다.
비슷한 이름의 구조로 여러 전문가 중 일부만 골라 쓰는 전문가 혼합 방식도 있는데, 이쪽은 같은 종류의 작업 안에서 일부 전문가만 호출한다는 점에서 초점이 다르다. 혼합 트랜스포머는 애초에 다루는 데이터의 종류 자체가 다른 여러 전문가를 하나의 모델 계열로 묶는다는 점에서 구분된다.
