매일 아침, 세계 AI 소식을 한국어 3줄 요약으로브랜드 디렉터리 보기

METAL LAB

트웰브랩스·Mimir, 영상 아카이브 AI 검색 통합

방송사 창고에 잠든 수십만 시간 분량의 테이프를 태그 없이 검색 가능하게 만드는 통합 솔루션으로, 1시간 분량 영상의 메타데이터 생성에 평균 3~4분이면 충분하다.

이미지: 트웰브랩스

손으로 쓴 메모장만 남은 방송 아카이브

방송사 창고 어딘가에는 DigiBeta, DVCam, VHS, 필름 릴, LTO 테이프, 3/4인치 테이프가 가득 쌓여 있다. 테이프에 무엇이 담겼는지는 선반 위 손으로 쓴 노트에만 기록되어 있고, 그 내용을 파악할 수 있는 사람은 그 노트를 직접 쓴 담당자뿐이다. 디지털 변환을 마쳐도 문제는 사라지지 않는다. 병목은 파일 포맷이 아니라 메타데이터, 즉 시스템이 파일 위치만 아는 게 아니라 그 안에서 실제로 무슨 일이 벌어지는지를 이해하고 있느냐에 있었다.

Mimir는 서버리스 미디어 제작·협업 플랫폼으로, 콘텐츠가 저장되고 정리되며 제작 흐름을 타는 기록 시스템 역할을 한다. 트웰브랩스는 그 콘텐츠의 내부를 이해하는 인텔리전스 레이어로, 모든 장면·발화·객체·동작을 인덱싱해 검색 가능하게 만든다. 두 플랫폼의 결합으로 아카이브는 단순 저장소에서 찾고 이해하고 재활용할 수 있는 공간으로 바뀐다.

태그 없이도 찾는 의미 기반 검색

기존 Mimir 검색은 클립 제목, 트랜스크립트, 얼굴 인식 결과에서 결과를 끌어온다. "마크롱"을 검색하고 "넥타이 착용", "독점이라는 단어 발화" 같은 조건을 중첩하면 특정 순간 하나로 범위를 좁힐 수 있다. 강력하지만 누군가가 미리 태그를 달아 두었을 때만 통한다.

트웰브랩스의 멀티모달 미디어 임베딩 모델 Marengo로 구동되는 의미 기반 검색은 다르게 작동한다. "계단", "달리는 사람들", "투표", "밥 먹는 사람들", "헬리콥터"처럼 입력하면 사람이 만든 태그가 단 하나도 없어도 결과가 나타난다. Marengo는 키워드보다 의도를 읽어 쿼리를 시각·트랜스크립트·오디오 신호 중 가장 적합한 쪽으로 라우팅한다. "왼쪽에서 오른쪽으로 슛한 골, 흰 셔츠 선수, 노란 팀 상대, 빗속에서"처럼 복합 조건도 단일 쿼리로 처리된다. 두 방식을 결합하는 것도 가능해, 대형 아카이브에서는 Mimir 필터로 대상을 먼저 좁힌 뒤 의미 기반 검색을 실행해 처리 시간을 단축할 수 있다.

장면 단위 컴플라이언스 자동 로깅

영국 Ofcom 같은 규제 기관은 유해 콘텐츠 방송에 엄격한 제재를 가하지만, 늘어나는 아카이브를 사람이 처음부터 끝까지 시청하며 걸러내는 것은 현실적으로 불가능하다. 트웰브랩스의 비디오 언어 모델 Pegasus는 콘텐츠를 장면 단위 세그먼트로 분해하고, 폭력·고어·범죄 행위·마약 및 알코올 관련 장면을 미리 정의된 컴플라이언스 카테고리에 맞춰 자동으로 플래그 처리한다. 각 플래그에는 타임스탬프, 심각도 등급, 플래그 사유가 함께 붙어 검토자가 해당 프레임으로 바로 이동할 수 있다.

같은 장면 분할 기능은 컴플라이언스에만 국한되지 않는다. 방송 회차 도입부의 이전 내용 요약이나 마지막의 엔드 크레딧을 찾는 용도로도 활용되며, 세그먼테이션 패스를 여러 겹 쌓아 사용할 수도 있다.

아카이브 규모에서의 메타데이터 생성

Pegasus는 클립 하나를 처리할 때 자산 수준 요약과 장면별 세부 내역(인물·객체·분류 체계 정렬 메타데이터)을 단일 패스로 뽑아낸다. 한 번에 처리할 수 있는 영상 길이는 최대 2시간이다. 생성된 메타데이터는 Mimir에 즉시 저장되어 별도의 의미 기반 검색 전환 없이 일반 어휘 검색으로도 찾을 수 있다.

처리 속도는 평균적으로 1시간 분량 콘텐츠의 인덱싱 및 메타데이터 생성에 3~4분이 걸린다. 단, 프록시가 Mimir에 온라인 상태일 때를 기준으로 한다. 실제 렌더링 완료 시간은 소스 포맷에 따라 달라진다. 단순 리랩으로 처리되는 포맷은 풀 트랜스코드가 필요한 포맷보다 빠르다. 생성된 메타데이터는 고객 소유이며 Mimir 자체 데이터베이스에 저장된다. 트웰브랩스는 생성한 데이터를 보존하지 않는다.

라이브 뉴스 워크플로에서는 녹화가 끝나기를 기다릴 필요도 없다. Mimir가 캡처와 동시에 프록시 세그먼트를 생성하기 때문에, 편집자는 녹화 시작 후 수 초 내에 영상 검토와 클립 제작을 시작할 수 있다.

자연어 쿼리에서 편집 타임라인까지

"축구 골"을 검색하면 아카이브 전체에서 순위가 매겨진 결과가 반환된다. 특정 선수로 범위를 좁히려면 선수 이미지 한 장을 업로드하면 된다. 트웰브랩스가 그 선수를 인식 가능한 엔티티로 등록해 아카이브 전체에서 매칭하며, 이름이나 태그에 의존하지 않는다. 해당 선수가 등장하는 골 세리머니 클립을 요청하면 관련 세그먼트가 각 클립의 타임라인에 직접 강조 표시된 채로 결과가 반환된다.

선별된 클립은 자연어로 요약해 클립 설명을 만들거나 Mimir Cutter로 바로 보낼 수 있다. Cutter에 도착한 클립들은 개별 파일 묶음이 아니라 조립된 타임라인으로 착지한다. 뉴스룸에서는 방송이 끝나기도 전에 경기 하이라이트를 편집해야 하는 상황이 흔한 만큼, 이름이나 이미지로 세리머니 클립을 요청하고 즉시 트리밍 가능한 타임라인을 받는 것이 실질적인 차이를 만든다.

통합 아키텍처와 현재 한계

두 플랫폼은 오케스트레이션 레이어로 연결된다. Mimir에 새 콘텐츠가 도착하면 이벤트가 발생하고, EventBridge·Step Functions·Lambda 같은 도구로 구축된 오케스트레이션 레이어가 트웰브랩스에 인덱싱을 지시한 뒤 결과를 Mimir로 돌려보낸다. 인덱싱은 풀 해상도 파일이 아닌 프록시를 대상으로 하며, 저장소 종류를 가리지 않는다. Amazon S3, GCP, 온프레미스, 로컬 NAS 어디에 파일이 있든 Mimir가 그 자리에서 미디어를 렌더링하고, 트웰브랩스가 경량 프록시를 가져가 임베딩을 생성한 뒤 프록시를 폐기한다.

인덱싱은 자동 수집이 아닌 온디맨드 방식으로만 실행하도록 설정할 수도 있다. 인물 식별에서는 트웰브랩스가 인물·객체·브랜드·로고를 담은 엔티티 라이브러리를 관리하며, 이를 고객 자체 인물 인식 데이터(Mimir의 AWS 기반 얼굴 인식)와 직접 연결하는 작업이 현재 진행 중이다. 가격·과금 방식·지원 국가 등 구체적인 상업 조건은 소스에 공개되어 있지 않다. 도입을 검토하는 경우 트웰브랩스 영업팀과의 개별 논의가 필요하다고 소스는 안내한다.