
이미지: Higgsfield 영상 갈무리
요약
- 힉스필드가 5일 기준 이미지를 먼저 확정하고 모든 생성에서 재사용하라는 AI 애니메이션 시리즈 캐릭터 일관성 가이드를 공개했다.
- 소울 ID는 20장 넘는 사진으로 캐릭터를 학습하고, 시네마 스튜디오 4.0은 클립당 최대 30초·기준 이미지 최대 50개로 장면을 만든다.
- 블렌들은 이 방식으로 약 4시간 만에 1분 20초 분량의 에피소드를 완성했다고 밝혔다.
- 발표
- 2026년 10월 5일 힉스필드 블로그 「How to Keep Characters and Art Style Consistent Across an AI Animated Series」
- 표류 유형
- 얼굴·비율 변화 · 기본 그림체로의 표류 · 이유 없는 옷·소품 변화 · 같은 장소의 불일치 · 색 보정·조명 변화
- 플랫폼
- 이미지·영상·오디오 생성 모델과 도구 35개 이상
- 소울 ID
- 캐릭터 유지 · 기준 사진 20장 이상으로 몇 분 안에 학습
- 소울 2.0
- 자체 이미지 모델 · 최대 2K · 프리셋 20개 이상 · 무드보드·소울 HEX
- 팝콘
- 대본·장면 목록을 스토리보드로 · 자동 모드 최대 8프레임 · 수동 모드 프레임별 지시
- 시네마 스튜디오 4.0
- 클립당 최대 30초 · 생성당 기준 최대 50개 · 장르·카메라·렌즈·템포·감정 휠·색 팔레트·시대
- 작업 순서
- 6단계: 소울 ID → 소울 2.0 화풍·자산 → 팝콘 스토리보드 → 시네마 스튜디오 생성 → 기준 라이브러리 대조 → (선택) 수정
- 수정 도구
- 겐주츠 오브젝트 스왑·모션 트랜스퍼 · 시댄스 2.5 에디트(프롬프트·드로 투 에디트) · 최대 30초·멀티모달 기준 50개
- 첨부 영상
- 13초 무음 애니메이션 · 같은 캐릭터가 테니스 코트에서 여러 컷
- 휴고 블렌들
- 멕시코시티 2D 애니메이터 · 「릭 앤 모티」 시즌 5·6 애니메이션 감독 · 「제로 투 히어로」 1인 제작
- 블렌들 방식
- 캐릭터마다 흰 배경 엘리먼트 · 기본 4분의 3 뷰 · 움직임 큰 장면만 전신 회전 · 배경 별도 생성 안 함 · 반복 장소 저장
- 블렌들 생산성
- 시댄스 2.5 720p 30초 클립 · 약 4시간에 1분 20초 · 하루 이틀에 한 편 · 업계 평균 애니메이터 1인 하루 3~5초
- 남은 과제
- 음성은 생성마다 따로 처리 · 실제 성우 도입 계획
힉스필드가 AI로 애니메이션 시리즈를 만들 때 캐릭터와 화풍이 장면마다 흔들리는 문제를 막는 제작 가이드를 5일 블로그에 공개했다. 핵심은 영상을 뽑기 전에 캐릭터와 화풍, 장소, 소품의 기준 이미지를 먼저 확정하고 모든 생성에서 그 기준을 다시 불러 쓰라는 것이다. 회사는 이 준비를 건너뛰면 시리즈가 길어질수록 시각적 표류가 생길 가능성이 크게 높아진다고 밝혔다. 같은 날 공개된 실무자 인터뷰에서는 애니메이터 출신 창작자가 이 원칙으로 하루 이틀에 한 편씩 시리즈를 내는 과정이 함께 나왔다.
표류가 생기는 이유는 생성이 장면마다 따로 이뤄지기 때문이다. 힉스필드에 따르면 같은 정체성과 기준을 넘겨주지 않으면 모델은 캐릭터 설명을 매번 조금씩 다르게 해석하고, 그 작은 차이가 시리즈 전체에서 쌓인다. 가이드는 문제를 다섯 가지로 나눴다. 에피소드마다 얼굴이나 비율이 바뀌는 경우, 화풍이 밋밋한 기본 그림체로 흘러가는 경우, 이야기상 이유 없이 옷이나 소품이 바뀌는 경우, 같은 장소가 회차마다 달라 보이는 경우, 장면마다 색 보정과 조명이 달라지는 경우다.
처방은 도구 네 개로 짜였다. 35개 넘는 모델과 도구를 한 작업 공간에 묶은 힉스필드에서 소울 ID는 캐릭터를 붙잡고, 20장 넘는 기준 사진으로 몇 분 안에 학습한다. 자체 이미지 모델 소울 2.0은 최대 2K 이미지를 만들고 20개 넘는 프리셋을 갖췄으며, 무드보드로 화풍을, 소울 HEX로 색 팔레트를 고정한다. 팝콘은 대본이나 장면 목록을 장면별 스토리보드로 바꾸는데, 자동 모드는 프롬프트 하나를 최대 8개 프레임으로 펼친다. 실제 장면은 시네마 스튜디오 4.0이 클립당 최대 30초, 생성 한 번에 기준 이미지 최대 50개로 만든다.
시네마 스튜디오 4.0의 장르, 카메라, 렌즈, 템포, 감정 휠, 색 팔레트, 시대 설정은 모두 직접 조작하는 값이다. 가이드는 이 값들을 프롬프트 문장에 맡기지 말고 명시적으로 고정하라고 권했다. 같은 촬영 선택을 장면마다 새로 묘사하는 대신 그대로 재사용하라는 뜻이다. 화풍도 같다. 매번 화풍을 글로 다시 설명하는 것은 모델이 두 번 똑같이 해석하기를 바라는 일이라는 것이 회사의 설명이다.

작업 순서는 여섯 단계다. 소울 ID로 캐릭터 정체성을 잠그고, 소울 2.0에서 화풍을 정한 뒤 장소와 물건, 의상을 같은 화풍으로 만든다. 팝콘으로 어느 장소와 소품이 어디 나오는지 스토리보드를 짜고, 시네마 스튜디오 4.0으로 장면을 생성한다. 새 에피소드는 직전 회차가 아니라 처음 만든 기준 이미지와 비교한다. 한 에피소드 안에서는 멀쩡해도 시즌 1에서 시즌 3으로 넘어가며 조용히 달라질 수 있기 때문이다. 어긋난 부분이 있으면 장면 전체를 다시 뽑기 전에 편집 도구로 고친다.
수정 도구는 둘이다. 겐주츠의 오브젝트 스왑은 카메라와 움직임, 구도를 그대로 둔 채 캐릭터나 의상, 장소를 바꾸고, 모션 트랜스퍼는 원래 움직임과 타이밍을 살린 채 다른 캐릭터나 장소로 장면을 다시 짓는다. 시댄스 2.5 에디트는 기존 클립 안의 국소 변경을 맡는데, 프롬프트로 설명하거나 드로 투 에디트로 바꿀 영역을 직접 칠한다. 시댄스 2.5는 최대 30초 클립과 멀티모달 기준 최대 50개를 지원한다. 가이드는 완성 영상에서 어긋남을 찾는 것보다 정지 기준 이미지를 다시 만드는 쪽이 훨씬 싸다고 강조했다.
메탈이 확인한 가이드 첨부 영상은 13초 분량의 무음 애니메이션이다. 빨간 비니와 큰 파란 트랙 재킷, 빨간 흰색 운동화 차림의 같은 캐릭터가 테니스 코트에서 철망 너머 원경, 어깨 너머, 발 클로즈업, 정면 전신 등 여러 컷에 걸쳐 같은 얼굴과 옷차림으로 나온다. 코트의 주황색 바닥과 철망, 나무 배경도 컷마다 같은 화풍을 유지한다.
원칙이 현장에서 어떻게 쓰이는지는 휴고 블렌들의 사례가 보여 준다. 멕시코시티 출신의 2D 애니메이터로 「릭 앤 모티」 시즌 5와 6의 애니메이션 감독을 지낸 그는 혼자 코미디 시리즈 「제로 투 히어로」를 만든다. 힉스필드 인터뷰에 따르면 그는 주요 캐릭터마다 흰 배경 디자인으로 엘리먼트를 하나씩 만들어 모든 생성에 붙이고, 기본은 4분의 3 측면 뷰를 쓴다. 전신 회전 시트를 붙이면 화면에 캐릭터가 둘로 복제되기 쉬워서, 돌거나 뛰거나 싸우는 장면에만 회전 시트를 쓴다. 배경은 따로 만들지 않고 캐릭터와 아주 구체적인 장소 묘사를 한 요청에 넣으며, 반복되는 장소는 한 번 만들어 저장해 둔다.
블렌들은 에피소드를 시댄스 2.5로 720p 30초 클립 단위로 생성한다. 최근 한 편은 대본과 의상 재디자인, 새 악당까지 포함해 약 4시간 만에 1분 20초 분량을 완성했다. TV 업계에서 애니메이터 한 명이 하루에 만드는 완성 분량은 3~5초다. 그는 "AI에게 애니메이션을 연출시키려 해도 여전히 애니메이션과 촬영을 이해해야 한다"며 "숏 크기, 카메라 움직임, 연기, 타이밍을 정확한 언어로 옮기지 못하면 결과물은 좋아 보이지 않는다"고 말했다. 또 "내가 하기 지겨워졌지만 할 줄 아는 일을 도구에 맡기는 것"이라고 자신의 방식을 설명했다. 음성은 아직 생성마다 따로 처리돼 이어지지 않아, 그는 실제 성우를 점차 들이겠다는 계획이다.
메탈은 힉스필드가 공개한 단편 애니메이션 제작기 영상을 보도한 바 있다. 당시가 한 편의 완성 과정이었다면, 이번 가이드는 여러 회차를 같은 얼굴과 같은 세계로 이어 가는 문제로 초점을 옮겼다. AI 영상 도구의 경쟁이 한 컷의 화질에서 시리즈의 연속성으로 넘어가고 있다는 신호다.
결론은 순서에 있다. 기준 이미지를 먼저 만들고, 값을 고정하고, 처음 기준과 대조하는 습관이 생성 모델의 즉흥성을 제작 공정의 규율로 바꾼다. 도구가 기억을 대신해 주지 않는 이상 시리즈의 일관성은 결국 창작자가 쌓아 두는 기준 라이브러리의 두께로 결정된다.





댓글