
이미지: METAL
요약
- 애플 머신러닝 리서치가 17억 파라미터 규모의 흐름매칭 언어모델을 2.1조 토큰으로 학습한 논문을 공개했다
- 이 모델을 자기증류(self-distillation)해 만든 Categorical Flow Map은 최소 4단계 추론으로 텍스트를 생성한다
- 기존 연구는 10억 파라미터 미만 규모에서만 검증돼 확장성이 열린 질문이었는데, 이번에 처음 대규모 검증이 이뤄졌다
- 발행처
- Apple ML Research, 논문 공개일 2026-08-07
- 베이스 모델 규모
- 17억 파라미터(1.7B) 흐름 모델
- 학습 데이터량
- 2.1조 토큰(2.1T tokens)
- 추론 단계
- 자기증류 후 최소 4단계(4-step)로 압축
- 저자
- Oscar Davis 등 7인, 옥스퍼드대 공동연구 포함
무엇이 나왔나
애플 머신러닝 리서치가 2026년 8월 7일 발표한 논문 'Scaling Categorical Flow Maps'는 언어모델을 자기회귀(autoregressive) 방식이 아닌 흐름매칭(flow matching) 방식으로 키워본 결과를 담았다. 연구진은 17억 파라미터 규모의 베이스 모델을 2.1조 토큰으로 학습한 뒤, 이를 다시 자기증류 — 모델이 자기 자신의 출력을 스승 삼아 더 빠른 버전을 학습하는 방식 — 해 Categorical Flow Map(CFM)이라는 압축 모델을 만들었다. 이 CFM은 최소 4번의 추론 단계만으로 다양하고 품질 좋은 텍스트를 생성하면서도 실제 데이터에 가까운 토큰 엔트로피 — 문장의 다양성 정도를 재는 지표 — 를 유지했다고 밝혔다. 연구진은 또 이 모델을 표준 언어모델 벤치마크에서 점수로 환산할 수 있는 우도(likelihood) 계산법도 함께 제시했으며, 그 결과가 기존 이산 확산(discrete diffusion) 방식과 비슷한 범위에 든다고 설명했다.
이게 무슨 의미인가
GPT 계열처럼 지금 널리 쓰이는 언어모델은 대부분 자기회귀 방식이다. 문장을 왼쪽에서 오른쪽으로, 한 토큰씩 순서대로 예측해 나간다. 반면 확산(diffusion)이나 흐름매칭 모델은 이미지 생성에서 먼저 자리를 잡은 방식으로, 노이즈에서 출발해 여러 지점을 동시에 다듬어가며 결과물을 완성한다. 이 방식을 텍스트에 적용하면 순서를 지키지 않고 여러 토큰을 병렬로 다듬을 수 있어, 이론적으로는 더 적은 단계에 더 빠른 생성이 가능하다. 문제는 텍스트가 이미지와 달리 연속값이 아니라 이산적인 단어·토큰의 나열이라는 점이다. 그래서 최근 연구들은 원-핫 인코딩된 데이터 분포와 가우시안 노이즈 사이를 흐름매칭으로 연결하는 방식을 시도해 왔지만, 지금까지는 10억 파라미터 미만의 작은 규모에서만 검증돼 대규모에서도 같은 결과가 나올지는 열린 질문이었다. 이번 논문은 그 질문에 처음으로 17억 파라미터, 2.1조 토큰 규모의 답을 내놨다는 점에서 흐름매칭 계열 연구의 다음 단계를 보여준다. 참고로 이미지 생성 쪽에서는 이미 흐름매칭 구조가 자리를 잡았는데, 블랙포레스트랩스가 지난 8월 320억 파라미터 규모의 rectified flow transformer인 FLUX.2-dev를 공개한 바 있다.
블랙포레스트랩스, 320억 파라미터 이미지 모델 FLUX.2-dev 공개
그래서 뭐가 달라지나
이번 발표는 상용 제품이 아니라 연구 논문이다. 그럼에도 자기회귀 모델이 사실상 표준으로 굳어진 언어모델 시장에 흐름매칭이라는 대안 아키텍처가 대규모에서도 통할 수 있다는 근거를 하나 더 쌓았다는 의미가 있다. 연구진은 손실 함수의 가중치를 어떻게 두고 시간 스케줄을 어떻게 짜야 하는지에 대한 실무적 조언도 함께 정리했는데, 이는 뒤이어 이 방식을 시도할 다른 연구팀에 직접적인 참고자료가 될 것으로 보인다. 4단계 생성이 실제 서비스에 쓰일 만큼 실용적인 속도와 품질을 동시에 갖췄는지는 앞으로 더 많은 벤치마크와 검증을 거쳐야 확인될 사안이다.





댓글