월~금 오전 7시, 일요일 오전 8시 — AI 뉴스와 용어를 보내드립니다메일로 받아보기

METAL LAB

marin-community/marin

1,970오늘 +214Python

Marin: 거대 언어모델을 밑바닥부터 만드는 과정을 전부 공개하는 오픈소스 연구 플랫폼

Marin은 데이터 정제부터 학습, 평가까지 대형 언어모델을 만드는 전 과정을 코드와 실험 기록으로 공개하는 프로젝트다. 성공한 실험뿐 아니라 실패한 실험까지 기록으로 남기는 것을 원칙으로 삼는다. Stanford CRFM과 Open Athena가 핵심 협력 기관으로 참여하고 있다.

무엇을 하는 레포인가

  1. 현재는 5e24 model-FLOPs, 5000억 개 이상의 파라미터를 가진 대형 mixture-of-experts(하나의 큰 모델 대신 여러 전문가 서브모델 중 일부만 골라 쓰는 구조) 모델을 밑바닥부터 학습시키고 후속 학습(posttraining)까지 진행 중이다.
  2. Delphi라는 스케일링 실험 세트를 공개했다. 3e18부터 1e23 FLOPs까지 컴퓨팅 예산에 맞춰 모델 구성을 정하는 레시피, 그 레시피로 Google TPU Research Cloud에서 학습한 체크포인트, 작은 모델 결과로 큰 모델 성능을 예측하는 스케일링 법칙을 함께 내놓았다.
  3. 학습에 쓴 데이터 혼합 파이프라인(Nemotron-CC, StarCoderData, ProofPile 2를 조합), 레시피 코드, 개발 방법론 문서, 그래프용 원자료까지 모두 저장소와 Hugging Face에 공개했다.
  4. 과거에는 Marin으로 학습시킨 80억 파라미터 모델이 자체 벤치마크에서 Llama 3.1 8B보다 나은 성능을 냈고, 320억 파라미터 모델(Marin 32B)도 학습시킨 바 있다.
  5. 실험은 Makefile처럼 서로 의존 관계가 있는 단계(step)들을 정의해 순서대로 실행하는 구조로, 토큰화 단계에 학습 단계가 의존하는 식으로 파이프라인을 구성할 수 있다.

왜 중요한가

대형 언어모델을 만드는 데 드는 데이터 처리, 학습 인프라, 실험 관리 노하우는 대부분 비공개로 남아있는데 Marin은 이 전 과정을 코드와 기록으로 열어 놓아 연구자와 개발자가 직접 따라 하거나 재현할 수 있게 한다. 오디오-텍스트, DNA, 단백질 모델처럼 언어모델 밖의 다른 영역에도 같은 도구를 라이브러리로 재사용할 수 있다는 점도 실무적으로 유용하다.

이 레포의 용어

  • foundation model · 대량의 데이터로 미리 학습해 다양한 작업에 응용할 수 있는 대형 인공지능 모델
  • mixture-of-experts · 하나의 큰 모델 대신 여러 전문가 서브모델 중 일부만 선택해 계산하는 구조
  • model-FLOPs · 모델 학습에 들어간 부동소수점 연산량으로 계산 규모를 나타내는 단위
  • 스케일링 법칙(scaling law) · 모델 크기나 데이터 양과 성능 사이의 관계를 수식으로 나타낸 것
  • posttraining · 사전학습이 끝난 모델을 특정 목적에 맞게 추가로 학습시키는 단계
  • 토큰화(tokenization) · 텍스트를 모델이 처리할 수 있는 작은 단위(토큰)로 잘라내는 과정

레포 원문 소개 (영문)

Open-source framework for the research and development of foundation models.

GitHub에서 보기

주목받는 레포

레포 전체 보기 →

METAL LAB 최신 기사