매일 아침, 어제의 AI를 한 통으로 정리해 보내드립니다메일로 받아보기

METAL LAB

liquid4all/toktoktok

23RustApache-2.0

AI 코딩 에이전트가 처음부터 끝까지 직접 짠, 대용량 텍스트용 토크나이저 학습기

toktoktok은 Liquid AI가 코딩 에이전트에게 결과와 제약 조건만 적힌 짧은 명세서를 주고, 사람이 코드를 한 줄도 읽지 않은 채 완성시킨 실험용 프로젝트다. OpenAI의 tiktoken과 Hugging Face tokenizers 양쪽에 그대로 불러 쓸 수 있는 BPE(단어를 더 작은 조각으로 쪼개는 방식) 토크나이저 어휘집을 학습해서 만들어 준다. 한 대의 컴퓨터에서 메모리 한도를 정해두고도 수조 개 단위의 토큰으로 학습할 수 있다.

무엇을 하는 레포인가

  1. Liquid AI가 엣지용(소형 기기에서 도는) LLM의 어휘집 크기 연구를 위해 필요했던 BPE 토크나이저 학습기를 직접 만드는 대신, 코딩 에이전트에게 맡기는 실험을 진행했다
  2. AGENTS.md라는 짧은 명세서와 실제 데이터가 있는 샌드박스, 에이전트가 손댈 수 없는 외부 검증 장치(학습된 어휘집이 tiktoken과 Hugging Face tokenizers 양쪽에서 동일한 토큰 ID를 내야 통과)만 주고 나머지는 전적으로 에이전트가 처리했다
  3. 리저버 샘플링(전체 자료 중 일부를 무작위로 뽑아 대표성을 유지하는 기법)으로 RAM보다 훨씬 큰 말뭉치도 지정한 메모리 예산 안에서 학습 가능
  4. 여러 단계(phase)로 나눠 언어나 코드 등 도메인별로 어휘 예산을 직접 배분할 수 있고, 기존 토크나이저를 이어서 확장하는 웜스타트도 지원
  5. 결과물인 .tiktoken 파일은 base 256바이트 더하기 1,161개의 고정 병합(숫자, 공백, 프로그래밍 연산자 등을 위해 미리 정해둔 규칙) 더하기 각 단계에서 학습한 병합 수의 합으로 구성됨

왜 중요한가

말뭉치가 너무 커서 기존 도구로는 메모리가 부족하거나 아예 학습이 안 되던 문제를, 사람 손을 거의 거치지 않고 코딩 에이전트만으로 해결할 수 있는지 보여주는 실제 사례다. 토크나이저 어휘집 설계와 관리가 필요한 LLM 개발자에게는 재현 가능한 학습 도구이자, AI 에이전트 활용 방식에 대한 참고 사례가 된다.

이 레포의 용어

  • BPE(Byte Pair Encoding) · 자주 등장하는 문자 조합을 반복해서 하나의 토큰으로 합쳐 나가는 방식의 토크나이저 학습 알고리즘
  • tiktoken · OpenAI가 만든 BPE 토크나이저 라이브러리
  • 리저버 샘플링 · 전체 데이터를 다 보지 않고도 무작위로 일부를 뽑아 전체를 대표하게 만드는 샘플링 기법
  • 웜스타트(warm start) · 이미 학습된 토크나이저의 기존 토큰 ID를 그대로 유지한 채 새로운 병합 규칙을 이어 붙이는 방식
  • 코딩 에이전트 · 사람의 개입 없이 스스로 코드를 작성하고 수정할 수 있는 AI 시스템
GitHub에서 보기

관련 기사

주목받는 레포

레포 전체 보기 →

METAL LAB 최신 기사