liquid4all/toktoktok
AI 코딩 에이전트가 처음부터 끝까지 직접 짠, 대용량 텍스트용 토크나이저 학습기
toktoktok은 Liquid AI가 코딩 에이전트에게 결과와 제약 조건만 적힌 짧은 명세서를 주고, 사람이 코드를 한 줄도 읽지 않은 채 완성시킨 실험용 프로젝트다. OpenAI의 tiktoken과 Hugging Face tokenizers 양쪽에 그대로 불러 쓸 수 있는 BPE(단어를 더 작은 조각으로 쪼개는 방식) 토크나이저 어휘집을 학습해서 만들어 준다. 한 대의 컴퓨터에서 메모리 한도를 정해두고도 수조 개 단위의 토큰으로 학습할 수 있다.
무엇을 하는 레포인가
- Liquid AI가 엣지용(소형 기기에서 도는) LLM의 어휘집 크기 연구를 위해 필요했던 BPE 토크나이저 학습기를 직접 만드는 대신, 코딩 에이전트에게 맡기는 실험을 진행했다
- AGENTS.md라는 짧은 명세서와 실제 데이터가 있는 샌드박스, 에이전트가 손댈 수 없는 외부 검증 장치(학습된 어휘집이 tiktoken과 Hugging Face tokenizers 양쪽에서 동일한 토큰 ID를 내야 통과)만 주고 나머지는 전적으로 에이전트가 처리했다
- 리저버 샘플링(전체 자료 중 일부를 무작위로 뽑아 대표성을 유지하는 기법)으로 RAM보다 훨씬 큰 말뭉치도 지정한 메모리 예산 안에서 학습 가능
- 여러 단계(phase)로 나눠 언어나 코드 등 도메인별로 어휘 예산을 직접 배분할 수 있고, 기존 토크나이저를 이어서 확장하는 웜스타트도 지원
- 결과물인 .tiktoken 파일은 base 256바이트 더하기 1,161개의 고정 병합(숫자, 공백, 프로그래밍 연산자 등을 위해 미리 정해둔 규칙) 더하기 각 단계에서 학습한 병합 수의 합으로 구성됨
왜 중요한가
말뭉치가 너무 커서 기존 도구로는 메모리가 부족하거나 아예 학습이 안 되던 문제를, 사람 손을 거의 거치지 않고 코딩 에이전트만으로 해결할 수 있는지 보여주는 실제 사례다. 토크나이저 어휘집 설계와 관리가 필요한 LLM 개발자에게는 재현 가능한 학습 도구이자, AI 에이전트 활용 방식에 대한 참고 사례가 된다.
이 레포의 용어
- BPE(Byte Pair Encoding) · 자주 등장하는 문자 조합을 반복해서 하나의 토큰으로 합쳐 나가는 방식의 토크나이저 학습 알고리즘
- tiktoken · OpenAI가 만든 BPE 토크나이저 라이브러리
- 리저버 샘플링 · 전체 데이터를 다 보지 않고도 무작위로 일부를 뽑아 전체를 대표하게 만드는 샘플링 기법
- 웜스타트(warm start) · 이미 학습된 토크나이저의 기존 토큰 ID를 그대로 유지한 채 새로운 병합 규칙을 이어 붙이는 방식
- 코딩 에이전트 · 사람의 개입 없이 스스로 코드를 작성하고 수정할 수 있는 AI 시스템
관련 기사
주목받는 레포
- cathrynlavery/diagram-designAI 코딩 도구가 그리는 다이어그램을 흔한 둥근 사각형 대신 잡지 느낌 편집 디자인으로 바꿔주는 스킬
- public-apis/public-apis세상의 모든 무료 API를 한곳에 모아둔 목록 저장소
- semantica-agi/semanticaAI 에이전트가 왜 그런 결정을 내렸는지 그래프로 증명하는 오픈소스 인프라
- cactus-compute/needle14메가바이트짜리 AI 모델로 스마트폰과 웨어러블에서 인터넷 없이 도구 호출하기
- unslothai/unsloth코딩 없이 내 컴퓨터에서 AI 모델을 돌리고 학습시키는 데스크톱 앱
- macro-inc/macro이메일, 채팅, 문서, 업무관리, CRM을 하나로 묶고 AI가 팀 전체 기억을 공유하는 업무 플랫폼
- harry0703/MoneyPrinterTurbo주제나 키워드 하나만 입력하면 대본, 영상 소재, 자막, 배경음악까지 자동으로 붙여 짧은 영상 하나를 완성해주는 오픈소스 도구
- basecamp/omarchyDHH가 만든, 미리 취향껏 세팅된 리눅스 배포판