매일 아침, 세계 AI 소식을 한국어 3줄 요약으로브랜드 디렉터리 보기

METAL LAB

중형 모델 구간이 다시 붐빈다…다음은 70~80B인가

DSV4 플래시·Inkling Small·Laguna S 2.1·Step 3.7 플래시가 짧은 간격으로 나왔다.

요약

  • 최근 몇 주 사이 중형 구간 모델이 연달아 공개되며 선택지가 넓어졌다.
  • 커뮤니티에서는 70~80B 구간의 새 경쟁자를 기다리는 목소리가 나온다.
  • 자체 호스팅을 검토하는 조직에는 비교 시점으로 적절하다.
최근 공개 모델
DSV4 Flash 0731 · Inkling Small · Laguna S 2.1 · Step 3.7 Flash
커뮤니티 요구
70~80B 구간의 새 경쟁자
논의 채널
r/LocalLLaMA
관전 포인트
자체 호스팅 후보군을 한 번에 비교하기 좋은 시점

최근 몇 주 사이 중형 구간 모델이 연달아 나왔다. DSV4 플래시 0731, Inkling Small, Laguna S 2.1, Step 3.7 플래시가 짧은 간격으로 공개되면서 선택지가 눈에 띄게 넓어졌다. 커뮤니티에서는 이제 70~80B 구간의 새 경쟁자를 기다리는 목소리가 나온다.

왜 하필 중형인가

거대 모델은 API로 쓰는 게 대체로 싸다. 소형 모델은 품질이 아쉽다. 자체 호스팅이 말이 되는 구간은 그 사이다. 한 대의 서버, 혹은 카드 두세 장에 얹을 수 있으면서 실무 품질이 나오는 지점 — 그게 지금 중형 구간에 모델이 몰리는 이유다.

자체 호스팅을 고르는 이유는 대체로 셋 중 하나다.

  1. 데이터를 밖으로 못 보낸다 — 규제 산업, 계약상 제약, 내부 정책
  2. 호출량이 많다 — 일정 규모를 넘으면 API 비용이 장비 비용을 넘어선다
  3. 지연이 중요하다 — 네트워크 왕복을 없애야 하는 실시간 용도

셋 다 아니면 API가 대체로 낫다. 운영 부담을 과소평가하는 경우가 많다.

지금 나와 있는 것들

최근 공개구간
DSV4 Flash 0731중형
Inkling Small중형(소형 상단)
Laguna S 2.1중형
Step 3.7 Flash중형
비어 있는 자리70~80B

각 모델의 정확한 파라미터 수와 벤치마크는 배포처마다 공개 범위가 달라 여기서는 나열하지 않는다. 숫자를 비교하려면 원 저장소의 모델 카드를 직접 확인하는 편이 정확하다.

랙 후면에 정리된 케이블 다발
랙 후면에 정리된 케이블 다발

70~80B가 왜 특별한 자리인가

이 구간은 하드웨어 경계선 위에 놓여 있다. 80GB 카드 한 장에 4비트로 겨우 들어가고, 두 장이면 여유가 생긴다. 즉 장비를 한 단계 올리지 않고 품질을 한 단계 올릴 수 있는 마지막 지점에 가깝다. 커뮤니티가 이 숫자를 콕 집어 부르는 이유다.

구간4비트 기준 대략 용량현실적인 장비
7~9B4~6 GB노트북 · 소비자 GPU 1장
24~32B14~20 GB소비자 GPU 1장(상급)
70~80B40~48 GB워크스테이션 GPU 1장 또는 소비자 2장
200B+110 GB 이상서버 · 다중 GPU

한 단계 위로 올라갈 때마다 장비 예산이 몇 배로 뛴다. 그래서 경계선 바로 아래에 있는 모델이 실무에서 가장 많이 쓰인다.

도입 검토 순서

  1. 용도부터 좁힌다. 요약·분류·추출이면 중형으로 충분한 경우가 많다. 장문 추론과 코드 생성은 다르다.
  2. VRAM 예산을 먼저 정한다. 모델을 고르고 장비를 맞추면 대체로 예산이 터진다. 반대로 간다.
  3. 양자화 손실을 자기 데이터로 잰다. 실제 업무 프롬프트 100건으로 Q4와 Q6을 비교하면 결정이 빨라진다.
  4. 동시 사용자 수를 계산에 넣는다. 혼자 쓸 때와 열 명이 붙을 때 필요한 장비가 다르다. KV 캐시가 사용자 수만큼 늘어난다.
  5. 라이선스를 마지막에 다시 본다. 상업적 사용 조건이 모델마다 다르고, 같은 회사 모델이라도 버전별로 다른 경우가 있다.

비교 절차를 만들어 두는 편이 남는다

지금처럼 후보가 한꺼번에 쏟아질 때는 하나를 고르는 것보다 다음에 또 고를 수 있는 절차를 만들어 두는 것이 남는다. 다음 모델은 반드시 나온다.

최소한의 형태는 이 정도다. ① 자사 업무를 대표하는 평가 프롬프트 세트 100~200건, ② 정답 또는 채점 기준, ③ 모델을 바꿔 끼울 수 있는 추상화 계층, ④ 토큰당 비용과 지연을 함께 기록하는 로그. 이 넷이 있으면 새 모델이 나올 때마다 반나절이면 결론이 난다.

출처: r/LocalLLaMA 커뮤니티 논의. 모델별 사양은 각 배포처 모델 카드 참고.