
이미지: METAL
요약
- 레딧 r/LocalLLaMA 이용자가 8B~12B급 신형 오픈소스 모델 출시가 뜸하다고 문제를 제기했다
- LM Studio가 추천하는 최신 모델은 66일 전 나온 Gemma4 12B QAT이며, 나머지는 147~161일 전 모델이었다
- 최근 오픈소스 출시가 27B 이상급에 집중되는 흐름이 논쟁의 배경으로 지목됐다
- 게시판
- r/LocalLLaMA
- 제기 시점
- 2026-08-11
- 사용자 환경
- MacBook Pro M4, 16GB 통합메모리
- 언급된 최신 모델
- Gemma4 12B QAT (66일 전 출시)
- 언급된 구형 모델
- Nemotron 3 Nano 4B, Qwen3.5 9B (147~161일 전)
- 언급된 신규 대형 모델
- Bonsai 27B (10일 전 출시)
16GB 맥북에서 쓸 만한 모델이 안 보인다
레딧 r/LocalLLaMA에 올라온 글 한 편이 로컬 LLM 이용자들 사이에서 공감을 얻었다. 16GB 통합메모리를 쓰는 MacBook Pro M4 사용자가 "LM Studio에서 돌릴 만한 신형 8B~12B 모델이 안 보인다"고 문제를 제기한 것이다. 글쓴이가 현재 쓰고 있는 모델은 66일 전 나온 Gemma4 12B QAT다. LM Studio가 다음으로 추천하는 Nemotron 3 Nano 4B와 Qwen3.5 9B는 각각 147일, 161일 전 모델로, 사실상 세대가 지난 선택지였다. 10일 전 나온 Bonsai 27B도 눈에 띄었지만, 글쓴이는 16GB 메모리로 이 모델을 감당할 수 있을지조차 확신하지 못했다. "요즘 출시되는 건 다 27B 이상인데, 왜 그런가"라는 질문이 글의 핵심이다.
왜 중소형 모델이 뜸해졌나
8B~12B는 그동안 로컬 추론의 '스위트스팟'으로 불려온 구간이다. 4비트 양자화를 거치면 16GB 안팎의 통합메모리에서 실시간에 가깝게 돌아가고, 답변 품질도 실사용에 부족하지 않은 수준이었기 때문이다. 그런데 최근 오픈소스 진영의 경쟁은 벤치마크 점수 우위를 잡기 쉬운 27B 이상급에 몰리는 모양새다. 파라미터가 클수록 추론·코딩 벤치마크에서 점수 올리기가 상대적으로 수월하고, 각 회사가 플래그십 성능을 과시하려는 유인도 크다. 반면 8B~12B는 이미 검증된 구조를 다듬는 데 자원을 쓰기보다, 대형 모델 개발에 밀려 후순위로 넘어가는 경향이 있다는 지적이 댓글에서 이어졌다.
실제로 지난 8월 9일 공개된 구글 Gemma 4 12B QAT — 양자화 인식 학습(QAT)으로 미리 훈련해 압축 손실을 줄인 체크포인트 — 는 12B급에서 거의 유일하게 최신 축에 속하는 모델이었다. 이 모델은 텍스트·이미지 입력을 받는 멀티모달 구조에 최대 256K 토큰 컨텍스트, 140개 이상 언어를 지원하며 Apache 2.0 라이선스로 배포됐다. 글쓴이가 "그나마 쓸 만하다"고 꼽은 것도 이 지점과 맞닿아 있다.
구글 젬마4, QAT 양자화 체크포인트 12B 모델 공개
그래서 뭐가 달라지나
이번 논쟁은 특정 회사의 발표가 아니라 커뮤니티의 체감을 보여준다는 점에서 눈여겨볼 만하다. 32GB 이상 고사양 맥이나 데스크톱 GPU가 없는 이용자, 즉 보급형 노트북으로 로컬 LLM을 쓰려는 사람들에게는 신형 모델 출시 주기가 곧 사용 경험의 질을 좌우한다. 8B~12B 구간의 신작이 뜸해지면 이용자들은 반년 넘은 모델을 계속 쓰거나, 감당하기 버거운 대형 모델에 억지로 맞춰야 하는 처지에 놓인다. 개발사 입장에서 대형 모델로 벤치마크 경쟁을 이어가는 흐름이 계속된다면, 온디바이스·경량 추론 수요는 당분간 소수의 최신 사례에 의존할 가능성이 크다.





댓글