
요약
- 앤트그룹이 오픈웨이트 소형 모델 Ling 3.0 Tiny를 공개했고, Artificial Analysis Intelligence Index에서 25점을 기록했다.
- 총 파라미터 7.9B·활성 파라미터 1.3B로 '지능 대비 활성 파라미터' 파레토 프론티어에 올랐다.
- 정답률은 9%로 비교군 최하위였지만 시도율이 37%에 그쳐 환각률 30%로 가장 낮았고, 대신 과제당 출력 토큰은 51k로 가장 많았다.
- 모델명
- Ling 3.0 Tiny (앤트그룹, 오픈웨이트)
- 파라미터
- 총 7.9B / 활성 1.3B
- Intelligence Index
- 25점 (Artificial Analysis v4.1.1)
- AA-Omniscience Index
- -19 (Nemotron 3.5 Lightning -18에 이어 표 내 2위)
- 정답률
- 9% (비교 목록 최하위, 최고는 Muse Glimmer high 27%)
- 환각률
- 30% (비교 목록 최저, Ministral 3 8B는 94%)
- 시도율
- 37% — 질문의 3분의 1가량에만 답을 시도
- 과제당 출력 토큰
- 51k (Ling 3.0 Flash 36k, Nemotron 3.5 Lightning·Qwen3.6 35B A3B는 각 31k)
모르면 답을 안 한다
작은 모델이 큰 모델을 이기는 방법은 대개 하나다. 아는 척을 하지 않는 것. 앤트그룹(Ant Group)이 내놓은 오픈웨이트 소형 모델 Ling 3.0 Tiny는 지식 문항의 37%에만 답을 시도했다. 나머지는 그냥 넘겼다. 그 결과 틀린 답을 내놓는 비율, 즉 환각률이 30%로 비교 대상 12개 모델 가운데 가장 낮았다.
독립 평가기관 Artificial Analysis가 측정한 이 모델의 Intelligence Index 점수는 25점이다. 총 파라미터는 7.9B, 실제로 질문 하나를 처리할 때 켜지는 활성 파라미터는 1.3B에 불과하다. Artificial Analysis는 이 모델이 '지능 대비 활성 파라미터' 파레토 프론티어에 위치한다고 평가했다 — 같은 크기로 이보다 똑똑한 모델이 아직 없다는 뜻이다.

활성 파라미터 1.3B가 어느 정도인가
MoE(전문가 혼합) 구조는 모델 전체를 다 켜지 않고 필요한 일부만 켠다. 그래서 총 파라미터는 크고 활성 파라미터는 작다. 비교 대상인 NVIDIA Nemotron 3.5 Lightning이 30B 총 파라미터에 활성 3B, 앤트그룹이 지난 8월 7~8일 공개한 상위 모델 Ling 3.0 Flash가 총 124B다. Ling 3.0 Tiny의 1.3B는 이 계열에서도 눈에 띄게 작은 축이다. 작을수록 메모리를 덜 먹고, 덜 먹을수록 노트북이나 단일 GPU에서 돌릴 여지가 생긴다.
정답률 꼴찌, 지수는 상위 — 어떻게 가능한가
AA-Omniscience Index는 지식의 신뢰도를 재는 지표다. 맞히면 점수를 주고, 틀리면 깎고, 모른다고 물러서면 감점이 없다. -100에서 100 사이이며 0은 정답과 오답이 같은 수, 음수는 오답이 더 많다는 뜻이다. 소형 모델은 애초에 담고 있는 지식이 적어 대부분 음수대에 머문다.
| 모델 | Omniscience Index | 정답률 | 환각률 |
|---|---|---|---|
| Nemotron 3.5 Lightning | -18 | 14% | 38% |
| Ling 3.0 Tiny | -19 | 9% | 30% |
| Qwen3.6 35B A3B | -22 | 19% | 51% |
| Muse Glimmer (high) | -33 | 27% | 82% |
| Ministral 3 8B | -69 | 13% | 94% |
표를 가로로 읽으면 구조가 드러난다. Muse Glimmer는 정답률 27%로 가장 높지만 환각률이 82%다. 모르는 것까지 다 답하기 때문이다. Ling 3.0 Tiny는 정답률 9%로 목록 최하위인데도 지수는 -19로 두 번째다. Artificial Analysis는 이를 두고 "낮은 시도율이 환각을 줄였다"고 설명했다.
실무에서 이 차이는 크다. 문서 요약이나 사내 검색처럼 틀린 사실 하나가 전체 결과물을 망치는 작업에서는, 절반을 맞히고 절반을 지어내는 모델보다 모르면 침묵하는 모델이 다루기 쉽다. 반대로 폭넓은 상식 응답이 필요한 챗봇에는 어울리지 않는다.

대가는 토큰이다
공짜는 아니다. Ling 3.0 Tiny는 Intelligence Index 과제 하나를 푸는 데 평균 51k 출력 토큰을 썼다. 그중 32k가 답을 내기 전 스스로 따져보는 추론 토큰이다.
| 모델 | 과제당 출력 토큰 | |
|---|---|---|
| Ling 3.0 Tiny | 51k | 100 |
| Ling 3.0 Flash | 36k | 71 |
| Nemotron 3.5 Lightning | 31k | 61 |
| Qwen3.6 35B A3B | 31k | 61 |
| Gemma 4 31B | 5k | 10 |
Artificial Analysis 집계 기준으로 Nemotron 3.5 Lightning이나 Qwen3.6 35B A3B보다 약 65% 많다. 파라미터를 줄인 만큼 생각을 길게 해서 메운 셈이다. 모델이 작아 한 토큰을 뽑는 속도는 빠르지만, 뽑아야 할 토큰 수가 많으면 체감 대기 시간과 비용은 그만큼 늘어난다. 소형 추론 모델을 고를 때 파라미터 수만 보면 안 되는 이유다.

그래서 무엇이 달라지나
최근 몇 주 사이 소형 오픈웨이트 모델이 몰려나왔다. NVIDIA Nemotron 3.5 Lightning은 Intelligence Index 24점, Ling 3.0 Flash는 38점을 받았고 여기에 25점짜리 Ling 3.0 Tiny가 더해졌다. 점수만 보면 고만고만하다. 갈리는 건 성격이다. 어떤 모델은 속도로, 어떤 모델은 지식 폭으로, Ling 3.0 Tiny는 '틀린 말을 덜 한다'는 쪽으로 자기 자리를 잡았다.
오픈웨이트라 가중치를 내려받아 직접 돌릴 수 있다. 사내 문서 질의응답처럼 답을 못 하는 것보다 잘못 답하는 게 더 위험한 용도라면, 자체 서버에서 이런 모델을 시험해볼 선택지가 하나 늘었다. 다만 벤치마크의 낮은 시도율이 실제 서비스에서 "모르겠습니다"의 남발로 이어질지는 직접 돌려봐야 안다. 지표 한 줄로 결정할 문제는 아니다.





댓글