
摘要
- 蚂蚁集团发布了开放权重小型模型Ling 3.0 Tiny,在Artificial Analysis Intelligence Index中取得25分。
- 总参数7.9B、激活参数1.3B,登上了“智能与激活参数之比”的帕累托前沿。
- 正确率仅9%,在对比组中垫底,但由于作答率只有37%,幻觉率以30%排名最低,同时每个任务的输出token数以51k居于首位。
不知道就不答
小模型战胜大模型的方法通常只有一个:不装懂。蚂蚁集团(Ant Group)推出的开放权重小型模型Ling 3.0 Tiny,只对37%的知识类问题尝试作答,其余的直接跳过。结果是,其给出错误答案的比例——也就是幻觉率——在12个对比模型中最低,仅为30%。
独立评测机构Artificial Analysis测得的这一模型的Intelligence Index得分为25分。总参数为7.9B,实际处理一个问题时被激活的参数仅为1.3B。Artificial Analysis评价称,该模型位于“智能与激活参数之比”的帕累托前沿——意味着目前还没有同等规模下更聪明的模型。

激活参数1.3B意味着什么
MoE(专家混合)结构不会一次性激活整个模型,而只启用所需的一部分,因此总参数很大,而激活参数很小。作为对比的NVIDIA Nemotron 3.5 Lightning总参数30B、激活3B,蚂蚁集团于8月7日至8日发布的上位模型Ling 3.0 Flash总参数达124B。相比之下,Ling 3.0 Tiny的1.3B在同系列中也显得格外小。参数越小,占用内存越少,也就越有可能在笔记本电脑或单张GPU上运行。
正确率垫底,指数却靠前——原因何在
AA-Omniscience Index是衡量知识可靠性的指标。答对加分,答错扣分,选择“不知道”则不扣分。得分区间为-100到100,0代表答对与答错数量相同,负数代表答错更多。小型模型本身储备的知识较少,大多停留在负值区间。
| 模型 | Omniscience Index | 正确率 | 幻觉率 |
|---|---|---|---|
| Nemotron 3.5 Lightning | -18 | 14% | 38% |
| Ling 3.0 Tiny | -19 | 9% | 30% |
| Qwen3.6 35B A3B | -22 | 19% | 51% |
| Muse Glimmer (high) | -33 | 27% | 82% |
| Ministral 3 8B | -69 | 13% | 94% |
横向读这张表,结构就显现出来了。Muse Glimmer正确率高达27%,位居第一,但幻觉率也高达82%——因为它连不知道的问题也全都作答。Ling 3.0 Tiny正确率仅9%,在列表中垫底,但指数却以-19排名第二。Artificial Analysis对此解释称:“较低的作答率降低了幻觉。”
在实际应用中,这一差异意义重大。在文档摘要或企业内部检索等一个错误事实就足以毁掉整体结果的任务中,宁可在不知道时保持沉默的模型,也比那种一半答对一半瞎编的模型更容易驾驭。反过来,对于需要广泛常识应答的聊天机器人而言,这种模型并不适合。

代价是token
天下没有免费的午餐。Ling 3.0 Tiny在解决一道Intelligence Index任务时,平均要用掉51k输出token,其中32k是在给出答案之前自我推敲的推理token。
| 模型 | 每任务输出token数 | |
|---|---|---|
| Ling 3.0 Tiny | 51k | 100 |
| Ling 3.0 Flash | 36k | 71 |
| Nemotron 3.5 Lightning | 31k | 61 |
| Qwen3.6 35B A3B | 31k | 61 |
| Gemma 4 31B | 5k | 10 |
按Artificial Analysis的统计口径,这一数字比Nemotron 3.5 Lightning或Qwen3.6 35B A3B多出约65%。可以说,参数削减的部分,是靠更长的“思考”来弥补的。由于模型体积小,生成单个token的速度较快,但如果需要生成的token数量多,实际感受到的等待时间和成本也会随之增加。这也是为什么在挑选小型推理模型时,不能只看参数数量。

那么这意味着什么
最近几周,小型开放权重模型接连问世。NVIDIA Nemotron 3.5 Lightning获得Intelligence Index 24分,Ling 3.0 Flash获得38分,如今又加入了25分的Ling 3.0 Tiny。单看分数,差距不大。真正的区别在于各自的特性。有的模型靠速度取胜,有的靠知识广度取胜,而Ling 3.0 Tiny则以“少说错话”找到了自己的定位。
由于是开放权重,可以下载权重自行运行。如果用途是企业内部文档问答这类场景——答错比答不出更危险——那么在自建服务器上试用这类模型,如今又多了一个选择。不过,基准测试中较低的作答率,是否会在实际服务中演变成“我不知道”的滥用,还需要亲自运行才能验证。这不是仅凭一项指标就能下定论的问题。





评论