每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

蚂蚁集团Ling 3.0 Tiny,激活参数1.3B跑出智能指数25分

准确率在同类中垫底,但幻觉率30%最低。代价是每个答案要用掉5万个token。

AI 모델별 지능 지수와 파라미터 수 비교 차트

이미지: X — 벤치마크·평가 화면 갈무리

摘要

  • 蚂蚁集团发布了开放权重小型模型Ling 3.0 Tiny,在Artificial Analysis Intelligence Index中获得25分。
  • 该模型总参数7.9B、激活参数1.3B,登上了“智能相对于激活参数”的帕累托前沿。
  • 正确率9%,在对比组中垫底,但由于只尝试回答37%的问题,幻觉率仅30%,为最低水平;作为代价,其每任务输出token数达5.1万,为最高。
모델명
Ling 3.0 Tiny (앤트그룹, 오픈웨이트)
파라미터
총 7.9B / 활성 1.3B
Intelligence Index
25점 (Artificial Analysis v4.1.1)
AA-Omniscience Index
-19 (Nemotron 3.5 Lightning -18에 이어 표 내 2위)
정답률
9% (비교 목록 최하위, 최고는 Muse Glimmer high 27%)
환각률
30% (비교 목록 최저, Ministral 3 8B는 94%)
시도율
37% — 질문의 3분의 1가량에만 답을 시도
과제당 출력 토큰
51k (Ling 3.0 Flash 36k, Nemotron 3.5 Lightning·Qwen3.6 35B A3B는 각 31k)

不知道就不答

小模型战胜大模型,通常只有一条路:不装懂。蚂蚁集团(Ant Group)推出的开放权重小型模型Ling 3.0 Tiny,在知识类题目中只尝试回答了37%,其余全部跳过。结果是,其给出错误答案的比例——也就是幻觉率——为30%,在参与对比的12个模型中最低。

独立评测机构Artificial Analysis测得的该模型Intelligence Index得分为25。总参数为7.9B,实际处理一次提问时被激活的参数仅1.3B。Artificial Analysis评价称,该模型位于“智能相对于激活参数”的帕累托前沿——也就是说,目前还没有同等规模下比它更聪明的模型。

이미지: X — 벤치마크·평가

1.3B激活参数意味着什么

MoE(混合专家)结构不会全模型同时启动,只激活所需的一部分。因此总参数很大,激活参数却很小。作为对比的NVIDIA Nemotron 3.5 Lightning总参数30B、激活参数3B,蚂蚁集团于今年8月7日至8日发布的旗舰模型Ling 3.0 Flash总参数则达124B。Ling 3.0 Tiny的1.3B在这一系列中也是格外小的量级。越小,占用内存越少;占用越少,就越有可能在笔记本电脑或单张GPU上运行。

이미지: X — 벤치마크·평가

正确率垫底,指数却靠前——为什么会这样

AA-Omniscience Index是衡量知识可靠性的指标。答对加分,答错减分,承认不知道则不扣分。分值区间为-100到100,0代表答对与答错数量相同,负数代表答错更多。小型模型本身储备的知识量较少,大多停留在负分区间。

模型Omniscience Index正确率幻觉率
Nemotron 3.5 Lightning-1814%38%
Ling 3.0 Tiny-199%30%
Qwen3.6 35B A3B-2219%51%
Muse Glimmer (high)-3327%82%
Ministral 3 8B-6913%94%

横向看这张表,结构就一目了然。Muse Glimmer正确率27%为最高,但幻觉率高达82%,因为它连不知道的问题也全部作答。Ling 3.0 Tiny正确率9%排在列表末位,但指数却是-19,位居第二。Artificial Analysis解释称,“较低的尝试率降低了幻觉率”。

在实际业务中,这种差异很关键。在文档摘要或企业内部检索等场景中,一个错误事实就足以毁掉整份结果,这类任务中,一个不知道就沉默的模型,比一个答对一半、编造一半的模型更容易掌控。反过来,如果需要广泛常识应答的聊天机器人,这种模型就不太合适。

이미지: X — 벤치마크·평가

代价是token

天下没有免费的午餐。Ling 3.0 Tiny在解答Intelligence Index的一道题时,平均要用掉5.1万个输出token。其中3.2万是模型在给出答案前自行推理所用的token。

模型每任务输出token数
Ling 3.0 Tiny51k100
Ling 3.0 Flash36k71
Nemotron 3.5 Lightning31k61
Qwen3.6 35B A3B31k61
Gemma 4 31B5k10

按Artificial Analysis的统计口径,这一数字比Nemotron 3.5 Lightning或Qwen3.6 35B A3B多出约65%。减少参数所省下的部分,被拉长的思考过程填补了回来。模型体积小,生成单个token的速度更快,但如果需要生成的token总数更多,那么实际等待时间和成本上的优势就会被相应抵消。这也是选择小型推理模型时不能只看参数数量的原因。

由此带来的变化

最近几周,小型开放权重模型密集涌现。NVIDIA Nemotron 3.5 Lightning拿到Intelligence Index 24分,Ling 3.0 Flash拿到38分,如今又加入了25分的Ling 3.0 Tiny。单看分数,彼此相差不大。真正拉开差距的是各自的“性格”。有的模型靠速度取胜,有的凭知识广度立足,而Ling 3.0 Tiny则选择了“少说错话”这条路来确立自己的位置。

由于是开放权重模型,权重文件可以下载后自行部署运行。如果应用场景是企业内部文档问答之类——答错比答不上更危险——那么现在多了一个可以在自有服务器上测试的选项。不过,基准测试中较低的尝试率是否会在实际服务中演变成动辄“我不知道”的滥用,还得亲自跑一遍才能知道。这不是靠一行指标就能拍板的事。