每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

Qwen3.8 Max, 基准测试中略逊于开源模型Kimi K3

阿里巴巴新模型智能指数得分56分,单任务成本1.14美元……成本效益方面Kimi K3更胜一筹

이미지: METAL LAB 생성

摘要

  • 阿里巴巴发布了采用2.4T总参数MoE架构的Qwen3.8 Max
  • 该模型在Artificial Analysis Intelligence Index中获得56分,单任务成本为1.14美元
  • 开源模型Kimi K3以领先1分的成绩,用低25%的成本(0.86美元)实现了这一表现
모델명
Qwen3.8 Max (Alibaba Qwen)
구조
2.4T 총 파라미터 MoE(Mixture of Experts), 알리바바 발표 기준
Intelligence Index 점수
56점
작업당 비용
1.14달러
비교 대상
Kimi K3 (오픈 가중치 리더)
Kimi K3 비용 우위
Qwen3.8 Max 대비 25% 낮은 0.86달러
평가 기관
Artificial Analysis

阿里巴巴发布Qwen3.8 Max

阿里巴巴旗下Qwen团队发布了新一代大语言模型Qwen3.8 Max。阿里巴巴方面表示,该模型采用2.4T(2.4万亿)总参数规模的MoE(专家混合)架构。评测机构Artificial Analysis公布了使用其自有指标Intelligence Index对该模型进行测评的结果,并同时给出了与开放权重模型的对比结果。

基准测试结果:56分,单任务成本1.14美元

据Artificial Analysis显示,Qwen3.8 Max在Intelligence Index中获得56分,取得该分数所需成本为单任务1.14美元。在同一指标中,被视为开放权重模型领先者的Kimi K3虽然多得了1分,但成本反而更低。

模型Intelligence Index单任务成本(美元)
Qwen3.8 Max56 bar:561.14
Kimi K357(估算,领先1分) bar:570.86

成本效益差距

Artificial Analysis表示,Kimi K3的单任务成本比Qwen3.8 Max低25%。虽然分数差距仅为1分,但成本差距相当可观,在获得同等性能所需支付的成本方面,Kimi K3占据优势。相关帖子中说明道:"open weights leader Kimi K3 remains 1 point ahead at 25% lower cost per task"。

MoE架构与参数规模

据阿里巴巴披露,Qwen3.8 Max采用了拥有2.4T总参数的MoE架构设计。MoE架构的方式是仅激活全部参数中的一部分进行推理,其优点在于可以在拥有大规模参数的同时控制运算成本。不过从本次基准测试结果来看,参数规模庞大并不必然保证成本效益。

metallab.ai的Kimi K3相关报道也曾探讨过开源大语言模型生态的最新动向。

启示

此次对比被视为闭源大型模型与开放权重模型之间差距正在缩小的一个案例。尤其是开放权重模型在性价比指标上表现占优,这可能会对商用API价格竞争格局产生影响。不过需要谨慎解读的是,这些数据是基于Artificial Analysis自有基准测试标准得出的,采用其他评测方式可能会得出不同结果。