
摘要
- 阿里巴巴Qwen团队于9月2日发布了Qwen3.8-Max-0902。该版本保留了2.4万亿参数和100万Token上下文长度,并针对编程与协作能力进行了专项再训练。
- TerminalBench 3.0得分从11.3跃升至29.0,但仍未追上Claude Opus5的42.7分。
Qwen3.8-Max升级至0902版本
阿里巴巴Qwen团队于9月2日通过官方X账号发布了Qwen3.8-Max的新版本——Qwen3.8-Max-0902。团队表示,该版本保留了原有的2.4万亿参数混合专家(MoE)架构和100万Token上下文窗口,并额外针对编程与协作(Coding & Cowork)任务进行训练,从而提升了在复杂企业业务和科研任务中的表现。
具体来说,Qwen3.8-Max是阿里巴巴的旗舰语言模型,上月初首次发布,8月初曾在智能体指数(Agentic Index)上登顶第一。此次的0902版本并非全新模型,而是在原模型基础上,针对编程和办公协作任务重新训练后的后续版本。
相关报道:Qwen3.8-Max智能体指数登顶第一、综合智能指数排名第五
编程基准测试:大幅提升,但差距犹存
从阿里巴巴公布的对比表来看,大部分编程相关指标较前一版本有明显提升。不过与Claude Opus5相比,仍有多项指标未能反超。
| 基准测试 | 0902版本 | 前一版本 | Claude Opus5 | Fable5 | GPT5.6 Sol |
|---|---|---|---|---|---|
| 终端智能体编程 (TerminalBench 3.0) | 29.0 | 11.3 | 42.7 | 34.0 | 34.6 |
| 仓库级代码生成 (NL2Repo-Bench) | 64.9 | 55.9 | 72.3 | 70.2 | -- |
| 复杂实务软件工程 (QwenSWEBench V2) | 70.0 | 55.1 | 68.0 | 67.1 | -- |
其中,TerminalBench 3.0的得分从11.3跃升至29.0,几乎提升了近三倍,但与Claude Opus5的42.7分相比仍有超过13分的差距。相反,在QwenSWEBench V2等阿里巴巴自研的基准测试中,该版本反超了Claude Opus5。

办公任务智能体:在WorkArena上超越Claude
在衡量长周期办公任务和职务执行能力的指标上,结果则更为均衡。
| 基准测试 | 0902版本 | 前一版本 | Claude Opus5 | Fable5 | GPT5.6 Sol |
|---|---|---|---|---|---|
| 长周期办公任务 (CoWorkBench) | 76.1 | 74.8 | 79.6 | 75.9 | 71.5 |
| 专业职务任务 (JobBench) | 64.0 | 53.4 | 67.8 | 57.4 | 45.4 |
| 专家评估协作指数 (WorkArena Elo) | 1468 | 1348 | 1437 | -- | 1482 |
WorkArena是通过人工对29个行业、145项任务进行评分后得出的Elo分数。0902版本在该指标上获得1468分,超过了Claude Opus5的1437分,但仍不及GPT5.6 Sol的1482分。评估方式在脚注中另有说明,团队表示自动化工作流指标Automation Bench v1.0.6是在纳入Automation Bench PR #16之后测得的。

多模态与具身智能:在机器人感知基准上表现强劲
在需要同时理解图像和视频的多模态指标上,0902版本展现出明显优势。
| 基准测试 | 0902版本 | 前一版本 | Claude Opus5 | Fable5 | GPT5.6 Sol |
|---|---|---|---|---|---|
| 具身智能 (ERQA) | 78.3 | 77.8 | 67.3 | 70.0 | 70.0 |
| 通用视觉推理 (BabyVision) | 93.8 | 91.3 | -- | 90.5 | 88.9 |
| STEM视觉推理 (MMMU-Pro) | 82.7 | 82.3 | 82.6 | 81.2 | 83.0 |
编辑视角
"0902"这个版本命名方式本身就体现了阿里巴巴的发布策略。团队没有推出全新模型,而是在保持相同参数规模和上下文架构的基础上,只针对特定任务群追加训练——这样做既能省去从零训练模型的成本,又能精准追赶竞品在特定领域的优势。相比上月初发布时甚至没有公开激活参数量的做法,这次至少用具体数字明确展示了哪些任务上有了实质提升。
从实际应用角度看,这类再训练式更新的结论往往大同小异——某项基准分数大幅提升的模型,通常只在该基准所代表的任务群上体感明显,其余领域与前一版本相比差别不大。这一次也是如此:对于依赖终端的长时间自主编程任务,继续选择Claude Opus5仍是更稳妥的做法;但正如WorkArena分数所暗示的那样,如果是企业内部文档处理或重复性办公自动化任务,Qwen可能是性价比更高的替代方案。
对国内企业而言,可以借鉴的思路很明确:引入编程智能体时不必强求一个模型覆盖所有任务,而是可以按任务类型分别配置——长周期终端任务交给其他模型处理,办公自动化和文档处理则不妨试试Qwen3.8-Max-0902。可以预见,未来几周内Claude或OpenAI阵营很可能也会推出类似的专项再训练版本——这或许正说明,前沿模型的竞争正从"全面重训"转向按任务群精准更新的阶段。





评论