METAL LAB

Qwen3.8-Max发布0902更新版本 强化编程与协作能力

阿里巴巴通过针对编程与协作的专项再训练重夺WorkArena榜首,但终端编程能力仍有差距

摘要

  • 阿里巴巴Qwen团队于9月2日发布了Qwen3.8-Max-0902。该版本保留了2.4万亿参数和100万Token上下文长度,并针对编程与协作能力进行了专项再训练。
  • TerminalBench 3.0得分从11.3跃升至29.0,但仍未追上Claude Opus5的42.7分。

Qwen3.8-Max升级至0902版本

阿里巴巴Qwen官方网站

居中的Qwen0902节点延伸出两条虚线箭头。一条指向Claude5,标注为"编程差距",表明在终端编程基准测试中仍落后于Claude。另一条指向GPT5.6,标注为"协作差距",显示在WorkArena协作指数上也仍未超越GPT5.6。两条差距均以虚线绘制,暗示这并非已完全固化的排名,而是仍有可能缩小的差距。居中的Qwen0902节点延伸出两条虚线箭头。一条指向Claude5,标注为"编程差距",表明在终端编程基准测试中仍落后于Claude。另一条指向GPT5.6,标注为"协作差距",显示在WorkArena协作指数上也仍未超越GPT5.6。两条差距均以虚线绘制,暗示这并非已完全固化的排名,而是仍有可能缩小的差距。

阿里巴巴Qwen团队于9月2日通过官方X账号发布了Qwen3.8-Max的新版本——Qwen3.8-Max-0902。团队表示,该版本保留了原有的2.4万亿参数混合专家(MoE)架构和100万Token上下文窗口,并额外针对编程与协作(Coding & Cowork)任务进行训练,从而提升了在复杂企业业务和科研任务中的表现。

具体来说,Qwen3.8-Max是阿里巴巴的旗舰语言模型,上月初首次发布,8月初曾在智能体指数(Agentic Index)上登顶第一。此次的0902版本并非全新模型,而是在原模型基础上,针对编程和办公协作任务重新训练后的后续版本。

相关报道:Qwen3.8-Max智能体指数登顶第一、综合智能指数排名第五

编程基准测试:大幅提升,但差距犹存

从阿里巴巴公布的对比表来看,大部分编程相关指标较前一版本有明显提升。不过与Claude Opus5相比,仍有多项指标未能反超。

基准测试0902版本前一版本Claude Opus5Fable5GPT5.6 Sol
终端智能体编程 (TerminalBench 3.0)29.011.342.734.034.6
仓库级代码生成 (NL2Repo-Bench)64.955.972.370.2--
复杂实务软件工程 (QwenSWEBench V2)70.055.168.067.1--

其中,TerminalBench 3.0的得分从11.3跃升至29.0,几乎提升了近三倍,但与Claude Opus5的42.7分相比仍有超过13分的差距。相反,在QwenSWEBench V2等阿里巴巴自研的基准测试中,该版本反超了Claude Opus5。

이미지: @Alibaba_Qwen (X)

办公任务智能体:在WorkArena上超越Claude

在衡量长周期办公任务和职务执行能力的指标上,结果则更为均衡。

基准测试0902版本前一版本Claude Opus5Fable5GPT5.6 Sol
长周期办公任务 (CoWorkBench)76.174.879.675.971.5
专业职务任务 (JobBench)64.053.467.857.445.4
专家评估协作指数 (WorkArena Elo)146813481437--1482

WorkArena是通过人工对29个行业、145项任务进行评分后得出的Elo分数。0902版本在该指标上获得1468分,超过了Claude Opus5的1437分,但仍不及GPT5.6 Sol的1482分。评估方式在脚注中另有说明,团队表示自动化工作流指标Automation Bench v1.0.6是在纳入Automation Bench PR #16之后测得的。

이미지: @Alibaba_Qwen (X)

多模态与具身智能:在机器人感知基准上表现强劲

在需要同时理解图像和视频的多模态指标上,0902版本展现出明显优势。

基准测试0902版本前一版本Claude Opus5Fable5GPT5.6 Sol
具身智能 (ERQA)78.377.867.370.070.0
通用视觉推理 (BabyVision)93.891.3--90.588.9
STEM视觉推理 (MMMU-Pro)82.782.382.681.283.0

编辑视角

"0902"这个版本命名方式本身就体现了阿里巴巴的发布策略。团队没有推出全新模型,而是在保持相同参数规模和上下文架构的基础上,只针对特定任务群追加训练——这样做既能省去从零训练模型的成本,又能精准追赶竞品在特定领域的优势。相比上月初发布时甚至没有公开激活参数量的做法,这次至少用具体数字明确展示了哪些任务上有了实质提升。

从实际应用角度看,这类再训练式更新的结论往往大同小异——某项基准分数大幅提升的模型,通常只在该基准所代表的任务群上体感明显,其余领域与前一版本相比差别不大。这一次也是如此:对于依赖终端的长时间自主编程任务,继续选择Claude Opus5仍是更稳妥的做法;但正如WorkArena分数所暗示的那样,如果是企业内部文档处理或重复性办公自动化任务,Qwen可能是性价比更高的替代方案。

对国内企业而言,可以借鉴的思路很明确:引入编程智能体时不必强求一个模型覆盖所有任务,而是可以按任务类型分别配置——长周期终端任务交给其他模型处理,办公自动化和文档处理则不妨试试Qwen3.8-Max-0902。可以预见,未来几周内Claude或OpenAI阵营很可能也会推出类似的专项再训练版本——这或许正说明,前沿模型的竞争正从"全面重训"转向按任务群精准更新的阶段。

评论