每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

Qwen3.8 Max 因擅长筛除"没必要做的东西"获好评

r/LocalLLaMA 用户点赞其速度、方案审查与自我纠错能力,背后是2.4万亿参数规模及Agentic Index排名第一的成绩

이미지: METAL LAB 생성

摘要

  • 一位r/LocalLLaMA用户试用阿里巴巴Qwen3.8 Max正式版后,对其速度和方案审查能力给予高度评价
  • 该评测者称,这款模型能很好地识别不必要的复杂性和重复组件,在实验设计上也表现出较强的试图反驳假设的态度
  • Qwen3.8 Max在今年8月的发布中曾在Artificial Analysis Agentic Index排名第一,在Intelligence Index上排名第五(56分)
모델명
Qwen3.8 Max (알리바바 Qwen)
리뷰 출처
r/LocalLLaMA, 2026-08-14 게시
파라미터 구조
2.4조 총 파라미터 MoE(8월 8일 알리바바 발표 기준)
Artificial Analysis Intelligence Index
56점, 5위
Artificial Analysis Agentic Index
1위
작업당 비용
1.14달러 (Kimi K3는 0.86달러로 1점 앞선 점수 기록)
리뷰어가 꼽은 강점
속도, 기획 검토, 실험 설계, 자기 교정, 인프라 작업, 창작 구현

用过的人先发现了什么

一位从早期API预览版一直用到正式发布版的r/LocalLLaMA用户评价称,Qwen3.8 Max是"会自动筛除不必要内容的模型"。这篇评测的核心观点是:以这个模型的体量而言,响应速度格外快,而且在给出答案之前会自我回溯检查假设、发现并纠正错误的频率也比较高。虽然这只是用户的实际使用体验,并非官方发布的内容,但其中包含的具体观察足以引起社区关注。

评测者给出最高评价的部分是方案与设计审查能力。他表示,在追问"这真的都有必要吗"这一点上,这是他用过的所有模型中表现最好的。许多模型都很擅长生成听起来精致、说得过去的复杂架构,而Qwen3.8 Max则善于指出过早的抽象、重复组件、不必要的服务,以及过多的可动部件。不过他也补充说,这款模型并非一味简化,而是能区分真正必要的复杂性与只会增加维护难度的复杂性。

在实验设计和基础设施工作中也表现不俗

在用于研究目的时,评测也给出了较高的评价。据其描述,这款模型能够提出有用的消融实验(ablation),指出混杂变量,并质疑比较是否公平,令人印象深刻。评测者称,这款模型不仅仅是生成支持假设的证据,还有一种真正推动能够反驳假设的实验的倾向。这与许多模型不管结果如何都乖乖配合、帮忙设计让所提方法显得不错的实验形成了对比。

在加密、基于角色的访问控制(RBAC)、服务器安全配置等基础设施类任务中,该模型对上下文的处理也不错,据称在类似任务中比其他模型出现不必要拒绝回答的情况更少。

背景:2.4万亿参数与褒贬不一的基准测试成绩

根据阿里巴巴Qwen团队8月6日通过X官方账号公布的成绩单,Qwen3.8-Max在Artificial Analysis Intelligence Index中排名第五(56分),在同一体系的Agentic Index中排名第一。不过就架构而言,据悉这款模型是总参数规模达2.4万亿的MoE(Mixture of Experts,即从众多专家神经网络中只挑选所需的一部分来使用的结构),其Intelligence Index分数比开源模型Kimi K3低1分。单任务成本为1.14美元,比Kimi K3(0.86美元)高出25%。

项目Qwen3.8 MaxKimi K3
Intelligence Index 分数56 bar:5657 bar:57
单任务成本(美元)1.14 bar:570.86 bar:43
公开形式非公开(API)开放权重

评测者还提到了总参数规模竞争再度升温的趋势。他观察到,一段时间以来行业曾专注于稀疏化和效率,力求用更少的激活参数榨取更多智能,但如今总参数规模又开始变大。他半开玩笑地展望道:"接下来就看GLM是否会突破3万亿了。"

甚至涉足了创意类任务

出乎意料的一点是创意类任务的实现能力。评测者曾用这款模型配合视频制作工具Remotion制作产品演示视频,称其在排版、留白、克制的表现手法、镜头运动以及功能展示时机的把控上都有不错的分寸感。有一次,模型甚至自己写了一段JavaScript脚本来分析音乐并将剪辑转场与节拍对齐,据称最终成片的剪辑感明显更有意图性。

这意味着什么

这篇评测终究是社区用户的使用体验,而非官方发布内容,有其局限性,但它展示了单靠基准分数难以体现的实际使用感受,值得关注。虽然在综合智能得分上略逊于开源模型,但在方案审查、剔除不必要复杂性等实务型任务上反而显示出优势。对于需要搭建代码架构或设计研究实验的从业者来说,这类实际使用反馈可能比排行榜分数更具参考价值。