
이미지: METAL LAB 생성
摘要
- 一位r/LocalLLaMA用户试用阿里巴巴Qwen3.8 Max正式版后,对其速度和方案审查能力给予高度评价
- 该评测者称,这款模型能很好地识别不必要的复杂性和重复组件,在实验设计上也表现出较强的试图反驳假设的态度
- Qwen3.8 Max在今年8月的发布中曾在Artificial Analysis Agentic Index排名第一,在Intelligence Index上排名第五(56分)
- 모델명
- Qwen3.8 Max (알리바바 Qwen)
- 리뷰 출처
- r/LocalLLaMA, 2026-08-14 게시
- 파라미터 구조
- 2.4조 총 파라미터 MoE(8월 8일 알리바바 발표 기준)
- Artificial Analysis Intelligence Index
- 56점, 5위
- Artificial Analysis Agentic Index
- 1위
- 작업당 비용
- 1.14달러 (Kimi K3는 0.86달러로 1점 앞선 점수 기록)
- 리뷰어가 꼽은 강점
- 속도, 기획 검토, 실험 설계, 자기 교정, 인프라 작업, 창작 구현
用过的人先发现了什么
一位从早期API预览版一直用到正式发布版的r/LocalLLaMA用户评价称,Qwen3.8 Max是"会自动筛除不必要内容的模型"。这篇评测的核心观点是:以这个模型的体量而言,响应速度格外快,而且在给出答案之前会自我回溯检查假设、发现并纠正错误的频率也比较高。虽然这只是用户的实际使用体验,并非官方发布的内容,但其中包含的具体观察足以引起社区关注。
评测者给出最高评价的部分是方案与设计审查能力。他表示,在追问"这真的都有必要吗"这一点上,这是他用过的所有模型中表现最好的。许多模型都很擅长生成听起来精致、说得过去的复杂架构,而Qwen3.8 Max则善于指出过早的抽象、重复组件、不必要的服务,以及过多的可动部件。不过他也补充说,这款模型并非一味简化,而是能区分真正必要的复杂性与只会增加维护难度的复杂性。
在实验设计和基础设施工作中也表现不俗
在用于研究目的时,评测也给出了较高的评价。据其描述,这款模型能够提出有用的消融实验(ablation),指出混杂变量,并质疑比较是否公平,令人印象深刻。评测者称,这款模型不仅仅是生成支持假设的证据,还有一种真正推动能够反驳假设的实验的倾向。这与许多模型不管结果如何都乖乖配合、帮忙设计让所提方法显得不错的实验形成了对比。
在加密、基于角色的访问控制(RBAC)、服务器安全配置等基础设施类任务中,该模型对上下文的处理也不错,据称在类似任务中比其他模型出现不必要拒绝回答的情况更少。
背景:2.4万亿参数与褒贬不一的基准测试成绩
根据阿里巴巴Qwen团队8月6日通过X官方账号公布的成绩单,Qwen3.8-Max在Artificial Analysis Intelligence Index中排名第五(56分),在同一体系的Agentic Index中排名第一。不过就架构而言,据悉这款模型是总参数规模达2.4万亿的MoE(Mixture of Experts,即从众多专家神经网络中只挑选所需的一部分来使用的结构),其Intelligence Index分数比开源模型Kimi K3低1分。单任务成本为1.14美元,比Kimi K3(0.86美元)高出25%。
| 项目 | Qwen3.8 Max | Kimi K3 |
|---|---|---|
| Intelligence Index 分数 | 56 bar:56 | 57 bar:57 |
| 单任务成本(美元) | 1.14 bar:57 | 0.86 bar:43 |
| 公开形式 | 非公开(API) | 开放权重 |
评测者还提到了总参数规模竞争再度升温的趋势。他观察到,一段时间以来行业曾专注于稀疏化和效率,力求用更少的激活参数榨取更多智能,但如今总参数规模又开始变大。他半开玩笑地展望道:"接下来就看GLM是否会突破3万亿了。"
甚至涉足了创意类任务
出乎意料的一点是创意类任务的实现能力。评测者曾用这款模型配合视频制作工具Remotion制作产品演示视频,称其在排版、留白、克制的表现手法、镜头运动以及功能展示时机的把控上都有不错的分寸感。有一次,模型甚至自己写了一段JavaScript脚本来分析音乐并将剪辑转场与节拍对齐,据称最终成片的剪辑感明显更有意图性。
这意味着什么
这篇评测终究是社区用户的使用体验,而非官方发布内容,有其局限性,但它展示了单靠基准分数难以体现的实际使用感受,值得关注。虽然在综合智能得分上略逊于开源模型,但在方案审查、剔除不必要复杂性等实务型任务上反而显示出优势。对于需要搭建代码架构或设计研究实验的从业者来说,这类实际使用反馈可能比排行榜分数更具参考价值。



