每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

Qwen3.8 27B, 出色但默认设置"过度思考"

Simon Willison评测:画一个圆也要用xhigh推理浪费数分钟

자전거를 타는 펠리컨 캐릭터가 해변 도로를 달리는 일러스트

이미지: Hacker News (200↑)

摘要

  • 阿里巴巴Qwen实验室发布的270亿参数模型Qwen3.8 27B将默认推理强度设为xhigh,有评测指出该模型在简单请求上也会过度思考
  • 在鹈鹕自行车SVG测试中,开启推理时耗时21分钟、消耗22276个推理token,而关闭推理后仅用137秒完成
  • 在128GB MacBook Pro和NVIDIA DGX Spark上进行的测试中,该模型在编码代理集成和图像边界框任务上表现良好
原文视频
모델명
Qwen3.8 27B (알리바바 큐원랩, Apache 2.0 라이선스)
전작
Qwen3.6 27B
기본 추론 강도
xhigh (큐원 공식 문서 명시)
펠리컨 SVG 소요 시간(추론 켬)
21분, 추론 토큰 22,276개, 출력 토큰 3,223개
펠리컨 SVG 소요 시간(추론 끔)
137초, 출력 토큰 3,715개
테스트 하드웨어
128GB M5 Max 맥북 프로, 엔비디아 DGX Spark
실행 환경
LM Studio, 17GB Q4_K_M 양자화 빌드, llama-server

一只耗时21分钟的鹈鹕

Simon Willison在测试本地LLM时有一个惯用的问题:"用SVG画一只骑自行车的鹈鹕"。他向Qwen3.8 27B提出这个问题后,足足等了21分钟才得到答案。模型消耗了22276个推理token后,才勉强给出一份3223个token的SVG。结果本身相当出色,堪称本地运行模型中最精细的鹈鹕SVG,但为达到这种完成度所付出的时间成了问题。

Qwen3.8 27B是一款什么样的模型

Qwen3.8 27B是阿里巴巴Qwen实验室以Apache 2.0许可发布的一款270亿参数级、支持视觉功能的语言模型。在27B——一台游戏笔记本电脑就能顺畅运行的规模——级别模型中,由于前代Qwen3.6 27B获得过不错的评价,这款后续模型自然受到关注。据悉,在阿里巴巴公布的自有基准测试中,该模型不仅超越前代,还超过了曾是Qwen系列顶级产品的闭源模型Qwen3.7-Plus。不过这一数据是阿里巴巴自行公布的,尚未得到独立机构的验证。

问题在于"想太多"的默认设置

Willison在配备128GB内存的M5 Max MacBook Pro和NVIDIA DGX Spark两台设备上运行LM Studio对该模型进行了测试。实际运行的构建版本是磁盘容量为17GB的Q4_K_M量化版本,在DGX Spark上他还直接启动了llama-server进行测试。

问题的根源在于模型设置。Qwen官方文档将该模型的reasoning_effort推理强度默认值指定为"xhigh",而LM Studio发布的GGUF构建版本也原样沿用了这一设置。再加上LM Studio默认的8192 token上下文长度限制,导致模型即便面对"画一个圆"这种极其简单的请求,也会把剩余token全部耗费在思考上。Willison将上下文长度扩大到该模型支持的最大值262144个token后,才避免了这一问题。

画圆测试最能说明这一现象。在xhigh默认设置开启的状态下,模型的推理过程以"The user is asking for an SVG drawing of a circle"(用户要求绘制一个圆的SVG)开始,随后自行添加了同心圆、圆规刻度乃至柔和的动画效果,耗费了数分钟时间。结果虽然美观,却并非最初要求的"一个圆"。

推理开/关对比

项目开启推理(xhigh默认值)关闭推理
耗时21分钟137秒(约2分17秒)
推理token22276个不适用
输出token3223个3715个

关闭推理的版本虽未能一次性生成理想的图像,但在2分钟内就给出了答案。相反,在边界框测试——一项需要用坐标标出照片中物体位置的视觉任务——中,开启推理时鹈鹕照片上的边界框位置准确无误,而关闭后边界框位置则出现偏差。这说明推理并非全无意义的浪费。

用作编码代理也试过了

Willison将系统提示较短、对小型模型更友好的代理工具"Pi"与Qwen3.8 27B连接了起来。他在DGX Spark上用LM Studio启动模型后,通过tailscale serve进行共享,并将其注册到~/.pi/agent/models.json配置文件中,在实际的开发文件夹中让模型执行任务。模型在多个文件间往返,反复进行推理和工具调用后给出了可用的答案,随后还自行编写并成功运行了一个将对话日志文件(JSONL)转换为Markdown格式的Python脚本。这意味着一个17GB的本地模型已经能够胜任代码编写、工具调用、图像标注等实际工作中所需的大部分功能。

编辑视角

这份评测的有趣之处不在于炫耀性能,而在于精准指出了"默认设置的陷阱"。阿里巴巴在文档中明确表示官方支持可调节推理强度的reasoning_effort选项。但实际发布的GGUF构建版本默认值却是最重的xhigh,而下载使用的普通用户大多对此一无所知,结果画一个圆都要耗费数分钟。开源模型的短板往往不在于模型本身的实力,而在于发布环节的默认设置,这种情况其实并不少见。

从将27B级本地模型接入实际工作的经验来看,结论总是相似的——如果原样开启推理型模型,在简单任务上会拖慢体感速度,但在复杂的视觉、编码任务中,推理反而能提高准确率。也就是说,根据任务类型随时调低或关闭推理强度的习惯必不可少。自8月初发布以来,Qwen3.8系列持续占据Hugging Face热门榜和本地推理排行榜前列,这一趋势与其灵活性不无关系。

从实操角度看,这款模型值得那些希望在个人笔记本电脑或小型工作站上运行代码编写、图像标注、简单代理任务的团队一试。不过在部署前必须确认上下文长度和reasoning_effort默认值,并根据需要进行调低。如果不做这一调整就直接接入服务,可能会导致响应时间延迟。

预计未来数周内,LM Studio、Ollama等部署工具很可能会针对这一问题进行更新,调低默认的reasoning_effort值或向用户提供明确提示。与此同时,独立基准测试机构对Qwen3.8 27B自我公布分数的验证结果预计也将很快出炉。