
이미지: @UnslothAI (X) 화면 갈무리
摘要
- 阿里巴巴Qwen推出的新款1250亿参数MoE模型Qwen3.8-Flash-Next,Unsloth于8月26日发布了适用于本地运行的GGUF版本
- 在1比特量化下,仅需75GB内存或统一内存即可在无GPU环境下运行,体积比原版BF16(355GB)小79%,但仍保持79%的top-1准确率
- 在Unsloth公布的对比表中,该模型在SWE-bench Pro、CoWorkBench、JobBench等所有有可比数据的项目上均超过了Claude Opus 4.6 Max
- 모델
- Qwen3.8-Flash-Next (알리바바 큐원 개발, 125B MoE, Qwen4 아키텍처 프리뷰)
- 컨텍스트 윈도우
- 262K 토큰
- 최소 구동 사양
- 75GB RAM/통합메모리 (1비트 양자화, GPU VRAM 불필요)
- 양자화 압축률
- BF16(355GB) 대비 79% 작은 용량, top-1 정확도 79% 유지
- 로컬 실행 지원 발표
- 언슬로스(Unsloth), 2026-08-26 X 게시물
- 벤치마크 비교(SWE-bench Pro)
- Qwen3.8-Flash-Next 62.5 vs 클로드 오퍼스 4.6 맥스 53.4
- GGUF 저장소
- huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF
阿里巴巴Qwen的新模型Qwen3.8-Flash-Next以开放权重形式登场后,Unsloth于8月26日发布了可在本地运行该模型的GGUF文件及使用指南。这是一款1250亿参数规模的MoE(专家混合)模型,但关键在于它无需服务器级GPU,仅凭75GB内存或统一内存就能运行。在Unsloth公布的对比表中,该模型在多项基准测试上超过了Anthropic的Claude Opus 4.6 Max。
Qwen4架构的首个预览版
Qwen3.8-Flash-Next是阿里巴巴一直在筹备的下一代Qwen4架构的首个预览模型。它采用能够同时处理文本和图像的多模态结构,支持262K token的上下文窗口,可以一次性读取并处理长文档或整个代码仓库。此前在8月14日,阿里巴巴Qwen曾以Apache 2.0协议发布270亿参数的密集模型Qwen3.8-27B,那款模型仅凭一张24GB级显卡就能运行。而这次的Qwen3.8-Flash-Next规模达到1250亿参数,接近前者的5倍,这一点有所不同。
75GB内存如何支撑运行
Unsloth将Qwen3.8-Flash-Next量化为从1比特到8比特的多个版本后发布。原版BF16权重高达355GB,而最轻量的1比特版本则缩减至75GB。
| 量化等级 | 所需内存 |
|---|---|
| 1比特 | 75GB |
| 2比特 | 79GB |
| 3比特 | 90GB |
| 4比特 | 112GB |
| 6比特 | 128GB |
| 8比特 | 156GB |
| BF16(原版) | 355GB |
表中数值以RAM与VRAM合计或统一内存总量为准。Unsloth表示,即便体积缩小了79%的1比特版本,其top-1准确率依然维持在79%。该模型结构独特,即使用CPU内存或统一内存进行推理,也能实现接近GPU显存的运算速度,因此特别适合Mac或NVIDIA DGX Spark等大内存设备。Unsloth在其发布文章中表示:"多亏了Qwen,我们才得以实现零日适配。"

基准测试:与Claude Opus 4.6 Max对比
| 基准测试 | Qwen3.8-Flash-Next | Claude Opus 4.6 Max |
|---|---|---|
| SWE-bench Pro(智能体编程) | 62.5 | 53.4 |
| SWE-bench Multilingual | 81.0 | 77.5 |
| NL2Repo-Bench | 48.1 | 47.6 |
| CoWorkBench(长期任务) | 73.9 | 68.2 |
| JobBench(专业工作) | 55.7 | 36.6 |
在Unsloth公布的对比表中,Qwen3.8-Flash-Next在两款模型均有分数的所有项目上都超过了Claude Opus 4.6 Max。尤其是在评估专业工作处理能力的JobBench项目上,Qwen3.8-Flash-Next以55.7分领先Claude(36.6分)近20分。不过这些数据是阿里巴巴Qwen与Unsloth自行公布的结果,目前尚未有第三方独立复现予以确认。
如何上手使用
要在本地运行Qwen3.8-Flash-Next,可以先参考Unsloth制作的指南文档和Hugging Face仓库。在Unsloth指南文档中可以查看安装步骤和针对不同硬件的推荐设置。
- 先确认自己电脑的RAM或统一内存容量。参照上表,如果达到75GB以上,可以选择1比特量化版本;如果内存更充裕,也可以选择4比特以上的版本。
- 前往huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF仓库下载所需量化等级的GGUF文件。
- 安装Unsloth发布的专用llama.cpp PR构建版或Unsloth Desktop应用。
- 加载下载好的GGUF文件后,无需额外的服务器GPU即可直接运行模型。
只要设备具备75GB以上的RAM或统一内存,即使没有GPU显存也能运行该模型。Unsloth以Mac和NVIDIA DGX Spark等大内存系统为例进行了说明。这意味着无需租用云端GPU,也能在个人工作站上尝试运行大型模型。
借助262K token的上下文窗口,可以一次性载入庞大的代码仓库或长文档,交给模型进行重构。例如可以用于SWE-bench Pro所测评的智能体编程任务,也可以应用于JobBench所涵盖的撰写报告、日程协调等办公场景。
编辑视角
这次发布中有一点尤为值得关注:阿里巴巴并没有把下一代Qwen4架构做成完成品才推出,而是先以预览版形式发布,用一款1250亿参数级别的MoE模型来试探市场反应。8月14日刚发布270亿参数的密集模型,短短十来天后就又推出规模接近5倍的模型,这种节奏让人感觉阿里巴巴正在密集填补开放权重产品线,坚定地走上与Anthropic、Google等闭源模型阵营正面竞争的路线。
如果说Qwen3.8-27B是一款靠一张24GB显卡就能运行的实用型模型,那么这次的Qwen3.8-Flash-Next规模大得多,却依然能仅凭内存、无需GPU运行,这种体验上的差异更为明显。从以往在本地部署同等规模开放模型的经验来看,过去往往需要多张GPU协同才能完成的任务,如今正逐渐转移到一台内存充足的工作站上就能完成。
对于国内企业来说,与其急着扩充服务器GPU,不如先在一台内存充裕的工作站或DGX Spark级别的设备上接入这类模型,试运行编程、文档处理等试点项目,性价比会更高。不过需要留意的是,这些基准测试数据是阿里巴巴和Unsloth自行公布的,最好不要跳过用企业自有数据进行验证的环节。
预计在未来几周内,Unsloth或其他社区很可能会发布针对该模型的独立基准测试或微调指南。而Qwen4正式版何时推出,恐怕也要看这次预览版的市场反响如何。




评论