工作日早上 7 点读 AI,周日早上 8 点读周报订阅邮件

METAL LAB

Qwen新模型Qwen3.8-Flash-Next发布,75GB内存即可本地运行

这款1250亿参数MoE模型无需GPU、仅靠内存就能运行,在多项基准测试中超过了Claude Opus 4.6 Max

Qwen3.8-Flash-Next 모델의 RAM 요구사항과 성능 벤치마크 표

이미지: @UnslothAI (X) 화면 갈무리

摘要

  • 阿里巴巴Qwen推出的新款1250亿参数MoE模型Qwen3.8-Flash-Next,Unsloth于8月26日发布了适用于本地运行的GGUF版本
  • 在1比特量化下,仅需75GB内存或统一内存即可在无GPU环境下运行,体积比原版BF16(355GB)小79%,但仍保持79%的top-1准确率
  • 在Unsloth公布的对比表中,该模型在SWE-bench Pro、CoWorkBench、JobBench等所有有可比数据的项目上均超过了Claude Opus 4.6 Max
모델
Qwen3.8-Flash-Next (알리바바 큐원 개발, 125B MoE, Qwen4 아키텍처 프리뷰)
컨텍스트 윈도우
262K 토큰
최소 구동 사양
75GB RAM/통합메모리 (1비트 양자화, GPU VRAM 불필요)
양자화 압축률
BF16(355GB) 대비 79% 작은 용량, top-1 정확도 79% 유지
로컬 실행 지원 발표
언슬로스(Unsloth), 2026-08-26 X 게시물
벤치마크 비교(SWE-bench Pro)
Qwen3.8-Flash-Next 62.5 vs 클로드 오퍼스 4.6 맥스 53.4
GGUF 저장소
huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF

阿里巴巴Qwen的新模型Qwen3.8-Flash-Next以开放权重形式登场后,Unsloth于8月26日发布了可在本地运行该模型的GGUF文件及使用指南。这是一款1250亿参数规模的MoE(专家混合)模型,但关键在于它无需服务器级GPU,仅凭75GB内存或统一内存就能运行。在Unsloth公布的对比表中,该模型在多项基准测试上超过了AnthropicClaude Opus 4.6 Max。

一个厚重的圆圈代表355GB的原始模型,沿箭头方向压缩成半满的圆圈,即75GB,同时仍保持79%的准确率。从这个压缩模型出发,一条虚线箭头延伸至代表Claude Opus的更大圆圈,表示在自行公布的基准测试中超越了它。

Qwen4架构的首个预览版

Qwen3.8-Flash-Next是阿里巴巴一直在筹备的下一代Qwen4架构的首个预览模型。它采用能够同时处理文本和图像的多模态结构,支持262K token的上下文窗口,可以一次性读取并处理长文档或整个代码仓库。此前在8月14日,阿里巴巴Qwen曾以Apache 2.0协议发布270亿参数的密集模型Qwen3.8-27B,那款模型仅凭一张24GB级显卡就能运行。而这次的Qwen3.8-Flash-Next规模达到1250亿参数,接近前者的5倍,这一点有所不同。

75GB内存如何支撑运行

Unsloth将Qwen3.8-Flash-Next量化为从1比特到8比特的多个版本后发布。原版BF16权重高达355GB,而最轻量的1比特版本则缩减至75GB。

量化等级所需内存
1比特75GB
2比特79GB
3比特90GB
4比特112GB
6比特128GB
8比特156GB
BF16(原版)355GB

表中数值以RAM与VRAM合计或统一内存总量为准。Unsloth表示,即便体积缩小了79%的1比特版本,其top-1准确率依然维持在79%。该模型结构独特,即使用CPU内存或统一内存进行推理,也能实现接近GPU显存的运算速度,因此特别适合Mac或NVIDIA DGX Spark等大内存设备。Unsloth在其发布文章中表示:"多亏了Qwen,我们才得以实现零日适配。"

Claude analyzes a spreadsheet containing Acme Grille, Inc.'s consolidated income statement from 2020-2024, providing real-time guidance on financial modeling.

基准测试:与Claude Opus 4.6 Max对比

基准测试Qwen3.8-Flash-NextClaude Opus 4.6 Max
SWE-bench Pro(智能体编程)62.553.4
SWE-bench Multilingual81.077.5
NL2Repo-Bench48.147.6
CoWorkBench(长期任务)73.968.2
JobBench(专业工作)55.736.6

在Unsloth公布的对比表中,Qwen3.8-Flash-Next在两款模型均有分数的所有项目上都超过了Claude Opus 4.6 Max。尤其是在评估专业工作处理能力的JobBench项目上,Qwen3.8-Flash-Next以55.7分领先Claude(36.6分)近20分。不过这些数据是阿里巴巴Qwen与Unsloth自行公布的结果,目前尚未有第三方独立复现予以确认。

如何上手使用

要在本地运行Qwen3.8-Flash-Next,可以先参考Unsloth制作的指南文档和Hugging Face仓库。在Unsloth指南文档中可以查看安装步骤和针对不同硬件的推荐设置。

  1. 先确认自己电脑的RAM或统一内存容量。参照上表,如果达到75GB以上,可以选择1比特量化版本;如果内存更充裕,也可以选择4比特以上的版本。
  2. 前往huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF仓库下载所需量化等级的GGUF文件。
  3. 安装Unsloth发布的专用llama.cpp PR构建版或Unsloth Desktop应用。
  4. 加载下载好的GGUF文件后,无需额外的服务器GPU即可直接运行模型。

只要设备具备75GB以上的RAM或统一内存,即使没有GPU显存也能运行该模型。Unsloth以Mac和NVIDIA DGX Spark等大内存系统为例进行了说明。这意味着无需租用云端GPU,也能在个人工作站上尝试运行大型模型。

借助262K token的上下文窗口,可以一次性载入庞大的代码仓库或长文档,交给模型进行重构。例如可以用于SWE-bench Pro所测评的智能体编程任务,也可以应用于JobBench所涵盖的撰写报告、日程协调等办公场景。

编辑视角

这次发布中有一点尤为值得关注:阿里巴巴并没有把下一代Qwen4架构做成完成品才推出,而是先以预览版形式发布,用一款1250亿参数级别的MoE模型来试探市场反应。8月14日刚发布270亿参数的密集模型,短短十来天后就又推出规模接近5倍的模型,这种节奏让人感觉阿里巴巴正在密集填补开放权重产品线,坚定地走上与Anthropic、Google等闭源模型阵营正面竞争的路线。

如果说Qwen3.8-27B是一款靠一张24GB显卡就能运行的实用型模型,那么这次的Qwen3.8-Flash-Next规模大得多,却依然能仅凭内存、无需GPU运行,这种体验上的差异更为明显。从以往在本地部署同等规模开放模型的经验来看,过去往往需要多张GPU协同才能完成的任务,如今正逐渐转移到一台内存充足的工作站上就能完成。

对于国内企业来说,与其急着扩充服务器GPU,不如先在一台内存充裕的工作站或DGX Spark级别的设备上接入这类模型,试运行编程、文档处理等试点项目,性价比会更高。不过需要留意的是,这些基准测试数据是阿里巴巴和Unsloth自行公布的,最好不要跳过用企业自有数据进行验证的环节。

预计在未来几周内,Unsloth或其他社区很可能会发布针对该模型的独立基准测试或微调指南。而Qwen4正式版何时推出,恐怕也要看这次预览版的市场反响如何。

评论