每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

Qwen3.8-27B, 笔记本电脑上运行竟胜过Gemini 3.7 Flash

阿里巴巴Qwen以用户本地运行对比案例为卖点,强调27B模型的竞争力

WebGPU로 브라우저에서 3D 블록 세계를 생성하는 Qwen 데모 화면

이미지: X — 모델·오픈소스 영상 갈무리

摘要

  • 阿里巴巴Qwen于8月18日通过官方X账号介绍了自家27B模型的本地运行演示及用户对比案例
  • 用户AJ表示,在相同提示词下制作的Three.js水面模拟测试中,Qwen3.8-27B超过了谷歌Gemini 3.7 Flash
  • 该测试在单张RTX 3090显卡上加载Q5量化版本进行,Qwen3.8-27B于14日以Apache 2.0协议公开后,登上了Hugging Face热门榜第一位
공개일/라이선스
2026-08-14, 아파치 2.0 오픈웨이트 (알리바바 큐원)
허깅페이스 트렌딩
8월 16일 기준 1위, 원본 다운로드 9만1900건·좋아요 9890건(unsloth GGUF 판 86만8000건)
이번 비교 테스트
사용자 AJ가 동일 Three.js 물 시뮬레이션 프롬프트로 Qwen3.8-27B와 구글 제미나이 3.7 플래시를 원샷 비교
실행 환경
RTX 3090 GPU, Q5 GGUF 양자화 버전(F8 아님)
제3자 코멘트
레온 츠베트코프스키는 제미나이 3.7 플래시 가격대를 근거로 MoE 60~70B급으로 추정하며 비교가 공정하다고 평가
큐원 공식 발표
8월 18일 공식 X 계정이 로컬 실행 데모와 AJ의 비교 게시물을 소개

用一台笔记本跑出的27B模型,竟超越了Gemini的案例

阿里巴巴Qwen官方X账号于8月18日发布了一段简短视频。文案很简单:"强到足以追赶前沿模型,同时又轻到可以在笔记本电脑上运行"。几分钟后发布的第二条帖子中,引用了用户AJ(@ItsmeAjayKV)上传的对比演示。内容称在相同提示词、相同一次性生成的条件下,Qwen3.8-27B的结果超过了谷歌的Gemini 3.7 Flash。

Qwen3.8-27B,再度登上舞台

这款模型并非新发布。阿里巴巴Qwen于8月14日在Hugging Face上以Apache 2.0许可证公开了Qwen3.8-27B的权重。27B——参数量略低于300亿的密集模型,其4比特GGUF转换版仅有17.9GB,可以装入一张24GB级显卡。两天后的8月16日,该模型登上Hugging Face热门榜第一的消息也传出。原版下载量达9.19万次、点赞数9890次,而社区开发者unsloth制作的GGUF转换版下载量则远超前者,达到86.8万次。此次发帖可以说是此后不久接续而来的宣传攻势。

用户发布的水面模拟对比

AJ公开的测试是使用Three.js——一个在浏览器中绘制3D图形的JavaScript库——来模拟水波的任务。他分别用同一提示词向Qwen3.8-27B和谷歌Gemini 3.7 Flash各生成一次结果,并将其并排展示。在AJ发布的对比帖子中,他写道:"the difference is hugeee"(差距巨大)。他特别强调,此次测试是在单张RTX 3090显卡上,使用Q5量化版本而非F8版本进行的。量化——通过降低模型计算精度来减少容量和运算量的压缩方式——等级越低,性能损耗可能越大,但即便在这种条件下结果仍然领先,这是他的主张。

针对这一对比,Leon Cvetkovski留言评论称,根据Gemini 3.7 Flash的定价策略推测,该模型可能是规模在600亿至700亿之间的混合专家(MoE)结构,如果是这样,此次对比并不算太不公平。不过这只是第三方的推测,谷歌从未确认公开过Gemini 3.7 Flash的具体结构。

可直接使用的提示词原文

AJ对两款模型使用的完全相同的提示词全文如下。

"Create a Three.js water simulation. Requirements: Plane mesh with 512x512 subdivisions. Wave propagation simulation. Mouse click creates ripples. Multiple interacting waves. Real-time lighting. Everything in a single HTML file. No external libraries besides Three.js."

翻译成中文即是——用Three.js制作水面模拟。要求包括:512x512细分的平面网格、波浪传播模拟、鼠标点击产生波纹、多个波浪相互作用、实时光照,并且除Three.js外不使用其他库,全部在单个HTML文件中实现。将这段文字原样粘贴到本地聊天界面或API中,即可重现相同条件的对比测试。

从规格看两款模型

项目Qwen3.8-27BGemini 3.7 Flash
开发公司阿里巴巴QwenGoogle DeepMind
公开的结构27B密集模型,Apache 2.0开放权重未公开(根据定价推测为60~70B的MoE结构)
本次测试运行环境RTX 3090,Q5 GGUF云端API
近期动态8/14公开,8/16登上Hugging Face热门榜第一无确认背景信息

编辑视角

此次发帖本身并非新发布,而是一场宣传攻势。但这场宣传的时机颇为有趣。Qwen3.8-27B从公开(8/14)→登上热门榜第一(8/16)→被指出现"过度思考"问题(同一周)→到此次引用用户对比(8/18),在不到两周的时间里已经持续到第四轮。阿里巴巴通过官方账号不断转引社区演示,似乎是想用"我的电脑上就是这样"的一手见证,而非榜单分数,来证明这款模型的实力。榜单分数难免招致操纵争议,但一张RTX 3090就能复现的演示,任何人都能亲自验证,说服力自然不同。

回想在实际业务中使用本地LLM的经验,这种趋势并不陌生。27B级模型能在单张24GB显卡上运行,意味着过去只能在70B以上模型身上期待的代码生成质量,如今可以用便宜得多的硬件获得。不过,Q5这类较低量化等级下得出的结果并非总是稳定。在没有对同一提示词反复运行十次以确认结果波动的前提下,仅凭一次"一击获胜"的演示就决定是否投入实际使用,还是显得为时过早。

国内开发团队可以借鉴的地方很明确。对于前端原型或3D可视化这类只需一次代码生成即可看到结果的任务,现在就可以用一张RTX 3090或4090级显卡搭配Qwen3.8-27B的GGUF版本,不花云端API费用直接进行类似实验。但对于生产环境代码或涉及安全的工作,仍需要更广泛的验证。预计未来几周内,这类由社区发起的一次性对比还会延续到其他编码、可视化任务上,阿里巴巴很可能会继续通过官方账号转引这些案例。