
이미지: X — 모델·오픈소스 영상 갈무리
摘要
- 阿里巴巴Qwen于8月18日通过官方X账号介绍了自家27B模型的本地运行演示及用户对比案例
- 用户AJ表示,在相同提示词下制作的Three.js水面模拟测试中,Qwen3.8-27B超过了谷歌Gemini 3.7 Flash
- 该测试在单张RTX 3090显卡上加载Q5量化版本进行,Qwen3.8-27B于14日以Apache 2.0协议公开后,登上了Hugging Face热门榜第一位
- 공개일/라이선스
- 2026-08-14, 아파치 2.0 오픈웨이트 (알리바바 큐원)
- 허깅페이스 트렌딩
- 8월 16일 기준 1위, 원본 다운로드 9만1900건·좋아요 9890건(unsloth GGUF 판 86만8000건)
- 이번 비교 테스트
- 사용자 AJ가 동일 Three.js 물 시뮬레이션 프롬프트로 Qwen3.8-27B와 구글 제미나이 3.7 플래시를 원샷 비교
- 실행 환경
- RTX 3090 GPU, Q5 GGUF 양자화 버전(F8 아님)
- 제3자 코멘트
- 레온 츠베트코프스키는 제미나이 3.7 플래시 가격대를 근거로 MoE 60~70B급으로 추정하며 비교가 공정하다고 평가
- 큐원 공식 발표
- 8월 18일 공식 X 계정이 로컬 실행 데모와 AJ의 비교 게시물을 소개
用一台笔记本跑出的27B模型,竟超越了Gemini的案例
阿里巴巴Qwen官方X账号于8月18日发布了一段简短视频。文案很简单:"强到足以追赶前沿模型,同时又轻到可以在笔记本电脑上运行"。几分钟后发布的第二条帖子中,引用了用户AJ(@ItsmeAjayKV)上传的对比演示。内容称在相同提示词、相同一次性生成的条件下,Qwen3.8-27B的结果超过了谷歌的Gemini 3.7 Flash。
Qwen3.8-27B,再度登上舞台
这款模型并非新发布。阿里巴巴Qwen于8月14日在Hugging Face上以Apache 2.0许可证公开了Qwen3.8-27B的权重。27B——参数量略低于300亿的密集模型,其4比特GGUF转换版仅有17.9GB,可以装入一张24GB级显卡。两天后的8月16日,该模型登上Hugging Face热门榜第一的消息也传出。原版下载量达9.19万次、点赞数9890次,而社区开发者unsloth制作的GGUF转换版下载量则远超前者,达到86.8万次。此次发帖可以说是此后不久接续而来的宣传攻势。
用户发布的水面模拟对比
AJ公开的测试是使用Three.js——一个在浏览器中绘制3D图形的JavaScript库——来模拟水波的任务。他分别用同一提示词向Qwen3.8-27B和谷歌Gemini 3.7 Flash各生成一次结果,并将其并排展示。在AJ发布的对比帖子中,他写道:"the difference is hugeee"(差距巨大)。他特别强调,此次测试是在单张RTX 3090显卡上,使用Q5量化版本而非F8版本进行的。量化——通过降低模型计算精度来减少容量和运算量的压缩方式——等级越低,性能损耗可能越大,但即便在这种条件下结果仍然领先,这是他的主张。
针对这一对比,Leon Cvetkovski留言评论称,根据Gemini 3.7 Flash的定价策略推测,该模型可能是规模在600亿至700亿之间的混合专家(MoE)结构,如果是这样,此次对比并不算太不公平。不过这只是第三方的推测,谷歌从未确认公开过Gemini 3.7 Flash的具体结构。
可直接使用的提示词原文
AJ对两款模型使用的完全相同的提示词全文如下。
"Create a Three.js water simulation. Requirements: Plane mesh with 512x512 subdivisions. Wave propagation simulation. Mouse click creates ripples. Multiple interacting waves. Real-time lighting. Everything in a single HTML file. No external libraries besides Three.js."
翻译成中文即是——用Three.js制作水面模拟。要求包括:512x512细分的平面网格、波浪传播模拟、鼠标点击产生波纹、多个波浪相互作用、实时光照,并且除Three.js外不使用其他库,全部在单个HTML文件中实现。将这段文字原样粘贴到本地聊天界面或API中,即可重现相同条件的对比测试。
从规格看两款模型
| 项目 | Qwen3.8-27B | Gemini 3.7 Flash |
|---|---|---|
| 开发公司 | 阿里巴巴Qwen | Google DeepMind |
| 公开的结构 | 27B密集模型,Apache 2.0开放权重 | 未公开(根据定价推测为60~70B的MoE结构) |
| 本次测试运行环境 | RTX 3090,Q5 GGUF | 云端API |
| 近期动态 | 8/14公开,8/16登上Hugging Face热门榜第一 | 无确认背景信息 |
编辑视角
此次发帖本身并非新发布,而是一场宣传攻势。但这场宣传的时机颇为有趣。Qwen3.8-27B从公开(8/14)→登上热门榜第一(8/16)→被指出现"过度思考"问题(同一周)→到此次引用用户对比(8/18),在不到两周的时间里已经持续到第四轮。阿里巴巴通过官方账号不断转引社区演示,似乎是想用"我的电脑上就是这样"的一手见证,而非榜单分数,来证明这款模型的实力。榜单分数难免招致操纵争议,但一张RTX 3090就能复现的演示,任何人都能亲自验证,说服力自然不同。
回想在实际业务中使用本地LLM的经验,这种趋势并不陌生。27B级模型能在单张24GB显卡上运行,意味着过去只能在70B以上模型身上期待的代码生成质量,如今可以用便宜得多的硬件获得。不过,Q5这类较低量化等级下得出的结果并非总是稳定。在没有对同一提示词反复运行十次以确认结果波动的前提下,仅凭一次"一击获胜"的演示就决定是否投入实际使用,还是显得为时过早。
国内开发团队可以借鉴的地方很明确。对于前端原型或3D可视化这类只需一次代码生成即可看到结果的任务,现在就可以用一张RTX 3090或4090级显卡搭配Qwen3.8-27B的GGUF版本,不花云端API费用直接进行类似实验。但对于生产环境代码或涉及安全的工作,仍需要更广泛的验证。预计未来几周内,这类由社区发起的一次性对比还会延续到其他编码、可视化任务上,阿里巴巴很可能会继续通过官方账号转引这些案例。



