每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

Qwen, Hugging Face本地推理排行榜确认登顶

Hugging Face《开源模型现状》报告显示,在实际使用中的本地推理场景中,Qwen超越Gemma位居首位

해변 선베드에서 노트북으로 차트를 보는 캐릭터

이미지: X — 모델·오픈소스

摘要

  • Hugging Face于8月14日发布的《State of Open Models, Summer 2026》报告显示,Qwen在本地推理领域排名第一,Gemma位居第二
  • 报告指出,尽管前沿模型规模不断增大,但实际现场使用中小型模型的比例更高
  • 这一结果与Qwen在8月初拿下Agentic Index第一名、随后发布27B开放权重模型的时间点相重合
보고서명
Hugging Face 'State of Open Models, Summer 2026'
발행일
2026-08-14
로컬 추론 순위
1위 Qwen, 2위 Gemma
보고서 핵심 관찰
프런티어 모델은 대형화, 실사용은 소형 모델이 주도
부가 관찰
AI 에이전트가 허브 내 비중을 키우는 중
Qwen3.8-Max 벤치마크(8/6 발표)
Artificial Analysis Agentic Index 1위, Intelligence Index 5위(56점)
Qwen3.8-27B 공개
8월 14일 아파치 2.0 라이선스로 허깅페이스 공개

Hugging Face确认的趋势:本地推理由Qwen领跑

Hugging Face于8月14日发布的《State of Open Models, Summer 2026》报告梳理了开源AI生态系统近期的走向。报告指出,尽管前沿模型规模不断扩大,但实际现场使用的仍以小型模型居多。报告还表示,在本地环境下运行的推理(inference)领域,阿里巴巴Qwen排名第一,谷歌Gemma紧随其后。

本地推理指的是不依赖云端服务器,而是直接在用户个人电脑或自有设备中运行模型的方式。阿里巴巴Qwen团队通过自家X账号公布了这一结果,并简短评论称"小模型正在对现实世界产生巨大影响"。

本地推理为何成为衡量指标

Hugging Face Hub是全球开发者上传和下载开源模型权重的场所。在这里哪款模型被最多下载到本地并实际运行,比华丽的演示更接近诚实的实际使用指标。在本地运行模型无需将数据发送到外部,重复调用的成本也从API费用降至电费水平。报告还指出,AI智能体——即不只是给出答案,还能代为执行搜索或生成文件等任务的AI——在Hub中所占比重正在不断扩大。

与Qwen近期动向重合的时间点

这一结果与Qwen近期的一系列发布动作在时间上相重合。阿里巴巴Qwen此前在8月6日宣布,Qwen3.8-Max在Artificial Analysis的Intelligence Index中排名第五(56分),在同一机构的Agentic Index中排名第一。随后在8月14日,除2.4万亿参数级别的大型模型外,Qwen还以Apache 2.0许可证在Hugging Face上公开了更便于本地环境运行的27B(270亿参数)规模的Qwen3.8-27B权重。Hugging Face的本地推理第一名公布正是在同一天,这使得Qwen在大型模型和小型模型两端同时提升存在感的图景变得清晰。

指标第一名备注
Hugging Face本地推理(8/14)Qwen第二名Gemma
Artificial Analysis Agentic Index(8/6)Qwen3.8-Max-
Artificial Analysis Intelligence Index(8/6)Qwen3.8-Max第五名,56分

编辑视角

这一结果有意思的地方不在于排名本身,而在于排名产生的方式。基准测试分数完全可以通过操作性定义的调整而变动,但Hugging Face Hub上究竟谁被实际下载、在本地被真正运行,更接近开发者用脚投票的结果。Qwen同时在大型模型竞争(Qwen3.8-Max拿下Agentic Index第一)和小型模型竞争(Hugging Face本地推理第一)两条赛道上领先,这意味着阿里巴巴正在分别经营"谁更聪明"和"谁被更多使用"这两场竞赛。

对于在实际业务中用过开源LLM的人来说,这一趋势并不陌生。几年前想在本地环境找一款好用的开源模型,几乎只有Llama系列这一个选择,但最近一两年间,这个位置逐渐被Qwen和Gemma分享。实际在本地运行27B级开源模型时,结论往往类似——虽然不如最新大型模型聪明,但在重复性的文档摘要或代码审查等定型化任务中,无需API费用就足够好用。

对国内企业或开发团队而言,这是一个实用的信号。并非所有任务都需要调用性能最强的模型API。对于重复性工作、内部文档处理、涉及敏感信息的业务,将27B级开源模型部署在自有服务器上,在成本和安全两方面都可能更有利。不过这仅限于定型化任务,需要复杂推理或创造性判断的工作,仍应交给大型模型处理。

未来几周内,Hugging Face Hub的下载排行榜很可能会迎来其他开源模型系列的挑战。本地推理这条赛道才刚刚正式展开,Qwen和Gemma之后第三个名字何时出现,将是下一个值得关注的看点。