
이미지: METAL LAB 생성
摘要
- Reddit r/LocalLLaMA一名用户提出问题,称8B~12B级别新款开源模型发布已久未见更新
- LM Studio推荐的最新模型是66天前发布的Gemma4 12B QAT,其余模型均为147至161天前发布
- 近期开源模型发布集中在27B以上级别,被认为是引发这场讨论的背景
- 게시판
- r/LocalLLaMA
- 제기 시점
- 2026-08-11
- 사용자 환경
- MacBook Pro M4, 16GB 통합메모리
- 언급된 최신 모델
- Gemma4 12B QAT (66일 전 출시)
- 언급된 구형 모델
- Nemotron 3 Nano 4B, Qwen3.5 9B (147~161일 전)
- 언급된 신규 대형 모델
- Bonsai 27B (10일 전 출시)
16GB MacBook上找不到好用的模型
Reddit r/LocalLLaMA上的一篇帖子在本地LLM用户中引发共鸣。一名使用16GB统一内存MacBook Pro M4的用户提出问题:"在LM Studio上找不到能用的新款8B~12B模型。"该用户目前使用的模型是66天前发布的Gemma4 12B QAT。LM Studio接下来推荐的Nemotron 3 Nano 4B和Qwen3.5 9B分别是147天前和161天前的模型,实际上已经是过时的选择。10天前发布的Bonsai 27B虽然引人注目,但该用户甚至无法确定16GB内存是否能承载这个模型。这篇帖子的核心问题是:"最近发布的模型都是27B以上,为什么会这样?"
为何中小型模型变得罕见
8B12B一直被视为本地推理的"最佳平衡点"区间。经过4位量化处理后,这类模型可以在16GB左右的统一内存上接近实时运行,回答质量也足以满足实际使用需求。但最近开源阵营的竞争似乎都集中在更容易在基准测试中取得优势的27B以上级别。参数越大,在推理和编程基准测试中提升分数相对更容易,各公司也有更强的动机来展示旗舰级性能。相反,评论区不断有人指出,8B12B级别与其投入资源打磨已经验证过的架构,往往因为大型模型开发优先而被排到次要位置。
事实上,8月9日发布的谷歌Gemma 4 12B QAT——通过量化感知训练(QAT)预先训练、减少压缩损失的检查点——几乎是12B级别中唯一属于最新一批的模型。该模型采用支持文本、图像输入的多模态结构,最长支持256K token上下文,覆盖140多种语言,并以Apache 2.0许可证发布。该用户所说的"勉强能用",指的正是这款模型。
这意味着什么
这场讨论值得关注的地方在于,它反映的不是某家公司的官方发布,而是社区的真实体验。对于没有32GB以上高配Mac或桌面GPU、即想用入门级笔记本运行本地LLM的用户来说,新模型的发布周期直接决定了使用体验的质量。如果8B~12B区间的新作持续稀缺,用户就只能继续使用半年以上的旧模型,或者被迫勉强适配难以承受的大型模型。从开发商角度来看,如果继续依靠大型模型进行基准测试竞争,端侧和轻量级推理的需求短期内很可能只能依赖少数最新案例来满足。



