每天早晨,用三行读完全球 AI 动态浏览品牌目录

METAL LAB

中型模型区间再度火热…下一个是70~80B吗

DSV4 Flash、Inkling Small、Laguna S 2.1、Step 3.7 Flash在短时间内接连亮相。

최근 공개 모델
DSV4 Flash 0731 · Inkling Small · Laguna S 2.1 · Step 3.7 Flash
커뮤니티 요구
70~80B 구간의 새 경쟁자
논의 채널
r/LocalLLaMA
관전 포인트
자체 호스팅 후보군을 한 번에 비교하기 좋은 시점

最近几周中型区间模型接连问世。DSV4 Flash 0731、Inkling Small、Laguna S 2.1、Step 3.7 Flash在短时间内相继公开,选择明显变多了。社区中已经出现了期待70~80B区间新竞争者的声音。

为什么偏偏是中型

超大模型用API通常更划算。小型模型的质量又不够看。真正适合自建部署的,就是介于两者之间的这个区间——能装进一台服务器或两三张显卡、同时又能满足实际业务质量要求的那个点——这就是当下模型扎堆出现在中型区间的原因。

选择自建部署的理由大体不外乎以下三种。

  1. 数据不能外传——受监管行业、合同限制、内部政策
  2. 调用量大——超过一定规模后,API费用会超过硬件成本
  3. 延迟至关重要——需要消除网络往返的实时场景

三者都不沾边的话,用API通常更划算。运营负担往往被低估。

目前已有的选项

近期发布区间
DSV4 Flash 0731中型
Inkling Small中型(偏小型上限)
Laguna S 2.1中型
Step 3.7 Flash中型
空缺席位70~80B

各模型的具体参数量和基准测试成绩因发布方公开范围不同,本文不逐一列出。若要比较具体数字,建议直接查阅原始仓库的模型卡片,更为准确。

机架背面整理好的线缆
机架背面整理好的线缆

70~80B为何是特殊的位置

这个区间正好处在硬件边界线上。一张80GB显卡以4比特精度勉强能装下,两张则会有余裕。也就是说,这几乎是不用升级硬件档次、就能把质量再提升一档的最后一个点。这也是社区特意点名这个数字的原因。

区间4比特下大致容量现实可用硬件
7~9B4~6 GB笔记本电脑·单张消费级GPU
24~32B14~20 GB单张消费级GPU(高端)
70~80B40~48 GB单张工作站GPU或双张消费级GPU
200B+110 GB以上服务器·多GPU

每往上一档,硬件预算都会翻上几倍。所以恰好处于边界线下方的模型在实际业务中使用最多。

引入前的检查顺序

  1. 先明确用途。 摘要、分类、抽取等场景,中型模型往往已经够用。长文推理和代码生成则另当别论。
  2. 先定好VRAM预算。 先选模型再配硬件,预算通常会超支。要反过来。
  3. 用自己的数据测量量化损失。 拿实际业务提示词跑100条,对比Q4和Q6,决策会快很多。
  4. 把并发用户数计入考量。 一个人用和十个人同时用所需的硬件不同。KV缓存会随用户数增加而增大。
  5. 最后再看一遍许可证。 商用条件因模型而异,即便是同一家公司的模型,不同版本之间也可能不同。

建立比较流程比选定一个模型更划算

在候选一波涌现的当下,与其纠结选哪一个,不如建立起下次还能用的比较流程,这样更划算。因为下一个模型必然还会出现。

最起码的构成大致如下:①能代表本公司业务的评测提示词集,100~200条;②标准答案或评分标准;③可随时替换模型的抽象层;④同时记录每token成本和延迟的日志。有了这四项,每次新模型出现时,半天之内就能得出结论。

来源:r/LocalLLaMA 社区讨论。各模型具体规格请参考各发布方的模型卡片。