工作日早上 7 点读 AI,周日早上 8 点读周报订阅邮件

METAL LAB

Multiverse Computing:压缩到4比特的模型反而比原版更聪明

将GPT-OSS 120B压缩量化为60B后,在9项基准测试中的7项上超过了原版

세 가지 GPT-OSS 모델의 벤치마크 점수 비교 막대 그래프

이미지: Hugging Face 화면 갈무리

摘要

  • Multiverse Computing公开了一种名为QAH的技术,能让经过压缩和量化的4比特模型表现优于全精度原版模型
  • 将GPT-OSS 120B压缩为60B并用MXFP4量化后得到的QAH模型,在9项基准测试中有7项超过了bfloat16原版
  • 在相同条件下对比,QAH达到性能峰值的速度比QAT快7倍,且之后性能不会下滑
기법
Quantization-Aware Healing (QAH)
적용 모델
GPT-OSS 120B → 60B 파라미터 구조압축 후 MXFP4 양자화
벤치마크 결과
자체 bfloat16 체크포인트 대비 9개 중 7개 벤치마크 우위
장문맥·수학 개선폭
AA-LCR +7.4점, AIME 2025 +5.6점
원본 120B 교사모델 대비
LiveCodeBench 66.5 vs 66.0 우위, GPQA Diamond 67.4 vs 69.0
QAH vs QAT 학습곡선
QAH 약 100스텝에서 54.9점 도달·유지, QAT 700스텝에서 54.6점 후 1200스텝까지 19점 하락
메모리·연산 절감
가중치 메모리 약 4분의 1, 토큰당 연산량 최대 8분의 1
발표
Multiverse Computing, Hugging Face 블로그, 2026-08-25

把一个1200亿参数的大语言模型压缩到一半大小,精度还降到4比特,结果性能反而比原版更好。按常理,模型压缩加量化后性能应该下降才对,但这次的结果却颠覆了这个常识。

原始教师模型引出两条箭头。一条是虚线,指向恢复后的检查点,这个检查点本身只是近似值,因此成为性能的天花板。另一条是实线,直接连到经过压缩、量化的学生模型,该学生模型被画成种子的形状,象征着即便体积减半、精度降到4比特,依然能超越原版的结果。

让AI模型变轻量的标准流程通常分两步:先通过减少层数或神经元数量进行结构压缩,再把剩下的权重从16比特降到4比特进行量化。这两步都能大幅降低内存占用和运算量,但代价往往是推理、数学、代码生成等人们真正关心的能力会下降。因此实际部署流程通常会在压缩和量化之后,再加一道叫做"修复(healing)"的恢复步骤。专注于模型轻量化研究的Multiverse Computing在8月25日发布于Hugging Face博客的论文中,介绍了一种重新设计这一恢复步骤的技术——"量化感知修复"(Quantization-Aware Healing,QAH)。

现有两种修复技术的局限

此前业界广泛使用的修复技术主要有两种。一种是量化感知训练(QAT),做法是在前向传播过程中插入伪量化运算,再用任务损失函数持续微调。问题在于,模型本身已经经历过成本高昂的预训练、监督微调和RLHF流程,现在还要用带噪声的低精度前向传播再训练一遍。这不仅代价高,而且如果训练超过最佳点还持续进行,反而可能变得不稳定。

另一种方法量化感知蒸馏(QAD)则跳过了这种反复训练。它让冻结的全精度教师模型的输出分布,通过KL散度(衡量两个概率分布差异程度的指标)损失传递给学生模型。但这种方式只有在仅量化发生变化时效果良好,一旦叠加了层数、注意力头数、神经元数量本身减少的结构压缩,就会出问题——因为压缩后的架构根本不存在一个同等大小的独立全精度模型可以对照。剩下能用的教师候选,只有压缩后恢复出的bfloat16检查点,而这个检查点本身就是对原版的近似,导致学生模型的准确率永远无法超越这个检查点的水平,形成了一个天花板。

让模型直接向原版学习

QAH改变的只有一点:知识传递的来源不再是恢复后的检查点,而是压缩之前的原始模型。教师和学生甚至架构都不同——教师是原始大小的全精度模型,学生则是体积减半、以MXFP4运行的模型。Multiverse Computing解释称,由于教师的输出分布定义与结构无关,即便大小和形态不同,也不影响知识的传递。学生模型不看标准答案标签,只通过KL散度去匹配教师的输出分布来学习。这样一来,量化这一步的意义也变了:在以往的流程中,量化是修复完成之后附加的损失处理步骤;而在QAH中,它变成了针对原始教师的第二次蒸馏过程。

基准测试:4比特击败了16比特

Multiverse Computing用OpenAI公开的开放权重模型GPT-OSS 120B进行验证:先结构压缩到60B参数并恢复为bfloat16,再用QAH进一步量化到MXFP4。对比对象是同为60B架构的bfloat16检查点,也就是这个架构下能达到的最佳全精度版本。

基准测试QAH 4比特 vs bfloat16 60B备注
AA-LCR(长上下文)+7.4分提升幅度最大
AIME 2025(数学)+5.6分提升幅度第二大
MMLU-Pro落后1.5分以内落后的2项之一
SciCode小幅落后落后的2项之一
综合9项中7项占优整体超过bfloat16原版

与压缩前的原版120B教师模型相比,结果同样令人印象深刻。QAH模型参数量只有教师模型的一半,权重内存约为其四分之一,却在LiveCodeBench上拿到66.5分,超过教师模型的66.0分;在GPQA Diamond上也拿到67.4分,与教师模型的69.0分仅差1.6分。剩下差距最大的项目是需要处理极长上下文的AA-LCR,公司解释说,这本来就是压缩过程中损失的容量里最难恢复的部分。

比QAT快7倍,而且不会崩

为了单独验证损失函数本身的效果,团队还做了一组对照实验:把GPT-OSS 9B模型量化为MXFP4时,在相同条件下让QAH和QAT正面对比,按训练步数追踪MMLU-Pro、LiveCodeBench、GPQA Diamond三项平均分。

方式达到峰值步数分数之后的走势
QAH约100步54.9分(峰值)维持在峰值2分以内
QAT约700步54.6分(峰值)到1200步时下滑近19分

两种方式的最高分本身几乎相同,分别是54.9分和54.6分。真正的差别在于到达峰值的速度以及之后的表现。QAH只需约100步就能达到峰值,速度接近QAT的7倍,并且此后一直保持在这个水平;而QAT一过峰值就开始崩溃,到1200步时跌到了30多分。从实际操作角度看,要部署QAT检查点,还需要额外做验证,精确抓住性能下滑前的那个时间点停止训练;而QAH由于学生模型一旦追上教师分布后就没有再变化的动力,可以直接把训练充分的检查点安全地用于生产环境,这是Multiverse Computing给出的解释。

内存和运算量究竟省了多少

不只是准确率变好了,压缩本来追求的效率优势也完全保留下来。压缩到4比特的QAH模型,权重内存只用了bfloat16训练的学生模型的约四分之一。参数量也只有120B教师模型的一半,所以每个token的运算量大约减半。公司还表示,如果把这种方法用在其他以bfloat16方式提供服务的模型系列上,参数量减少和精度降低叠加起来,每个token的运算量最多可以降到八分之一。

在保持性能的同时让模型变轻量,这样的尝试并非首次。Liquid AI开源端侧基准测试Pipette一文也探讨过类似的问题意识。

编辑视角

这篇论文提出的观点——"量化不是必须付出损失的代价,而是可以再教一次模型的机会"——彻底改变了人们看待压缩流程的方式。此前业界一直把"压缩→量化→修复"这三步流程,看作是"尽量减少不可避免的性能损失"的过程,而QAH把修复这一步重新定义成了向原始教师再学习一次的机会。如果这个思路在其他模型系列上也同样成立,那么以后压缩模型的基准测试表格里,超越原版的结果可能不再是例外,而会变得司空见惯。

如果你曾经在实际业务中用过小型开放权重模型,应该能理解这个结果为什么值得关注。以前把参数减半、精度降到4比特,长上下文处理或数学题上通常会明显退步。但这次的QAH模型恰恰在这两个方向——AA-LCR和AIME 2025——提升幅度最大。也就是说,它精准地针对压缩损耗最严重的领域进行了修复。

对于国内自行运行sLLM或采用本地化部署模型服务的团队来说,这个结果应该被当作一张价格表来读。要达到同样的性能所需的GPU内存降到四分之一,每个token的运算量降到一半以下,这意味着可以用更少的推理服务器,或者用同样的预算处理更大的流量。不过,QAH需要提前计算压缩前原始模型的logits作为教师信号,所以没有原始模型访问权限的团队很难直接照搬这种方法。这更适合那些本身就在使用开放权重模型的团队先尝试。

QAT作为标准做法已经存在很久了,预计未来几个月内,其他开放权重模型系列上应用QAH方法的复现实验也很可能会出现。如果结果和这次的GPT-OSS实验类似,那么"量化会导致性能下降"这个前提本身从行业标准文档中消失,可能也不会太远了。

评论