量化感知蒸馏
Quantization-Aware Distillation
一种训练方法,把庞大精确的原始模型的判断习惯迁移到轻量化的压缩模型中,无需重新训练也能保住性能
简单来说
量化感知蒸馏(Quantization-Aware Distillation)是一种训练方法,把庞大精确的原始AI模型所具备的判断习惯,直接迁移给一个被大幅压缩、变得轻量的模型。
用老厨师和新厨师来比喻会更容易理解。与其让新人一字不差地死记菜谱,不如让他在旁边观察老厨师做菜时放多少料、怎么调味,学习那种整体的口味偏好和判断方式。在这个过程中,原始模型被冻结不动,学生模型只是模仿原始模型输出结果中的概率倾向来学习。
这种方法的优势在于成本。与那种把原始模型重新以低精度从头训练一遍的传统方法不同,这里原始模型完全不动,只参考它的输出结果,因此训练过程更轻量、也更稳定。不过,如果模型的大小和结构发生巨大变化,就可能找不到同等规模的原始模型来做精确对比,这也会限制学生模型的性能上限。
在报道中是这样出现的
一篇关于Multiverse Computing的报道这样写道:'另一种方法——量化感知蒸馏(QAD)——跳过了这种迭代训练。取而代之的是,它通过KL散度损失,把被冻结的全精度教师模型的输出分布迁移给学生模型。'这里容易产生的误解是,以为QAD是在重新训练原始模型,但实际上原始模型完全没被触碰,只是利用它的输出结果来训练学生模型。
