INT8量化
INT8 quantization
把模型内部的数字粗略地表示为8位整数,从而缩小体积、减少运算量的压缩技术
简单来说
INT8量化是把AI模型内部的数字四舍五入成更粗略的单位,以此减少存储空间和计算量的方法。这有点像不保存照片原图,而是保存压缩文件——文件体积大幅缩小,但肉眼看上去差别不大。模型通常由数十亿个带有精细小数位的数字组成,如果把这些数字粗略地归并到只有256级的整数(8位)上,模型体积最多可以缩小到原来的四分之一,计算速度也会大幅提升。
这样变轻的模型即便在智能手机、笔记本电脑这类存储空间和运算能力有限的设备上,也能顺畜运行。不过,由于这是一个粗略四舍五入的过程,精度难免会有所损失,因此需要谨慎选择哪些部分、归并到什么程度,才能让模型质量接近原始水平。
亲手试一试
可以在Hugging Face等模型库中搜索同一模型名称后加上'int8'或'8bit'的版本。这类版本常常和原始模型并列展示,可以看到文件体积缩小到一半以下。
