MXFP4
把AI模型中的数字(权重)压缩到仅4比特这种极小单位来表示,从而减少体积和运算量的低精度格式
简单来说
MXFP4是一种把AI模型里海量数字压缩成极少位数来表示的方法。通常在构建模型时,每个数字会以大约16位的精度存储,而MXFP4则把它大幅缩减到4位。这就好比把高清原图保留下来体积很大,但转换成压缩文件后体积变小,细节却随之消失。
不过,MXFP4并不是单纯地把位数平均削减,而是把相近的数字归为一组,为这一组设定一个共同的缩放基准(刻度),然后每个具体数字只在这个刻度范围内以很小的位数表示。这样比起把所有位数一律削减,能进一步减少信息损失。这样一来,运行模型所需的内存和计算资源会大幅减少,从而可以用同样的硬件运行更大的模型,或者以更低成本运营服务。
问题在于,把数字这样压缩之后,模型的判断力,也就是推理或计算能力通常也会随之下降。因此,转换成MXFP4之后,往往还需要额外的恢复步骤来把性能拉回来。
在报道中是这样出现的
文章中曾这样使用:“学生模型体积减半,以MXFP4运行”,或“用QAH再次量化到MXFP4进行验证”。这里容易被误解的一点是,以为压缩到MXFP4就会自动带来性能提升。实际上,把精度削减到4比特通常会导致性能下降,文章中提到的结果,是在同时应用了新的恢复技术之后才得到的特例。
相关词条
出现过这个词的报道
- DeepSeek v4 Flash推出DwarfStar专用GGUF版本 降低本地部署门槛AI · 2026.08.01
- LG AI研究院发布7500亿规模K-EXAONE 2.0 FP8模型AI · 2026.08.10
- DeepSeek v4 Flash 0731,RTX 4090与Tesla P40组合本地运行成功AI · 2026.08.10
- NVIDIA发布量子计算机自动校准VLM"Ising 1.5"AI · 2026.08.09
- Liquid AI, 3亿参数级草稿模型让解码最高提速3.18倍AI · 2026.08.21
- Liquid AI,3GB内运行的屏幕读取模型公开AI · 2026.08.13
