MiniMax Sparse Attention
让AI理解句子时不必两两比较所有词语,只挑相关部分计算,从而提升速度的技术。
简单来说
MiniMax Sparse Attention 是一种让AI模型在阅读文本时只挑选真正需要的部分来看的方式。这就好比读书时不是从头到尾翻遍每一页,而是直接翻到事先贴好的标签处,只查看需要的地方。
在传统方式中,AI理解一句话时会把句子里的所有词语两两互相比较。句子越长,需要比较的词对数量就会急剧增加,计算量随之暴涨。为了缓解这个问题,出现了只挑选看起来真正相关的部分进行计算、其余部分则跳过的方法,这类方法统称为稀疏注意力(sparse attention)。
MSA 是 MiniMax 自主研发并应用在自家 M3 模型上的实现方案。在处理长达百万级 token 的长文本时,它只挑选必要的键值(key-value)块进行运算,从而大幅减少计算量,使得即便在实时服务中也能达到可承受的速度。
在报道中是这样出现的
文章在介绍 MiniMax M3 时称其采用了"只挑选必要键值块以减少计算量的稀疏注意力技术'MSA'"。这里容易混淆的一点是:MSA 是 MiniMax 自主开发的技术名称,而将其移植并调优到服务基础设施中的则是 Modular 公司。也就是说,技术的开发者和将其优化后部署上线的基础设施公司并不是同一方。
