Grouped Query Attention
一种让多个查询头分组共享同一组键值头的注意力设计方式,用来减少计算量和内存占用
简单来说
GQA(Grouped Query Attention)是一种精简AI模型阅读和理解文本时所用计算结构的设计方式。AI模型在理解一句话时,会为每个词发出多个查询(query),并分别准备用于比对的参考资料(键和值)。原本每个查询都需要配备一份独立的参考资料,这会给数据的存储和读取带来很大负担。
GQA为了减轻这种负担,把多个查询分成若干组,让同一组内的查询共享同一份参考资料。这就像开会时,32位提问者原本每人配一名专属助理,现在改成8名助理、每4位提问者共享一名助理。提问者的数量没有变,但需要准备的参考资料量减少了,计算速度更快,占用的存储空间也更小。
像文章中提到的辅助草稿模型那样,需要快速运行体积较小的模型时,这种结构尤其常用。查询和参考资料的分组比例(例如32个查询头共享8个键值头)会决定速度和准确度之间的平衡。
在报道中是这样出现的
文章中提到"32个查询头共享8个KV头的GQA结构"。容易让人误会的是,好像GQA是这次才出现的新技术,但实际上GQA早已是许多大型语言模型中常用的标准设计,这篇文章只是用它来缩小加速用的辅助模型(草稿模型)的规模而已。
