混合专家架构
Mixture of Experts Architecture
一种AI设计方式,不使用整个模型,而是只挑选适合当前任务的部分专家组件来进行计算。
简单来说
用医院来比喻,混合专家架构就很容易理解了。综合医院里有几十位专科医生,但患者来了以后,并不是所有医生都同时给他看病。挂号处会先看症状,只叫来真正需要的几位专科医生。AI模型也是一样,内部设置了许多个小型"专家"组件,遇到问题时,只挑选其中一部分参与计算。
这样做的原因是,既想把模型做大,又想节省计算成本。即使模型的整体规模(总参数)大到数万亿,实际生成一次答案时真正动用的部分(激活参数)也只是其中一小部分。这样一来,既能保留大模型的知识和能力,又能把生成答案的速度和成本降到接近小模型的水平。
不过,这种结构规模大,并不代表性能或成本一定更有优势。实际效果很大程度上取决于挑选专家的方式有多精准,以及各个专家训练得有多好。
在报道中是这样出现的
亲手试一试
以后看到新的LLM相关消息时,可以留意两个数字:总参数和激活参数。如果这两个数字分别标注出来,就说明这个模型采用了混合专家架构。两者差距越大,就可以理解为这个模型体量虽大,但实际计算成本被设计得更低。
