Active Parameters(活跃参数)
Active Parameters
AI模型在生成一个答案时实际参与运算的参数规模,通常远小于总参数量。
简单来说
活跃参数指的是模型处理某一个问题时,实际被启用的那部分规模。如果把整个模型比作一座巨大的图书馆,馆内所有的书就是总参数,而为了回答一个问题实际抽出来翻阅的那几本书,就是活跃参数。图书馆可以建得很大,但因为不用每次都翻遍所有书架、只需打开需要的那几格就行,所以在速度和成本上都能占到便宜。
采用这种结构的模型通常会同时标注总参数量和活跃参数量。比如"总计300亿、活跃30亿",意思是模型储备的知识总量相当于300亿参数的规模,但处理一个问题所需的运算量和响应速度,更接近一个30亿参数模型的水平。知识储备铺得很广,而每次实际耗费的算力却很少,这正是这种结构的核心魅力。
不过也有公司只宣传庞大的总参数数字,却不公开活跃参数量。这种情况下,外界就很难判断实际运行这个模型要花多少计算成本。
在报道中是这样出现的
有报道解释道,某模型总参数量为300亿,但生成一个词元(token)时实际参与运算的只有30亿,称这种结构使其比同等规模的模型更快。相反,另一篇报道提到阿里巴巴发布了一个2.4万亿参数的模型,却始终未公布其活跃参数数字,导致外媒各自估算,一说950亿、一说220亿,说法不一。常见的误解是只看总参数数字就去揣测模型的实际运营成本,而要判断真实的运算成本,应该看活跃参数这一指标。
亲手试一试
可以这样问聊天机器人,看看"活跃参数"这个概念在实际回答中是如何体现的:
"请告诉我你所使用的模型的总参数量,以及处理一个问题时实际被激活的参数量分别是多少。如果不确定,请直接说不知道。"
模型很少能给出精确的数字。但如果得到的回答能解释这两个数字为何不同、总参数和活跃参数各自指什么,那本身就说明你已经掌握了这个概念。
