Cache-to-Cache
两个AI模型不通过互相传递文字句子,而是直接对接内部计算值来传递信息的方式
简单来说
Cache-to-Cache 是连接两个AI模型的一种方式:一方不再把内容写成文字让另一方阅读,而是直接把内部计算值传递过去。以往常见的做法是,较大的模型把答案以文字形式输出,较小的模型再从头阅读并理解这段文字——就像写信交给隔壁同事一样。问题在于,写信需要时间,而且把内容转化成文字的那一刻,微妙的语气和细节往往会被压缩甚至丢失。
Cache-to-Cache 省去了这个「写信」的过程。模型在把想法变成句子之前,脑中已经存在的中间计算值会被直接传给另一个模型。接收方拿到的不是被压缩成一行文字的结果,而是原本丰富的判断本身,因此不需要再重新猜测。研究显示,这种方式比通过文字连接模型的方式准确率更高,速度也快得多。
差不多同一时期,一家名为 Mostic 的公司更进一步尝试:不是传递中间计算值,而是寻找两个模型训练完成后各自固定数值(权重)之间的换算表,借此连接两个模型。方法不同,但目标一致——让模型之间无需用语言互相解释,就能共享彼此的判断。
在报道中是这样出现的
文章中提到,这个同时也是论文标题的术语,伴随着这样的实验结果出现:「比用文字连接模型的方式准确率高出3.1%至5.4%,速度平均快2.5倍」。容易被误解的一点是,这并不是让单个模型变得更聪明的技术,而是一种能更高效地连接多个现有模型的连接方法。
