DFlash并行骨干网络
DFlash parallel backbone
一种让草稿模型能够一次性同时计算多个候选token内部状态的神经网络结构,决定了推测解码的速度。
简单来说
DFlash并行骨干网络是一种让AI能够一次性同时计算出接下来可能出现的多个候选词(token)的内部结构。通常即便是小型辅助模型,逐个按顺序生成词也需要花费时间,而DFlash取消了这种顺序,一次性拉出多个候选。这就像一个人同时勾勒出草稿的好几行,而不是多个人接力、每人写一行。
这个结构是Liquid AI打造的辅助模型DSpark的三个组成部分之一。当负责给出最终答案的大模型把刚生成句子的上下文信息传递过来后,DFlash会据此并行地预先拉出接下来可能出现的多个token的内部状态。大模型只需一次计算就能检查这批准备好的候选,把其中正确的部分一次性确定下来,从而加快整句话生成的速度。
DFlash本身并不是给出最终答案的模型,只是为了提速而存在的辅助装置。因此无论用不用这个结构,最终生成的句子都是一样的,唯一的区别只是得到同样答案的速度快慢。
在报道中是这样出现的
文章中常以类似"以目标模型的上下文特征为条件、一次性提取全部草稿token隐藏状态的DFlash系并行骨干网络"的方式出现,是构成DSpark草稿模型的三个组成部分之一。很容易被误以为是一个独立的完整模型,但实际上它是草稿模型内部的子结构,不会单独使用。
