投机解码
Speculative Decoding
一种AI生成加速技术:先由小型辅助模型预测答案草稿,再由大模型一次性批量校验,从而提升速度。
简单来说
投机解码是这样一种方法:AI生成文字时,一个又小又快的辅助模型先预先写出几个词,而又大又聪明的模型只负责校验,不必自己逐字生成,从而提升速度。
可以用公司业务来打比方。新员工先快速写出几句初稿交给组长。组长不必从头开始一个字一个字地亲自撰写,而是通读初稿,对的地方直接放行,错的地方才重新修改。这比组长独自撰写所有内容要快得多。
AI中发生的事情也是一样。又大又重的模型如果逐词依次生成,会耗费很长时间。因此,轻量快速的辅助模型(通常称为"drafter",即草稿模型)先预测出几个词,原本的大模型则一次性审查这些预测——预测正确就采纳,预测错误就从出错的地方开始自己接着写。最终结果的质量与大模型独自生成的完全相同,但所需时间大幅减少。因此,在本地电脑或个人GPU等处理能力有限的环境中运行大型模型时,常常会搭配使用这种技术。
在报道中是这样出现的
文章中常见的表述是"通过DFlash、DSpark等投机解码技术提升了智能体任务的速度"。有一点容易被误解:投机解码并不意味着AI在随意猜测、敷衍作答。答案质量与大模型亲自校验的结果完全一致,提升的只是生成速度。
