Prompt Cache
把AI已经处理过的提示词前半部分的计算结果保存下来重复使用,从而节省速度和成本的技术
简单来说
Prompt Cache(提示词缓存)是让AI模型不必重新计算已经处理过一次的提示词前半部分,而是直接重复使用之前保存好的结果的技术。这就好比厨房里不是每次都从头熬汤,而是把提前熬好的高汤直接倒进锅里,从而节省烹饪时间。
AI是从头到尾按顺序读取问题来生成答案的。对话变长时,经常会出现前半部分内容不变、只有后半部分不断变化的情况。如果每次都要把没有变化的前半部分重新读一遍、重新计算一遍,就会浪费时间和成本。Prompt Cache会把这部分不变的前半内容的计算结果保存下来,当同样的前半部分再次出现时,就跳过这部分计算,直接从后面接续处理。
当智能体(agent)在执行任务过程中回退到某个特定时间点重新开始时,这项技术同样帮助很大。因为回退点之前的内容完全相同,这部分可以直接使用已保存的结果,只需重新计算之后发生变化的部分即可。
在报道中是这样出现的
文章在介绍可以让智能体执行过程回退的工具Shepherd时提到,"由于分支点之前的提示词前缀不变,回放时可以重复使用95%以上的prompt cache。"这里所说的重复使用prompt cache,指的是即使把执行过程回退到某个特定时间点,也不需要重新计算到那个时间点为止的内容,并不是说会把对话内容本身保存下来加以记忆。
亲手试一试
把一段较长的指令(比如角色设定或规则说明)固定作为系统消息,然后在同一个对话框里连续发送几个不同的问题。如果从第二个问题开始,得到第一句回复所需的时间明显变短,这就说明前半部分内容正被缓存并重复使用。
