Cached Prompt
复用之前已经处理过的结果、而不是重新计算,从而降低处理成本的一种提示词处理方式。
简单来说
缓存提示词指的是:再次向AI发送相同内容时,系统不会每次都从头重新计算,而是直接调用之前已经处理好的结果。打个比方,就像咖啡馆里不是每次客人来都重新磨豆子、烧水,而是把已经冲泡好的咖啡加热后端出来。味道(结果)几乎一样,但制作所花的功夫和成本却少了很多。
AI智能体在完成一项任务之前,往往需要反复调用相同的指令或背景信息。如果每次都重新计算这些重叠的部分,时间和成本都会大幅增加。用了缓存提示词之后,重叠部分直接复用已存储的结果,只需要计算新增的部分。因此即使工作量相同,单价也会比首次计算便宜得多。
结果就是,即便用量翻了好几倍,成本往往不会同比例增长。一个AI智能体的重复性工作越多,缓存提示词占的比重就越大,实际产生的账单费用增长速度也就比用量增长慢得多。
在报道中是这样出现的
文章指出,在OpenRouter上,整个智能体消耗的token中约70%来自缓存提示词。所以即便智能体的token消耗量增长了14倍,成本也不会跟着增长14倍——这一点很容易被误解,用量的增长和成本的增长,因为有了缓存,其实是以不同速度在变化的。
亲手试一试
在AI聊天机器人或API上多次重复发送相同的指令或很长的背景说明,就能亲身感受到这一点。比如把同一份长文档作为背景资料,只更换提问内容反复提问,你会发现响应速度更快、成本也更低,相比每次都换成全新内容重新提问的情况。重叠部分越多,缓存效果就越好。
