Cache Hit
当AI再次收到和之前完全相同的输入时,直接复用已保存的结果,而不是重新计算
简单来说
缓存命中(Cache Hit)指的是,当你发给AI的内容中有一部分之前已经处理过,系统再次遇到时不会从头重新计算,而是直接取出保存好的结果使用。相反,如果遇到的是全新、从未处理过的内容,就叫做缓存未命中(Cache Miss),这时必须整体重新计算。
用餐厅来比喻会更容易理解。如果提前把常用的食材准备好,下一位客人点同样的菜时出餐速度就会快很多。AI服务中每次都附带的相同指令(系统提示词),或者针对同一份文档连续提出多个问题,就是典型的这种情况。因为前面的部分和之前完全一样,所以不需要重新计算,直接复用就好。
正因为可以复用,AI公司会把命中缓存的部分定价定得比未命中的部分便宜得多。因此对用户来说,反复引用同一段对话或文档的次数越多,整体费用就会越低。
在报道中是这样出现的
文章中会这样写道:"缓存命中的输入价格为每百万token 0.003625美元,降到了缓存未命中价格的百分之一左右。"这里有一点容易混淆:缓存命中和模型变得更聪明、答案质量发生变化毫无关系,它只是一种降低重复处理相同输入所需计算成本的定价政策和技术手段。
亲手试一试
- 在使用API的服务中,连续两次发送包含相同系统提示词或长文档的请求。
- 查看返回结果中的用量信息,确认是否单独显示了缓存命中的token数量。
- 比较第一次和第二次请求的费用或响应速度差异,亲身感受缓存命中带来的效果。
