Prompt Caching 省钱笔记

长系统提示词、多轮对话、RAG 上下文,这些场景下 Prompt Caching 能省下多少钱?记录一次真实项目里的测算过程。

目录 · 3 节
  1. 缓存命中的前提
  2. 测算结果
  3. 小结

在一个客服类项目里,每次请求都带着近万 token 的系统提示词和知识库片段。接入 Prompt Caching 之后,月度账单降了一大截。

缓存命中的前提

缓存是按前缀匹配的:只有请求开头完全相同的那一段,才能被复用。所以要把稳定不变的内容(系统提示词、工具定义、长文档)放在最前面,把每次都会变的用户输入放在最后。

测算结果

0% 25% 50% 75% 100% 100% 不缓存 58% 命中 50% 24% 命中 90% 0% 25% 50% 75% 100% 100% 不缓存 58% 命中 50% 24% 命中 90%
相对成本(以不缓存为 100%,示例数据)

小结

先把 prompt 结构整理成「稳定前缀 + 变化后缀」,缓存几乎是白捡的收益。