在一个客服类项目里,每次请求都带着近万 token 的系统提示词和知识库片段。接入 Prompt Caching 之后,月度账单降了一大截。
缓存命中的前提
缓存是按前缀匹配的:只有请求开头完全相同的那一段,才能被复用。所以要把稳定不变的内容(系统提示词、工具定义、长文档)放在最前面,把每次都会变的用户输入放在最后。
测算结果
小结
先把 prompt 结构整理成「稳定前缀 + 变化后缀」,缓存几乎是白捡的收益。
长系统提示词、多轮对话、RAG 上下文,这些场景下 Prompt Caching 能省下多少钱?记录一次真实项目里的测算过程。
在一个客服类项目里,每次请求都带着近万 token 的系统提示词和知识库片段。接入 Prompt Caching 之后,月度账单降了一大截。
缓存是按前缀匹配的:只有请求开头完全相同的那一段,才能被复用。所以要把稳定不变的内容(系统提示词、工具定义、长文档)放在最前面,把每次都会变的用户输入放在最后。
先把 prompt 结构整理成「稳定前缀 + 变化后缀」,缓存几乎是白捡的收益。