提示词缓存
缓存命中如何计费、如何最大化命中率。
对话历史、系统提示词、工具定义这类在多次请求间重复出现的前缀,命中缓存后按缓存读取价计费——通常远低于输入价(各模型实价见模型库详情页)。Agent 工具(Claude Code、Codex 等)的长会话是最大受益场景。
命中如何确认
以响应 usage 为准:
| 协议 | 字段 |
|---|---|
| OpenAI | usage.prompt_tokens_details.cached_tokens |
| Anthropic | usage.cache_read_input_tokens |
命中部分按缓存读取价计费,未命中部分按输入价计费。
缓存如何生效
- 自动缓存:支持上下文缓存的模型(如 DeepSeek 系列)由供给方自动识别重复前缀,无需任何参数
- 显式标注:Anthropic 协议下可在 system 或消息块上标注
cache_control: {"type": "ephemeral"}设置缓存断点,网关按模型支持情况透传
{
"system": [
{
"type": "text",
"text": "<长系统提示词>",
"cache_control": {"type": "ephemeral"}
}
]
}提高命中率
缓存按前缀完全一致匹配,请把稳定内容放前、变化内容放后:
- 工具定义、系统提示词在最前且保持字节级稳定(注意 JSON 字段顺序)
- 对话历史按原样追加,不要改写历史消息
- 每轮只在末尾新增内容