GoodPut AI

提示词缓存

缓存命中如何计费、如何最大化命中率。

对话历史、系统提示词、工具定义这类在多次请求间重复出现的前缀,命中缓存后按缓存读取价计费——通常远低于输入价(各模型实价见模型库详情页)。Agent 工具(Claude Code、Codex 等)的长会话是最大受益场景。

命中如何确认

以响应 usage 为准:

协议字段
OpenAIusage.prompt_tokens_details.cached_tokens
Anthropicusage.cache_read_input_tokens

命中部分按缓存读取价计费,未命中部分按输入价计费。

缓存如何生效

  • 自动缓存:支持上下文缓存的模型(如 DeepSeek 系列)由供给方自动识别重复前缀,无需任何参数
  • 显式标注:Anthropic 协议下可在 system 或消息块上标注 cache_control: {"type": "ephemeral"} 设置缓存断点,网关按模型支持情况透传
{
  "system": [
    {
      "type": "text",
      "text": "<长系统提示词>",
      "cache_control": {"type": "ephemeral"}
    }
  ]
}

提高命中率

缓存按前缀完全一致匹配,请把稳定内容放前、变化内容放后:

  1. 工具定义、系统提示词在最前且保持字节级稳定(注意 JSON 字段顺序)
  2. 对话历史按原样追加,不要改写历史消息
  3. 每轮只在末尾新增内容

各模型是否支持缓存、缓存读取价是多少,见模型库能力与价格标注;实际扣费金额可在控制台调用日志逐笔核对。

本页目录