GoodPut AI

推理模型

思考过程如何返回、如何计量,以及多轮对话的正确姿势。

平台上的推理模型(如 GLM-5.2、DeepSeek V4 系列)会在给出答案前先「思考」。思考过程与正文分开返回,思考消耗的 token 独立计量、计入输出计费。

思考过程的返回形式

OpenAI 协议

思考过程在 message.reasoning_content(流式为 delta.reasoning_content),正文在 content

{
  "message": {
    "content": "ok",
    "reasoning_content": "用户要求只回复 ok,我应当……"
  },
  "usage": {
    "completion_tokens": 25,
    "completion_tokens_details": {"reasoning_tokens": 22, "text_tokens": 3}
  }
}

Anthropic 协议

思考过程以 thinking 内容块返回(流式为 thinking_delta 事件),正文在 text 块:

{
  "content": [
    {"type": "thinking", "thinking": "用户要求……", "signature": "..."},
    {"type": "text", "text": "ok"}
  ]
}

多轮对话注意事项

  • 历史 assistant 消息原样回传即可,包括思考内容——需要裁剪时只删除整段思考块,不要改写其内部字段
  • 历史思考块的协议兼容问题(缺 signature、空 content 等)由网关自动清洗,客户端无需处理

计量与预算

  • 思考 token 计入 completion_tokens(细分见 completion_tokens_details.reasoning_tokens),按输出价计费
  • max_tokens 的上限包含思考部分——推理模型建议把 max_tokens 设得比常规模型更大,避免思考占满预算后正文被截断

控制思考行为

不同模型对思考控制参数(如思考开关、思考长度)的支持不同,以模型库各模型详情页说明为准;不受支持的控制参数会被网关安全忽略,不会导致请求失败。

本页目录