推理模型
思考过程如何返回、如何计量,以及多轮对话的正确姿势。
平台上的推理模型(如 GLM-5.2、DeepSeek V4 系列)会在给出答案前先「思考」。思考过程与正文分开返回,思考消耗的 token 独立计量、计入输出计费。
思考过程的返回形式
OpenAI 协议
思考过程在 message.reasoning_content(流式为 delta.reasoning_content),正文在 content:
{
"message": {
"content": "ok",
"reasoning_content": "用户要求只回复 ok,我应当……"
},
"usage": {
"completion_tokens": 25,
"completion_tokens_details": {"reasoning_tokens": 22, "text_tokens": 3}
}
}Anthropic 协议
思考过程以 thinking 内容块返回(流式为 thinking_delta 事件),正文在 text 块:
{
"content": [
{"type": "thinking", "thinking": "用户要求……", "signature": "..."},
{"type": "text", "text": "ok"}
]
}多轮对话注意事项
- 历史 assistant 消息原样回传即可,包括思考内容——需要裁剪时只删除整段思考块,不要改写其内部字段
- 历史思考块的协议兼容问题(缺
signature、空content等)由网关自动清洗,客户端无需处理
计量与预算
- 思考 token 计入
completion_tokens(细分见completion_tokens_details.reasoning_tokens),按输出价计费 max_tokens的上限包含思考部分——推理模型建议把max_tokens设得比常规模型更大,避免思考占满预算后正文被截断
控制思考行为
不同模型对思考控制参数(如思考开关、思考长度)的支持不同,以模型库各模型详情页说明为准;不受支持的控制参数会被网关安全忽略,不会导致请求失败。