创建响应
OpenAI Responses API:Codex CLI 与 GPT、GLM、千问、Grok 等模型使用;无状态,每轮需发送完整历史。
/v1/responsesOpenAI Responses 兼容端点,Codex CLI 走这里。HopBase 的 Responses 是无状态的:store 固定为 false,previous_response_id 会被移除,多轮对话请每次发送完整 input。
未列出的字段原样转发;模型不收的字段(如 DeepSeek 的 truncation、reasoning.summary)由各模型页说明是否静默删除。流式输出中途失败时以 event: response.failed 下发,HTTP 状态仍为 200。
请求头
Bearer sk-…:控制台「API 密钥」里创建的密钥,所属分组须包含请求的模型
请求体参数JSON
当前密钥分组内的模型 ID。支持 Responses 的分组:GPT(Codex)、GLM-5.3、千问、Grok,以及 deepseek-v4.1-flash;Gemini 不支持
字符串会自动包成单条用户消息;也可传消息数组。千问的内容分片只收 input_text、input_image、input_file,不收视频
user / assistant / system / developer
字符串或内容分片数组
输出上限。网关不截断、不改写;上限按模型官方规格
true 返回 Responses SSE 事件流,见流式事件
默认false
工具定义,原样转发。Responses 的函数工具是扁平结构(name 与 type 同级),不同于 Chat Completions
function,或模型支持的服务端工具类型
函数名
函数用途
参数的 JSON Schema
原样转发
推理配置,原样转发。Codex CLI 的 model_reasoning_effort 即写入这里
GPT:low / medium / high / xhigh,档位越高思考越久、token 消耗越多。grok-4.20-multi-agent-0309 用它控制协作的智能体数量
只保留 priority / flex;其他取值会被移除后再转发
可选值priorityflex
不支持:网关会移除此字段,不会接续上一轮。多轮对话请在 input 里带上完整历史
固定为 false:服务端不保存响应,不能事后按 ID 取回
默认false
返回
200成功。非流式为 response JSON;stream: true 时为 SSE
响应 ID(store 固定为 false,不能按 ID 取回)
Unix 秒
completed / incomplete / failed
模型 ID
输出项:message、reasoning、function_call 等
message / reasoning / function_call
message 为 assistant
message 的内容分片
output_text
输出文字
function_call:函数名
function_call:JSON 字符串参数
function_call:回传结果时引用
Token 用量
输入 Token
输出 Token,含推理 Token
合计
其中推理 Token
失败时的错误
错误
missing_api_key / invalid_api_key / api_key_expired)insufficient_quota)model_not_found),或路径不属于该分组(route_not_found)request_too_large)user_concurrency_limit / apikey_concurrency_limit),带 Retry-Afterprevious_response_id 开新对话