Crear una respuesta
OpenAI Responses API: la usan Codex CLI y modelos como GPT, GLM, Qwen y Grok; sin estado, cada turno debe enviar el historial completo.
/v1/responsesEndpoint compatible con OpenAI Responses; Codex CLI lo usa. En HopBase, Responses es sin estado: store siempre es false y previous_response_id se elimina, así que en conversaciones de varios turnos envíe el input completo cada vez.
Los campos no listados se reenvían sin cambios; cada página de modelo indica si los campos que el modelo no acepta (como truncation y reasoning.summary en DeepSeek) se eliminan sin aviso. Si la salida en streaming falla a mitad, se envía event: response.failed y el estado HTTP sigue siendo 200.
Encabezados
Bearer sk-…: una clave de API creada en la consola; su grupo debe incluir el modelo solicitado
Parámetros del cuerpoJSON
Un ID de modelo del grupo de la clave actual. Grupos con Responses: GPT (Codex), GLM-5.3, Qwen, Grok y deepseek-v4.1-flash; Gemini no lo admite
Una cadena se envuelve automáticamente en un único mensaje de usuario; también acepta un array de mensajes. En Qwen, las partes de contenido solo admiten input_text, input_image e input_file, sin video
user / assistant / system / developer
Cadena o array de partes de contenido
Límite de salida. El gateway no lo recorta ni lo reescribe; el máximo sigue la especificación oficial del modelo
true devuelve el flujo de eventos SSE de Responses; ver Eventos de streaming
Predeterminadofalse
Definiciones de herramientas; se reenvían sin cambios. En Responses las herramientas de función son planas (name al mismo nivel que type), a diferencia de Chat Completions
function o un tipo de herramienta del servidor que admita el modelo
Nombre de la función
Para qué sirve la función
JSON Schema de los parámetros
Se reenvía sin cambios
Configuración de razonamiento; se reenvía sin cambios. El model_reasoning_effort de Codex CLI se escribe aquí
GPT: low / medium / high / xhigh; cuanto más alto el nivel, más razona y más tokens consume. grok-4.20-multi-agent-0309 lo usa para controlar cuántos agentes colaboran
Solo se conservan priority / flex; los demás valores se eliminan antes de reenviar
Valorespriorityflex
No admitido: el gateway elimina este campo y no continúa el turno anterior. En conversaciones de varios turnos, incluya el historial completo en input
Siempre false: el servidor no guarda la respuesta y no se puede recuperar después por ID
Predeterminadofalse
Respuesta
200Éxito. Sin streaming es un JSON response; con stream: true es SSE
ID de la respuesta (store siempre es false; no se puede recuperar por ID)
Segundos Unix
completed / incomplete / failed
ID del modelo
Elementos de salida: message, reasoning, function_call, etc.
message / reasoning / function_call
assistant en message
Partes de contenido de message
output_text
Texto de salida
function_call: nombre de la función
function_call: argumentos como cadena JSON
function_call: se referencia al devolver el resultado
Uso de tokens
Tokens de entrada
Tokens de salida, incluidos los de razonamiento
Total
De ellos, tokens de razonamiento
Error si falla
Errores
missing_api_key / invalid_api_key / api_key_expired)insufficient_quota)model_not_found) o la ruta no pertenece a ese grupo (route_not_found)request_too_large)user_concurrency_limit / apikey_concurrency_limit), con Retry-Afterprevious_response_id e inicie una conversación nueva