Qwen

Llame a los modelos Qwen 3.8 y 3.7 mediante la API de Chat Completions compatible con OpenAI de HopBase.

Qwen funciona sobre el protocolo compatible con OpenAI de HopBase. Use https://api.hop-base.com/v1 con Authorization: Bearer sk-your-key y tome el ID de modelo exacto de GET /v1/models.

Modelos

ID de modeloContextoEntrada de imagen y video
qwen3.8-max1M
qwen3.8-flash1M
qwen3.7-max1MSolo texto
qwen3.7-plus1M
qwen3.7-flash1M

Los cinco exponen una ventana de contexto de 1.048.576 tokens, con hasta 991.808 tokens de entrada y 131.072 de salida por solicitud. Los cinco pertenecen al mismo grupo de plan, así que una sola clave llega a todos.

Endpoint

POST /v1/chat/completions es el punto de entrada admitido. El streaming funciona con normalidad.

Pida el uso de forma explícita en streaming

Envíe stream_options: { "include_usage": true } si su cliente necesita leer el consumo de tokens de una respuesta en streaming. La facturación es correcta en cualquier caso, pero sin esa opción el bloque de uso no se entrega al cliente.

Los campos propios de Qwen como enable_thinking, thinking_budget y enable_search se transmiten al modelo sin cambios: HopBase ni los exige ni los valida. Las llamadas a funciones y el modo JSON se comportan igual que en la API oficial.

Lo que la pasarela cambia en su solicitud

Conviene conocer estas dos reescrituras antes de construir un agente de larga duración sobre Qwen.

ComportamientoEfecto en su solicitud
Guardia del historial de mensajesEn chat/completions, una solicitud con más de 26 mensajes conserva como máximo los 2 primeros mensajes system / developer más los últimos 24. Todo lo intermedio se descarta
previous_response_idSe elimina si está presente. Las solicitudes se balancean entre cuentas, así que un ID emitido por una no es válido en otra

La guardia también se aplica a los modelos de 1M de contexto

Una conversación larga se trunca por número de mensajes, no por número de tokens. Si su agente depende del historial completo, compáctelo usted en menos mensajes y mantenga lo que deba sobrevivir en los dos primeros mensajes de sistema.

Solicitudes de entrada larga

Algunos modelos Qwen cambian de nivel cuando la entrada de una solicitud supera cierta longitud.

  • El umbral cuenta todo el prompt: la parte en caché y la que no lo está.
  • Al superarlo, toda la solicitud pasa a ese nivel, no solo los tokens que exceden el umbral.
  • La caché no le mantiene por debajo del umbral. La caché cambia qué tarifa se aplica a la parte almacenada; no acorta el prompt a efectos del nivel. La única forma de mantenerse por debajo es enviar un prompt más corto.

Qué modelos tienen niveles y dónde están los umbrales aparece en el catálogo de modelos con la sesión iniciada.

Lectura del uso

completion_tokens ya incluye los tokens de razonamiento, así que no los sume otra vez. completion_tokens_details.reasoning_tokens es un subconjunto de la salida, informado solo a título orientativo.

Su registro de uso de HopBase y el cuerpo de la respuesta cuentan la entrada de forma distinta, lo cual importa al conciliar:

CampoSignificado
prompt_tokens de la respuestaTodo el prompt, incluida la parte en caché
Tokens de entrada del registroEl prompt menos la parte en caché
Tokens de entrada en caché del registroLa parte en caché, por separado

Es decir, la entrada más la entrada en caché del registro equivalen al prompt_tokens de la respuesta.

curl

curl https://api.hop-base.com/v1/chat/completions \
  -H "Authorization: Bearer sk-your-key" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-max",
    "messages": [{ "role": "user", "content": "Resuma los riesgos de este trimestre en cinco puntos." }]
  }'

Manejo de errores

Las respuestas 4xx del proveedor se transmiten con los prefijos de código de error propios del fabricante eliminados, así que el texto de message es legible pero no estable. Ramifique según el estado HTTP y el campo code, nunca según la cadena del mensaje.

Un nombre de modelo que no esté en su grupo devuelve 404 model_not_found. Los ID de modelo son exactos: léalos de GET /v1/models en lugar de adivinarlos.

Grupo

Qwen tiene su propio grupo de plan. Una clave de Qwen no llega a otras familias, y una clave de otra familia no llega a Qwen. Esto incluye los modelos de video Wan 3.0 y HappyHorse, que son un grupo aparte con su propia clave aunque provengan del mismo fabricante.

En esta página