Qwen
Llame a los modelos Qwen 3.8 y 3.7 mediante la API de Chat Completions compatible con OpenAI de HopBase.
Qwen funciona sobre el protocolo compatible con OpenAI de HopBase. Use https://api.hop-base.com/v1 con Authorization: Bearer sk-your-key y tome el ID de modelo exacto de GET /v1/models.
Modelos
| ID de modelo | Contexto | Entrada de imagen y video |
|---|---|---|
qwen3.8-max | 1M | Sí |
qwen3.8-flash | 1M | Sí |
qwen3.7-max | 1M | Solo texto |
qwen3.7-plus | 1M | Sí |
qwen3.7-flash | 1M | Sí |
Los cinco exponen una ventana de contexto de 1.048.576 tokens, con hasta 991.808 tokens de entrada y 131.072 de salida por solicitud. Los cinco pertenecen al mismo grupo de plan, así que una sola clave llega a todos.
Endpoint
POST /v1/chat/completions es el punto de entrada admitido. El streaming funciona con normalidad.
Pida el uso de forma explícita en streaming
Envíe stream_options: { "include_usage": true } si su cliente necesita leer el consumo de tokens de una respuesta en streaming. La facturación es correcta en cualquier caso, pero sin esa opción el bloque de uso no se entrega al cliente.
Los campos propios de Qwen como enable_thinking, thinking_budget y enable_search se transmiten al modelo sin cambios: HopBase ni los exige ni los valida. Las llamadas a funciones y el modo JSON se comportan igual que en la API oficial.
Lo que la pasarela cambia en su solicitud
Conviene conocer estas dos reescrituras antes de construir un agente de larga duración sobre Qwen.
| Comportamiento | Efecto en su solicitud |
|---|---|
| Guardia del historial de mensajes | En chat/completions, una solicitud con más de 26 mensajes conserva como máximo los 2 primeros mensajes system / developer más los últimos 24. Todo lo intermedio se descarta |
previous_response_id | Se elimina si está presente. Las solicitudes se balancean entre cuentas, así que un ID emitido por una no es válido en otra |
La guardia también se aplica a los modelos de 1M de contexto
Una conversación larga se trunca por número de mensajes, no por número de tokens. Si su agente depende del historial completo, compáctelo usted en menos mensajes y mantenga lo que deba sobrevivir en los dos primeros mensajes de sistema.
Solicitudes de entrada larga
Algunos modelos Qwen cambian de nivel cuando la entrada de una solicitud supera cierta longitud.
- El umbral cuenta todo el prompt: la parte en caché y la que no lo está.
- Al superarlo, toda la solicitud pasa a ese nivel, no solo los tokens que exceden el umbral.
- La caché no le mantiene por debajo del umbral. La caché cambia qué tarifa se aplica a la parte almacenada; no acorta el prompt a efectos del nivel. La única forma de mantenerse por debajo es enviar un prompt más corto.
Qué modelos tienen niveles y dónde están los umbrales aparece en el catálogo de modelos con la sesión iniciada.
Lectura del uso
completion_tokens ya incluye los tokens de razonamiento, así que no los sume otra vez. completion_tokens_details.reasoning_tokens es un subconjunto de la salida, informado solo a título orientativo.
Su registro de uso de HopBase y el cuerpo de la respuesta cuentan la entrada de forma distinta, lo cual importa al conciliar:
| Campo | Significado |
|---|---|
prompt_tokens de la respuesta | Todo el prompt, incluida la parte en caché |
| Tokens de entrada del registro | El prompt menos la parte en caché |
| Tokens de entrada en caché del registro | La parte en caché, por separado |
Es decir, la entrada más la entrada en caché del registro equivalen al prompt_tokens de la respuesta.
curl
curl https://api.hop-base.com/v1/chat/completions \
-H "Authorization: Bearer sk-your-key" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"messages": [{ "role": "user", "content": "Resuma los riesgos de este trimestre en cinco puntos." }]
}'Manejo de errores
Las respuestas 4xx del proveedor se transmiten con los prefijos de código de error propios del fabricante eliminados, así que el texto de message es legible pero no estable. Ramifique según el estado HTTP y el campo code, nunca según la cadena del mensaje.
Un nombre de modelo que no esté en su grupo devuelve 404 model_not_found. Los ID de modelo son exactos: léalos de GET /v1/models en lugar de adivinarlos.
Grupo
Qwen tiene su propio grupo de plan. Una clave de Qwen no llega a otras familias, y una clave de otra familia no llega a Qwen. Esto incluye los modelos de video Wan 3.0 y HappyHorse, que son un grupo aparte con su propia clave aunque provengan del mismo fabricante.