DeepSeek V4
Llame a DeepSeek V4 Pro y Flash mediante la API de Chat Completions compatible con OpenAI de HopBase.
DeepSeek V4 funciona sobre el protocolo compatible con OpenAI de HopBase. Use https://api.hop-base.com/v1 con Authorization: Bearer sk-your-key y tome el ID de modelo exacto de GET /v1/models.
Modelos
| ID de modelo | Notas |
|---|---|
deepseek-v4-pro-202606 | V4 Pro |
deepseek-v4-flash-202605 | V4 Flash, 1M de contexto, hasta 384.000 tokens de salida |
Ambos pertenecen al mismo grupo de plan, así que una sola clave llega a los dos.
Los nombres cortos no son invocables
Solo los ID con fecha de arriba son modelos de producción. deepseek-v4-flash se rechaza con un 400 que indica deepseek-v4-flash-202605 como reemplazo, y deepseek-v4-pro devuelve 404 model_not_found. Ninguno llega a un modelo: lea el ID de GET /v1/models en lugar de abreviarlo.
Endpoint
POST /v1/chat/completions es el punto de entrada admitido. El streaming funciona con normalidad.
Pida el uso de forma explícita en streaming
Envíe stream_options: { "include_usage": true } si su cliente necesita leer el consumo de tokens de una respuesta en streaming. La facturación es correcta en cualquier caso, pero sin esa opción el bloque de uso no se entrega al cliente.
Dos capacidades que DeepSeek ofrece en su propia API no están disponibles aquí: la compleción de relleno intermedio (FIM) y la compleción por prefijo. Viven en rutas que HopBase no enruta.
Claude Code no puede usar estos modelos. Habla el protocolo Anthropic Messages, que HopBase mapea a modelos GPT y no a DeepSeek.
Salida de razonamiento
DeepSeek devuelve su traza de razonamiento en un campo reasoning_content aparte, no dentro de content. Léalo explícitamente si lo necesita.
completion_tokens ya incluye los tokens de razonamiento, así que trátelo como la longitud real de salida y no sume reasoning_tokens encima. Esto se diferencia de Grok, donde el endpoint de chat los informa por separado y hay que sumarlos.
Lo que la pasarela cambia en su solicitud
| Comportamiento | Efecto en su solicitud |
|---|---|
| Guardia del historial de mensajes | Una solicitud con más de 26 mensajes conserva como máximo los 2 primeros mensajes system / developer más los últimos 24. Todo lo intermedio se descarta |
previous_response_id | Se elimina si está presente. Las solicitudes se balancean entre cuentas, así que un ID emitido por una no es válido en otra |
messages vacío | Se rechaza con un 400 antes de llamar al proveedor |
La guardia también se aplica al modelo de 1M de contexto
Una conversación larga se trunca por número de mensajes, no por número de tokens. Si su agente depende del historial completo, compáctelo usted en menos mensajes y mantenga lo que deba sobrevivir en los dos primeros mensajes de sistema.
Caché de prefijo
La caché de prefijo es implícita: no hay nada que activar ni ningún parámetro de control que enviar. Un acierto se informa en el campo estándar de OpenAI usage.prompt_tokens_details.cached_tokens.
Su registro de uso de HopBase y el cuerpo de la respuesta cuentan la entrada de forma distinta, lo cual importa al conciliar:
| Campo | Significado |
|---|---|
prompt_tokens de la respuesta | Todo el prompt, incluida la parte en caché |
| Tokens de entrada del registro | El prompt menos la parte en caché |
| Tokens de entrada en caché del registro | La parte en caché, por separado |
Es decir, la entrada más la entrada en caché del registro equivalen al prompt_tokens de la respuesta. La lectura de caché se tarifica aparte de la entrada normal; consulte el catálogo de modelos con la sesión iniciada para ver la tarifa que aplica a su clave.
curl
curl https://api.hop-base.com/v1/chat/completions \
-H "Authorization: Bearer sk-your-key" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-pro-202606",
"messages": [{ "role": "user", "content": "Resuma los riesgos de este trimestre en cinco puntos." }]
}'Identidad del modelo en las respuestas
El campo model de la respuesta siempre refleja el ID público que solicitó. HopBase lo mantiene estable incluso cuando la solicitud se atiende por otra ruta upstream, así que un cliente que verifique response.model == request.model sigue funcionando.
Relacionado
DeepSeek Harness explica cómo conectar el propio runtime de agentes dsh: el archivo de configuración y el formulario de proveedor personalizado. Esta página es el contrato de modelo que hay detrás.
Qwen
Llame a los modelos Qwen 3.8 y 3.7 mediante la API de Chat Completions compatible con OpenAI de HopBase.
Grok
Llame a los modelos de chat, razonamiento e imagen de Grok de xAI mediante la API compatible con OpenAI de HopBase, incluidos el precio de contexto largo, la facturación de tokens de razonamiento y el cargo por herramientas del servidor.