DeepSeek V4

Llame a DeepSeek V4 Pro y Flash mediante la API de Chat Completions compatible con OpenAI de HopBase.

DeepSeek V4 funciona sobre el protocolo compatible con OpenAI de HopBase. Use https://api.hop-base.com/v1 con Authorization: Bearer sk-your-key y tome el ID de modelo exacto de GET /v1/models.

Modelos

ID de modeloNotas
deepseek-v4-pro-202606V4 Pro
deepseek-v4-flash-202605V4 Flash, 1M de contexto, hasta 384.000 tokens de salida

Ambos pertenecen al mismo grupo de plan, así que una sola clave llega a los dos.

Los nombres cortos no son invocables

Solo los ID con fecha de arriba son modelos de producción. deepseek-v4-flash se rechaza con un 400 que indica deepseek-v4-flash-202605 como reemplazo, y deepseek-v4-pro devuelve 404 model_not_found. Ninguno llega a un modelo: lea el ID de GET /v1/models en lugar de abreviarlo.

Endpoint

POST /v1/chat/completions es el punto de entrada admitido. El streaming funciona con normalidad.

Pida el uso de forma explícita en streaming

Envíe stream_options: { "include_usage": true } si su cliente necesita leer el consumo de tokens de una respuesta en streaming. La facturación es correcta en cualquier caso, pero sin esa opción el bloque de uso no se entrega al cliente.

Dos capacidades que DeepSeek ofrece en su propia API no están disponibles aquí: la compleción de relleno intermedio (FIM) y la compleción por prefijo. Viven en rutas que HopBase no enruta.

Claude Code no puede usar estos modelos. Habla el protocolo Anthropic Messages, que HopBase mapea a modelos GPT y no a DeepSeek.

Salida de razonamiento

DeepSeek devuelve su traza de razonamiento en un campo reasoning_content aparte, no dentro de content. Léalo explícitamente si lo necesita.

completion_tokens ya incluye los tokens de razonamiento, así que trátelo como la longitud real de salida y no sume reasoning_tokens encima. Esto se diferencia de Grok, donde el endpoint de chat los informa por separado y hay que sumarlos.

Lo que la pasarela cambia en su solicitud

ComportamientoEfecto en su solicitud
Guardia del historial de mensajesUna solicitud con más de 26 mensajes conserva como máximo los 2 primeros mensajes system / developer más los últimos 24. Todo lo intermedio se descarta
previous_response_idSe elimina si está presente. Las solicitudes se balancean entre cuentas, así que un ID emitido por una no es válido en otra
messages vacíoSe rechaza con un 400 antes de llamar al proveedor

La guardia también se aplica al modelo de 1M de contexto

Una conversación larga se trunca por número de mensajes, no por número de tokens. Si su agente depende del historial completo, compáctelo usted en menos mensajes y mantenga lo que deba sobrevivir en los dos primeros mensajes de sistema.

Caché de prefijo

La caché de prefijo es implícita: no hay nada que activar ni ningún parámetro de control que enviar. Un acierto se informa en el campo estándar de OpenAI usage.prompt_tokens_details.cached_tokens.

Su registro de uso de HopBase y el cuerpo de la respuesta cuentan la entrada de forma distinta, lo cual importa al conciliar:

CampoSignificado
prompt_tokens de la respuestaTodo el prompt, incluida la parte en caché
Tokens de entrada del registroEl prompt menos la parte en caché
Tokens de entrada en caché del registroLa parte en caché, por separado

Es decir, la entrada más la entrada en caché del registro equivalen al prompt_tokens de la respuesta. La lectura de caché se tarifica aparte de la entrada normal; consulte el catálogo de modelos con la sesión iniciada para ver la tarifa que aplica a su clave.

curl

curl https://api.hop-base.com/v1/chat/completions \
  -H "Authorization: Bearer sk-your-key" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-pro-202606",
    "messages": [{ "role": "user", "content": "Resuma los riesgos de este trimestre en cinco puntos." }]
  }'

Identidad del modelo en las respuestas

El campo model de la respuesta siempre refleja el ID público que solicitó. HopBase lo mantiene estable incluso cuando la solicitud se atiende por otra ruta upstream, así que un cliente que verifique response.model == request.model sigue funcionando.

Relacionado

DeepSeek Harness explica cómo conectar el propio runtime de agentes dsh: el archivo de configuración y el formulario de proveedor personalizado. Esta página es el contrato de modelo que hay detrás.

En esta página