Saltar al contenido

Región EE. UU.: DeepSeek y GLM

Llame a los modelos DeepSeek y GLM de la región de EE. UU. con OpenAI Chat Completions, OpenAI Responses o Anthropic Messages.

ElementoValor
Base URLhttps://api.hop-base.com/v1
OpenAI Chat CompletionsPOST /v1/chat/completions
OpenAI ResponsesPOST /v1/responses
Anthropic MessagesPOST /v1/messages

Los modelos de la región de EE. UU. son un conjunto propio de ID de modelo, todos terminados en -us. Cada modelo admite los tres protocolos con la misma clave y el mismo ID de modelo, así que elija el protocolo que hable su cliente.

curl https://api.hop-base.com/v1/chat/completions \
  -H "Authorization: Bearer sk-your-key" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4.1-flash-us",
    "messages": [{ "role": "user", "content": "Resume en cinco puntos los riesgos de este trimestre." }]
  }'

Modelos

ID de modeloVentana de contextoTokens de salida máximosEntrada de imágenes
deepseek-v4.1-flash-us1M393.216Sí
deepseek-v4-pro-us1M393.216No
deepseek-v4-flash-us1M393.216No
glm-5.3-us1M131.072No
glm-5.2-us1M131.072No

Los modelos DeepSeek están en el grupo DeepSeek región EE. UU. y los GLM en el grupo GLM región EE. UU.. Añada el grupo a su clave en Claves de API de la consola; una clave sin él recibe un 404. En el diálogo de claves, ambos grupos aparecen bajo Región EE. UU.

deepseek-v4-pro-us es la versión del 2026-08-13 y deepseek-v4-flash-us la del 2026-07-31. Los modelos sin entrada de imágenes no ven las imágenes: la solicitud tiene éxito y el modelo responde que no se adjuntó ninguna imagen.

Estos ID son distintos de los modelos de las páginas de DeepSeek y GLM-5.3: cambian los límites, los precios y los protocolos admitidos. Para los modelos -us, siga esta página.

Elegir un protocolo

ClienteProtocoloEndpoint
OpenAI SDK, Cherry Studio, Cursor, DifyOpenAI Chat Completions/v1/chat/completions
Codex CLIOpenAI Responses/v1/responses
Claude Code, Anthropic SDKAnthropic Messages/v1/messages

Autentíquese con Authorization: Bearer sk-your-key. En /v1/messages también funciona la cabecera x-api-key. El campo model de cada respuesta repite el ID que solicitó.

Claude Code

Apunte Claude Code a HopBase y elija un modelo -us. Claude Code no conoce estos ID, así que indíquele también la ventana de contexto real; si no, compacta la conversación al llegar a 200K tokens.

export ANTHROPIC_BASE_URL="https://api.hop-base.com"
export ANTHROPIC_AUTH_TOKEN="sk-your-key"
export ANTHROPIC_MODEL="deepseek-v4.1-flash-us"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="deepseek-v4-flash-us"
export CLAUDE_CODE_MAX_CONTEXT_TOKENS=1000000
claude

ANTHROPIC_DEFAULT_HAIKU_MODEL es el modelo que Claude Code usa para tareas en segundo plano, como generar títulos. La configuración en un clic y el formato de settings.json están en Claude Code.

Codex CLI

Añada un proveedor en ~/.codex/config.toml y ponga wire_api en responses.

model = "deepseek-v4.1-flash-us"
model_provider = "hopbase"

[model_providers.hopbase]
name = "HopBase"
base_url = "https://api.hop-base.com/v1"
env_key = "HOPBASE_API_KEY"
wire_api = "responses"

Después exporte HOPBASE_API_KEY y ejecute codex. Más opciones en Codex CLI.

Razonamiento y llamadas a herramientas

Los cinco modelos razonan por defecto. Chat Completions devuelve el razonamiento en reasoning_content, Anthropic Messages en bloques thinking y Responses en elementos de razonamiento. Los tokens de salida ya incluyen el razonamiento.

  • glm-5.3-us siempre razona. Desactivar el razonamiento devuelve un 400.
  • En Anthropic Messages, output_config.effort de los modelos GLM se asigna a low, high o max: medium pasa a high y xhigh pasa a max. DeepSeek recibe el valor sin cambios.
  • Las llamadas a funciones funcionan de principio a fin: una llamada, varias en paralelo y resultados de herramientas devueltos en turnos posteriores.
  • Los modelos GLM ignoran una elección de herramienta forzada (una herramienta concreta, required o any) y pueden responder con texto. Los modelos DeepSeek la respetan.
400 The value of the enable_thinking parameter is restricted to True.

Caché y facturación

La caché de prefijo es automática; no hay nada que activar. Los aciertos de caché aparecen en usage.prompt_tokens_details.cached_tokens (Chat Completions), usage.input_tokens_details.cached_tokens (Responses) y usage.cache_read_input_tokens (Anthropic Messages).

Los puntos de corte cache_control de las solicitudes de Anthropic se eliminan antes del envío, así que la caché explícita no está disponible; la caché automática sigue funcionando. En pruebas del 2026-10-02, a partir del segundo turno Claude Code leyó de la caché entre el 94 % y el 99 % del prompt.

Los precios siguen el precio oficial de la región de EE. UU., distinto del de las demás páginas de DeepSeek y GLM. Las tarifas de su clave están en el catálogo de modelos con la sesión iniciada.

  • Los tres modelos DeepSeek siguen cada día un horario pico / valle en hora de Pekín (UTC+8). El horario pico va de 08:00 a 22:00 todos los días, fines de semana incluidos.
  • En horario valle, los precios unitarios de entrada, entrada en caché y salida se reducen a la mitad.
  • Una solicitud se factura según el momento en que termina y lleva un único precio unitario.
  • Los modelos GLM no tienen horario pico / valle.

Al conciliar Anthropic Messages, input_tokens excluye la parte en caché y coincide con Tokens de entrada del registro de uso. cache_read_input_tokens coincide con Tokens de entrada en caché.

Límites y errores

CasoResultado
max_tokens de GLM por encima de 131.072400
max_tokens de DeepSeek por encima de 393.216No se rechaza
n mayor que 1 en DeepSeek, o logprobs400
temperature de GLM de 2,0 o más400
Capacidad agotada momentáneamente429
400 Range of max_tokens should be [1, 131072]
400 Invalid n value (currently only n = 1 is supported)
400 Temperature should be in [0.0, 2.0)
429 Upstream accounts are currently rate limited, please retry later

En Anthropic Messages, el error de max_tokens de GLM dice Range of max_completion_tokens should be [1, 131072]. Un 429 no se factura. Reintente con espera exponencial: tras una ráfaga, un modelo puede quedar no disponible hasta un minuto.

Próximos pasos