Región EE. UU.: DeepSeek y GLM
Llame a los modelos DeepSeek y GLM de la región de EE. UU. con OpenAI Chat Completions, OpenAI Responses o Anthropic Messages.
| Elemento | Valor |
|---|---|
| Base URL | https://api.hop-base.com/v1 |
| OpenAI Chat Completions | POST /v1/chat/completions |
| OpenAI Responses | POST /v1/responses |
| Anthropic Messages | POST /v1/messages |
Los modelos de la región de EE. UU. son un conjunto propio de ID de modelo, todos terminados en -us. Cada modelo admite los tres protocolos con la misma clave y el mismo ID de modelo, así que elija el protocolo que hable su cliente.
curl https://api.hop-base.com/v1/chat/completions \
-H "Authorization: Bearer sk-your-key" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4.1-flash-us",
"messages": [{ "role": "user", "content": "Resume en cinco puntos los riesgos de este trimestre." }]
}'Modelos
| ID de modelo | Ventana de contexto | Tokens de salida máximos | Entrada de imágenes |
|---|---|---|---|
deepseek-v4.1-flash-us | 1M | 393.216 | Sí |
deepseek-v4-pro-us | 1M | 393.216 | No |
deepseek-v4-flash-us | 1M | 393.216 | No |
glm-5.3-us | 1M | 131.072 | No |
glm-5.2-us | 1M | 131.072 | No |
Los modelos DeepSeek están en el grupo DeepSeek región EE. UU. y los GLM en el grupo GLM región EE. UU.. Añada el grupo a su clave en Claves de API de la consola; una clave sin él recibe un 404. En el diálogo de claves, ambos grupos aparecen bajo Región EE. UU.
deepseek-v4-pro-us es la versión del 2026-08-13 y deepseek-v4-flash-us la del 2026-07-31. Los modelos sin entrada de imágenes no ven las imágenes: la solicitud tiene éxito y el modelo responde que no se adjuntó ninguna imagen.
Estos ID son distintos de los modelos de las páginas de DeepSeek y GLM-5.3: cambian los límites, los precios y los protocolos admitidos. Para los modelos -us, siga esta página.
Elegir un protocolo
| Cliente | Protocolo | Endpoint |
|---|---|---|
| OpenAI SDK, Cherry Studio, Cursor, Dify | OpenAI Chat Completions | /v1/chat/completions |
| Codex CLI | OpenAI Responses | /v1/responses |
| Claude Code, Anthropic SDK | Anthropic Messages | /v1/messages |
Autentíquese con Authorization: Bearer sk-your-key. En /v1/messages también funciona la cabecera x-api-key. El campo model de cada respuesta repite el ID que solicitó.
Claude Code
Apunte Claude Code a HopBase y elija un modelo -us. Claude Code no conoce estos ID, así que indíquele también la ventana de contexto real; si no, compacta la conversación al llegar a 200K tokens.
export ANTHROPIC_BASE_URL="https://api.hop-base.com"
export ANTHROPIC_AUTH_TOKEN="sk-your-key"
export ANTHROPIC_MODEL="deepseek-v4.1-flash-us"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="deepseek-v4-flash-us"
export CLAUDE_CODE_MAX_CONTEXT_TOKENS=1000000
claudeANTHROPIC_DEFAULT_HAIKU_MODEL es el modelo que Claude Code usa para tareas en segundo plano, como generar títulos. La configuración en un clic y el formato de settings.json están en Claude Code.
Codex CLI
Añada un proveedor en ~/.codex/config.toml y ponga wire_api en responses.
model = "deepseek-v4.1-flash-us"
model_provider = "hopbase"
[model_providers.hopbase]
name = "HopBase"
base_url = "https://api.hop-base.com/v1"
env_key = "HOPBASE_API_KEY"
wire_api = "responses"Después exporte HOPBASE_API_KEY y ejecute codex. Más opciones en Codex CLI.
Razonamiento y llamadas a herramientas
Los cinco modelos razonan por defecto. Chat Completions devuelve el razonamiento en reasoning_content, Anthropic Messages en bloques thinking y Responses en elementos de razonamiento. Los tokens de salida ya incluyen el razonamiento.
glm-5.3-ussiempre razona. Desactivar el razonamiento devuelve un 400.- En Anthropic Messages,
output_config.effortde los modelos GLM se asigna alow,highomax:mediumpasa ahighyxhighpasa amax. DeepSeek recibe el valor sin cambios. - Las llamadas a funciones funcionan de principio a fin: una llamada, varias en paralelo y resultados de herramientas devueltos en turnos posteriores.
- Los modelos GLM ignoran una elección de herramienta forzada (una herramienta concreta,
requiredoany) y pueden responder con texto. Los modelos DeepSeek la respetan.
400 The value of the enable_thinking parameter is restricted to True.Caché y facturación
La caché de prefijo es automática; no hay nada que activar. Los aciertos de caché aparecen en usage.prompt_tokens_details.cached_tokens (Chat Completions), usage.input_tokens_details.cached_tokens (Responses) y usage.cache_read_input_tokens (Anthropic Messages).
Los puntos de corte cache_control de las solicitudes de Anthropic se eliminan antes del envío, así que la caché explícita no está disponible; la caché automática sigue funcionando. En pruebas del 2026-10-02, a partir del segundo turno Claude Code leyó de la caché entre el 94 % y el 99 % del prompt.
Los precios siguen el precio oficial de la región de EE. UU., distinto del de las demás páginas de DeepSeek y GLM. Las tarifas de su clave están en el catálogo de modelos con la sesión iniciada.
- Los tres modelos DeepSeek siguen cada día un horario pico / valle en hora de Pekín (UTC+8). El horario pico va de 08:00 a 22:00 todos los días, fines de semana incluidos.
- En horario valle, los precios unitarios de entrada, entrada en caché y salida se reducen a la mitad.
- Una solicitud se factura según el momento en que termina y lleva un único precio unitario.
- Los modelos GLM no tienen horario pico / valle.
Al conciliar Anthropic Messages, input_tokens excluye la parte en caché y coincide con Tokens de entrada del registro de uso. cache_read_input_tokens coincide con Tokens de entrada en caché.
Límites y errores
| Caso | Resultado |
|---|---|
max_tokens de GLM por encima de 131.072 | 400 |
max_tokens de DeepSeek por encima de 393.216 | No se rechaza |
n mayor que 1 en DeepSeek, o logprobs | 400 |
temperature de GLM de 2,0 o más | 400 |
| Capacidad agotada momentáneamente | 429 |
400 Range of max_tokens should be [1, 131072]
400 Invalid n value (currently only n = 1 is supported)
400 Temperature should be in [0.0, 2.0)
429 Upstream accounts are currently rate limited, please retry laterEn Anthropic Messages, el error de max_tokens de GLM dice Range of max_completion_tokens should be [1, 131072]. Un 429 no se factura. Reintente con espera exponencial: tras una ráfaga, un modelo puede quedar no disponible hasta un minuto.
Próximos pasos
- Claude Code y Codex CLI: configuración completa del cliente
- Anthropic SDK y OpenAI SDK: cómo escribir solicitudes con cada protocolo
- Códigos de error y reintentos
- Concurrencia, tiempos de espera y facturación