跳到正文

美国区:DeepSeek 与 GLM

用 OpenAI Chat Completions、OpenAI Responses 或 Anthropic Messages 调用美国区的 DeepSeek 与 GLM 模型。

项目值
Base URLhttps://api.hop-base.com/v1
OpenAI Chat CompletionsPOST /v1/chat/completions
OpenAI ResponsesPOST /v1/responses
Anthropic MessagesPOST /v1/messages

美国区模型是一组独立的模型 ID,全部以 -us 结尾。每个模型都支持这三种协议,同一把密钥、同一个模型 ID 通用,按你的客户端选协议即可。

curl https://api.hop-base.com/v1/chat/completions \
  -H "Authorization: Bearer sk-your-key" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4.1-flash-us",
    "messages": [{ "role": "user", "content": "用五条要点总结本季度的风险。" }]
  }'

模型

模型 ID上下文窗口最大输出 tokens图片输入
deepseek-v4.1-flash-us1M393,216支持
deepseek-v4-pro-us1M393,216不支持
deepseek-v4-flash-us1M393,216不支持
glm-5.3-us1M131,072不支持
glm-5.2-us1M131,072不支持

DeepSeek 模型在「DeepSeek 美国区」分组,GLM 模型在「GLM 美国区」分组。在控制台「API 密钥」里把分组加进密钥;不含该分组的密钥调用返回 404。建密钥弹窗里,这两个分组都列在「美国区」分类下。

deepseek-v4-pro-us 是 2026-08-13 发布版,deepseek-v4-flash-us 是 2026-07-31 发布版。不支持图片输入的模型看不到图片:请求照常成功,模型会回答没有收到图片。

这些 ID 与 DeepSeek、GLM-5.3 页面上的模型相互独立,限制、价格和协议支持都不同。调用 -us 模型以本页为准。

选择协议

客户端协议端点
OpenAI SDK、Cherry Studio、Cursor、DifyOpenAI Chat Completions/v1/chat/completions
Codex CLIOpenAI Responses/v1/responses
Claude Code、Anthropic SDKAnthropic Messages/v1/messages

鉴权用 Authorization: Bearer sk-your-key;在 /v1/messages 上也可以用 x-api-key 请求头。所有响应里的 model 字段都回显你请求的 ID。

Claude Code

把 Claude Code 指向 HopBase,再选一个 -us 模型。Claude Code 不认识这些 ID,所以还要告诉它真实的上下文窗口,否则它会在 200K tokens 时压缩对话。

export ANTHROPIC_BASE_URL="https://api.hop-base.com"
export ANTHROPIC_AUTH_TOKEN="sk-your-key"
export ANTHROPIC_MODEL="deepseek-v4.1-flash-us"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="deepseek-v4-flash-us"
export CLAUDE_CODE_MAX_CONTEXT_TOKENS=1000000
claude

ANTHROPIC_DEFAULT_HAIKU_MODEL 是 Claude Code 做生成标题等后台任务时用的模型。一键配置和 settings.json 写法见 Claude Code。

Codex CLI

在 ~/.codex/config.toml 里加一个 provider,wire_api 设为 responses。

model = "deepseek-v4.1-flash-us"
model_provider = "hopbase"

[model_providers.hopbase]
name = "HopBase"
base_url = "https://api.hop-base.com/v1"
env_key = "HOPBASE_API_KEY"
wire_api = "responses"

然后设置环境变量 HOPBASE_API_KEY 并运行 codex。更多选项见 Codex CLI。

思考与工具调用

五个模型默认都会思考。Chat Completions 在 reasoning_content 里返回思考过程,Anthropic Messages 用 thinking 块,Responses 用推理项。输出 tokens 已经包含思考部分。

  • glm-5.3-us 始终思考,关闭思考返回 400。
  • 在 Anthropic Messages 上,GLM 模型的 output_config.effort 会映射到 low、high 或 max:medium 按 high,xhigh 按 max。DeepSeek 原样接收。
  • 函数调用完整可用:单次调用、并行调用,以及在后续轮次回传工具结果。
  • GLM 模型会忽略强制指定工具(指定工具名、required 或 any),可能直接用文字回答。DeepSeek 模型会按指定调用。
400 The value of the enable_thinking parameter is restricted to True.

缓存与计费

前缀缓存自动生效,无需配置。缓存命中显示在 usage.prompt_tokens_details.cached_tokens(Chat Completions)、usage.input_tokens_details.cached_tokens(Responses)和 usage.cache_read_input_tokens(Anthropic Messages)。

Anthropic 请求里的 cache_control 断点会在发出前去掉,所以不支持显式缓存,自动缓存照常生效。2026-10-02 实测,Claude Code 从第二轮起有 94%–99% 的 prompt 命中缓存。

价格以美国区官方价为基准,与其他 DeepSeek、GLM 页面不同。你的密钥适用的价格见登录后的模型广场。

  • 三个 DeepSeek 模型按北京时间(UTC+8)每天分峰谷计价:每天 08:00–22:00 为高峰,含周末。
  • 低峰时段输入、缓存输入、输出单价全部减半。
  • 一次请求按完成时刻计价,只有一个单价。
  • GLM 模型不分峰谷。

用 Anthropic Messages 对账时,input_tokens 不含缓存命中部分,对应用量记录的「输入 Token」;cache_read_input_tokens 对应「缓存输入 Token」。

限制与报错

情况结果
GLM max_tokens 超过 131,072400
DeepSeek max_tokens 超过 393,216不拒绝
DeepSeek n 大于 1,或传 logprobs400
GLM temperature 大于等于 2.0400
容量暂时耗尽429
400 Range of max_tokens should be [1, 131072]
400 Invalid n value (currently only n = 1 is supported)
400 Temperature should be in [0.0, 2.0)
429 Upstream accounts are currently rate limited, please retry later

在 Anthropic Messages 上,GLM 的 max_tokens 报错原文是 Range of max_completion_tokens should be [1, 131072]。429 不计费。请用指数退避重试:突发流量之后,模型可能在一分钟内不可用。

下一步