本文へスキップ

米国リージョン:DeepSeek と GLM

OpenAI Chat Completions、OpenAI Responses、Anthropic Messages のいずれかで米国リージョンの DeepSeek と GLM を呼び出します。

項目値
Base URLhttps://api.hop-base.com/v1
OpenAI Chat CompletionsPOST /v1/chat/completions
OpenAI ResponsesPOST /v1/responses
Anthropic MessagesPOST /v1/messages

米国リージョンのモデルは独立したモデル ID のセットで、すべて -us で終わります。どのモデルも 3 つのプロトコルすべてに対応し、同じキーと同じモデル ID で使えます。クライアントが話すプロトコルを選んでください。

curl https://api.hop-base.com/v1/chat/completions \
  -H "Authorization: Bearer sk-your-key" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4.1-flash-us",
    "messages": [{ "role": "user", "content": "今四半期のリスクを 5 つの箇条書きで要約してください。" }]
  }'

モデル

モデル IDコンテキストウィンドウ最大出力トークン画像入力
deepseek-v4.1-flash-us1M393,216対応
deepseek-v4-pro-us1M393,216非対応
deepseek-v4-flash-us1M393,216非対応
glm-5.3-us1M131,072非対応
glm-5.2-us1M131,072非対応

DeepSeek のモデルは「DeepSeek 米国リージョン」プラン、GLM のモデルは「GLM 米国リージョン」プランに属します。コンソールの「APIキー」でプランをキーに追加してください。プランを含まないキーで呼び出すと 404 が返ります。キー作成ダイアログでは、両プランとも「米国リージョン」の分類に表示されます。

deepseek-v4-pro-us は 2026-08-13 リリース版、deepseek-v4-flash-us は 2026-07-31 リリース版です。画像入力に対応しないモデルには画像が見えません。リクエストは成功し、モデルは画像が添付されていないと回答します。

これらの ID は DeepSeek と GLM-5.3 のページにあるモデルとは別物で、上限、料金、プロトコル対応が異なります。-us モデルはこのページに従ってください。

プロトコルの選び方

クライアントプロトコルエンドポイント
OpenAI SDK、Cherry Studio、Cursor、DifyOpenAI Chat Completions/v1/chat/completions
Codex CLIOpenAI Responses/v1/responses
Claude Code、Anthropic SDKAnthropic Messages/v1/messages

認証は Authorization: Bearer sk-your-key です。/v1/messages では x-api-key ヘッダーも使えます。どのレスポンスでも model フィールドはリクエストした ID をそのまま返します。

Claude Code

Claude Code の接続先を HopBase にし、-us モデルを選びます。Claude Code はこれらの ID を知らないため、実際のコンテキストウィンドウも指定してください。指定しないと 200K トークンで会話を圧縮します。

export ANTHROPIC_BASE_URL="https://api.hop-base.com"
export ANTHROPIC_AUTH_TOKEN="sk-your-key"
export ANTHROPIC_MODEL="deepseek-v4.1-flash-us"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="deepseek-v4-flash-us"
export CLAUDE_CODE_MAX_CONTEXT_TOKENS=1000000
claude

ANTHROPIC_DEFAULT_HAIKU_MODEL は、Claude Code がタイトル生成などのバックグラウンド処理に使うモデルです。ワンクリック設定と settings.json での書き方は Claude Code を参照してください。

Codex CLI

~/.codex/config.toml にプロバイダーを追加し、wire_api を responses にします。

model = "deepseek-v4.1-flash-us"
model_provider = "hopbase"

[model_providers.hopbase]
name = "HopBase"
base_url = "https://api.hop-base.com/v1"
env_key = "HOPBASE_API_KEY"
wire_api = "responses"

次に環境変数 HOPBASE_API_KEY を設定して codex を実行します。その他のオプションは Codex CLI にあります。

思考とツール呼び出し

5 つのモデルはすべて、デフォルトで思考します。思考内容は Chat Completions では reasoning_content、Anthropic Messages では thinking ブロック、Responses では推論アイテムで返ります。出力トークン数には思考分が含まれています。

  • glm-5.3-us は常に思考します。思考をオフにすると 400 が返ります。
  • Anthropic Messages では、GLM モデルの output_config.effort は low、high、max のいずれかに対応付けられます。medium は high、xhigh は max として扱われます。DeepSeek にはそのまま渡ります。
  • 関数呼び出しは一通り使えます。単発の呼び出し、並列呼び出し、後続ターンでのツール結果の返送に対応します。
  • GLM モデルはツールの強制指定(ツール名の指定、required、any)を無視し、テキストで回答することがあります。DeepSeek モデルは指定どおりに呼び出します。
400 The value of the enable_thinking parameter is restricted to True.

キャッシュと課金

プレフィックスキャッシュは自動で効き、設定は不要です。キャッシュ命中は usage.prompt_tokens_details.cached_tokens(Chat Completions)、usage.input_tokens_details.cached_tokens(Responses)、usage.cache_read_input_tokens(Anthropic Messages)に表示されます。

Anthropic のリクエストに含まれる cache_control のブレークポイントは送信前に取り除かれるため、明示的キャッシュは使えません。自動キャッシュは通常どおり効きます。2026-10-02 の実測では、Claude Code の 2 ターン目以降はプロンプトの 94%–99% がキャッシュから読み込まれました。

料金は米国リージョンの公式価格が基準で、ほかの DeepSeek・GLM のページとは異なります。お使いのキーに適用されるレートは、ログイン後のモデルカタログをご確認ください。

  • 3 つの DeepSeek モデルは、北京時間(UTC+8)で毎日ピークとオフピークに分けて課金されます。ピークは週末を含む毎日 08:00–22:00 です。
  • オフピークでは、入力・キャッシュ入力・出力の単価がすべて半額になります。
  • 1 回のリクエストは完了した時点で課金され、単価は 1 つだけです。
  • GLM モデルにはピークとオフピークの区別はありません。

Anthropic Messages で突き合わせるときは、input_tokens はキャッシュ命中分を含まず、利用量レコードの「入力トークン」に対応します。cache_read_input_tokens は「キャッシュ入力トークン」に対応します。

上限とエラー

ケース結果
GLM の max_tokens が 131,072 を超える400
DeepSeek の max_tokens が 393,216 を超える拒否されない
DeepSeek の n が 1 より大きい、または logprobs を指定400
GLM の temperature が 2.0 以上400
一時的な容量不足429
400 Range of max_tokens should be [1, 131072]
400 Invalid n value (currently only n = 1 is supported)
400 Temperature should be in [0.0, 2.0)
429 Upstream accounts are currently rate limited, please retry later

Anthropic Messages では、GLM の max_tokens エラーは Range of max_completion_tokens should be [1, 131072] です。429 は課金されません。指数バックオフで再試行してください。突発的な負荷のあと、モデルが最大 1 分間使えなくなることがあります。

次のステップ