米国リージョン:DeepSeek と GLM
OpenAI Chat Completions、OpenAI Responses、Anthropic Messages のいずれかで米国リージョンの DeepSeek と GLM を呼び出します。
| 項目 | 値 |
|---|---|
| Base URL | https://api.hop-base.com/v1 |
| OpenAI Chat Completions | POST /v1/chat/completions |
| OpenAI Responses | POST /v1/responses |
| Anthropic Messages | POST /v1/messages |
米国リージョンのモデルは独立したモデル ID のセットで、すべて -us で終わります。どのモデルも 3 つのプロトコルすべてに対応し、同じキーと同じモデル ID で使えます。クライアントが話すプロトコルを選んでください。
curl https://api.hop-base.com/v1/chat/completions \
-H "Authorization: Bearer sk-your-key" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4.1-flash-us",
"messages": [{ "role": "user", "content": "今四半期のリスクを 5 つの箇条書きで要約してください。" }]
}'モデル
| モデル ID | コンテキストウィンドウ | 最大出力トークン | 画像入力 |
|---|---|---|---|
deepseek-v4.1-flash-us | 1M | 393,216 | 対応 |
deepseek-v4-pro-us | 1M | 393,216 | 非対応 |
deepseek-v4-flash-us | 1M | 393,216 | 非対応 |
glm-5.3-us | 1M | 131,072 | 非対応 |
glm-5.2-us | 1M | 131,072 | 非対応 |
DeepSeek のモデルは「DeepSeek 米国リージョン」プラン、GLM のモデルは「GLM 米国リージョン」プランに属します。コンソールの「APIキー」でプランをキーに追加してください。プランを含まないキーで呼び出すと 404 が返ります。キー作成ダイアログでは、両プランとも「米国リージョン」の分類に表示されます。
deepseek-v4-pro-us は 2026-08-13 リリース版、deepseek-v4-flash-us は 2026-07-31 リリース版です。画像入力に対応しないモデルには画像が見えません。リクエストは成功し、モデルは画像が添付されていないと回答します。
これらの ID は DeepSeek と GLM-5.3 のページにあるモデルとは別物で、上限、料金、プロトコル対応が異なります。-us モデルはこのページに従ってください。
プロトコルの選び方
| クライアント | プロトコル | エンドポイント |
|---|---|---|
| OpenAI SDK、Cherry Studio、Cursor、Dify | OpenAI Chat Completions | /v1/chat/completions |
| Codex CLI | OpenAI Responses | /v1/responses |
| Claude Code、Anthropic SDK | Anthropic Messages | /v1/messages |
認証は Authorization: Bearer sk-your-key です。/v1/messages では x-api-key ヘッダーも使えます。どのレスポンスでも model フィールドはリクエストした ID をそのまま返します。
Claude Code
Claude Code の接続先を HopBase にし、-us モデルを選びます。Claude Code はこれらの ID を知らないため、実際のコンテキストウィンドウも指定してください。指定しないと 200K トークンで会話を圧縮します。
export ANTHROPIC_BASE_URL="https://api.hop-base.com"
export ANTHROPIC_AUTH_TOKEN="sk-your-key"
export ANTHROPIC_MODEL="deepseek-v4.1-flash-us"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="deepseek-v4-flash-us"
export CLAUDE_CODE_MAX_CONTEXT_TOKENS=1000000
claudeANTHROPIC_DEFAULT_HAIKU_MODEL は、Claude Code がタイトル生成などのバックグラウンド処理に使うモデルです。ワンクリック設定と settings.json での書き方は Claude Code を参照してください。
Codex CLI
~/.codex/config.toml にプロバイダーを追加し、wire_api を responses にします。
model = "deepseek-v4.1-flash-us"
model_provider = "hopbase"
[model_providers.hopbase]
name = "HopBase"
base_url = "https://api.hop-base.com/v1"
env_key = "HOPBASE_API_KEY"
wire_api = "responses"次に環境変数 HOPBASE_API_KEY を設定して codex を実行します。その他のオプションは Codex CLI にあります。
思考とツール呼び出し
5 つのモデルはすべて、デフォルトで思考します。思考内容は Chat Completions では reasoning_content、Anthropic Messages では thinking ブロック、Responses では推論アイテムで返ります。出力トークン数には思考分が含まれています。
glm-5.3-usは常に思考します。思考をオフにすると 400 が返ります。- Anthropic Messages では、GLM モデルの
output_config.effortはlow、high、maxのいずれかに対応付けられます。mediumはhigh、xhighはmaxとして扱われます。DeepSeek にはそのまま渡ります。 - 関数呼び出しは一通り使えます。単発の呼び出し、並列呼び出し、後続ターンでのツール結果の返送に対応します。
- GLM モデルはツールの強制指定(ツール名の指定、
required、any)を無視し、テキストで回答することがあります。DeepSeek モデルは指定どおりに呼び出します。
400 The value of the enable_thinking parameter is restricted to True.キャッシュと課金
プレフィックスキャッシュは自動で効き、設定は不要です。キャッシュ命中は usage.prompt_tokens_details.cached_tokens(Chat Completions)、usage.input_tokens_details.cached_tokens(Responses)、usage.cache_read_input_tokens(Anthropic Messages)に表示されます。
Anthropic のリクエストに含まれる cache_control のブレークポイントは送信前に取り除かれるため、明示的キャッシュは使えません。自動キャッシュは通常どおり効きます。2026-10-02 の実測では、Claude Code の 2 ターン目以降はプロンプトの 94%–99% がキャッシュから読み込まれました。
料金は米国リージョンの公式価格が基準で、ほかの DeepSeek・GLM のページとは異なります。お使いのキーに適用されるレートは、ログイン後のモデルカタログをご確認ください。
- 3 つの DeepSeek モデルは、北京時間(UTC+8)で毎日ピークとオフピークに分けて課金されます。ピークは週末を含む毎日 08:00–22:00 です。
- オフピークでは、入力・キャッシュ入力・出力の単価がすべて半額になります。
- 1 回のリクエストは完了した時点で課金され、単価は 1 つだけです。
- GLM モデルにはピークとオフピークの区別はありません。
Anthropic Messages で突き合わせるときは、input_tokens はキャッシュ命中分を含まず、利用量レコードの「入力トークン」に対応します。cache_read_input_tokens は「キャッシュ入力トークン」に対応します。
上限とエラー
| ケース | 結果 |
|---|---|
GLM の max_tokens が 131,072 を超える | 400 |
DeepSeek の max_tokens が 393,216 を超える | 拒否されない |
DeepSeek の n が 1 より大きい、または logprobs を指定 | 400 |
GLM の temperature が 2.0 以上 | 400 |
| 一時的な容量不足 | 429 |
400 Range of max_tokens should be [1, 131072]
400 Invalid n value (currently only n = 1 is supported)
400 Temperature should be in [0.0, 2.0)
429 Upstream accounts are currently rate limited, please retry laterAnthropic Messages では、GLM の max_tokens エラーは Range of max_completion_tokens should be [1, 131072] です。429 は課金されません。指数バックオフで再試行してください。突発的な負荷のあと、モデルが最大 1 分間使えなくなることがあります。
次のステップ
- Claude Code と Codex CLI:クライアントの設定全般
- Anthropic SDK と OpenAI SDK:プロトコルごとのリクエストの書き方
- エラーコードと再試行
- 同時実行数、タイムアウト、課金