Kimi K3
通過 OpenAI Chat Completions 兼容協議接入 Kimi K3。
Kimi K3 走 HopBase 的 OpenAI Chat Completions 兼容協議。接入時統一使用 https://api.hop-base.com/v1,模型名填寫 kimi-k3。
Kimi K3 是月之暗面(Moonshot AI)最新的旗艦推理模型:1M 上下文(1,048,576 tokens),單次最大輸出 131,072 tokens,經自部署專線接入。
分組與計費
- 在控制檯「API Key」新建密鑰時,分組選擇 Kimi K3 自部署專線,該 Key 即可調用
kimi-k3。 - 官方牌價為每百萬 token 輸入 $3、輸出 $15,緩存命中的輸入讀取為 $0.30;實際結算價以登錄後模型廣場為準。
- 一把 Key 綁定一個分組:綁定在其他分組的 Key 調用
kimi-k3會收到明確的 404 提示——新建一把綁定本分組的 Key,或在控制檯把現有 Key 改綁過來。
客戶端字段
| 字段 | 填寫值 |
|---|---|
| API 地址 / Base URL | https://api.hop-base.com/v1 |
| API Key | sk-你的密鑰 |
| 模型 | kimi-k3 |
| API 格式 | OpenAI Chat Completions |
| 上下文窗口 | 1,048,576 tokens |
| 單次最大輸出 | 131,072 tokens |
Kimi K3 只提供 POST /v1/chat/completions。上游沒有實現 /v1/responses(請求會返回 not implemented),因此只會說 OpenAI Responses 協議或 Anthropic Messages 協議的客戶端無法調用該模型。
接不了的客戶端
Codex CLI 和 Claude Code 目前都用不了 Kimi K3。 Codex CLI 需要 /v1/responses,Claude Code 走 Anthropic Messages 協議,這兩條路對該模型都不通。可用的接入方式是 OpenAI SDK、curl,以及任何走 chat.completions 的客戶端(LobeChat、Dify、Cherry Studio 等)。
推理輸出與前綴緩存
- Kimi K3 是推理模型,響應裡會帶
reasoning_content字段承載思考過程;思考 token 計入輸出計費。 max_tokens建議設到 1024 以上。預算給得太小時,輸出可能被思考過程佔滿,最終只有思考沒有正文。- 前綴緩存實測有效,按 256 token 的塊粒度匹配。多輪 agent 會話在穩態下命中率約 88%–96%,把系統提示、工具定義等固定內容放在消息列表最前面即可穩定複用緩存。
OpenAI SDK / Python
from openai import OpenAI
client = OpenAI(
base_url="https://api.hop-base.com/v1",
api_key="sk-你的密鑰",
)
resp = client.chat.completions.create(
model="kimi-k3",
max_tokens=4096,
messages=[{"role": "user", "content": "解釋一下 Kimi K3 的適用場景"}],
)
message = resp.choices[0].message
print(getattr(message, "reasoning_content", None))
print(message.content)curl
curl https://api.hop-base.com/v1/chat/completions \
-H "Authorization: Bearer sk-你的密鑰" \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k3",
"max_tokens": 4096,
"messages": [{"role": "user", "content": "你好,介紹一下你自己"}]
}'