Kimi K3

通過 OpenAI Chat Completions 兼容協議接入 Kimi K3。

Kimi K3 走 HopBase 的 OpenAI Chat Completions 兼容協議。接入時統一使用 https://api.hop-base.com/v1,模型名填寫 kimi-k3

Kimi K3 是月之暗面(Moonshot AI)最新的旗艦推理模型:1M 上下文(1,048,576 tokens),單次最大輸出 131,072 tokens,經自部署專線接入。

分組與計費

  • 在控制檯「API Key」新建密鑰時,分組選擇 Kimi K3 自部署專線,該 Key 即可調用 kimi-k3
  • 官方牌價為每百萬 token 輸入 $3、輸出 $15,緩存命中的輸入讀取為 $0.30;實際結算價以登錄後模型廣場為準。
  • 一把 Key 綁定一個分組:綁定在其他分組的 Key 調用 kimi-k3 會收到明確的 404 提示——新建一把綁定本分組的 Key,或在控制檯把現有 Key 改綁過來。

客戶端字段

字段填寫值
API 地址 / Base URLhttps://api.hop-base.com/v1
API Keysk-你的密鑰
模型kimi-k3
API 格式OpenAI Chat Completions
上下文窗口1,048,576 tokens
單次最大輸出131,072 tokens

Kimi K3 只提供 POST /v1/chat/completions。上游沒有實現 /v1/responses(請求會返回 not implemented),因此只會說 OpenAI Responses 協議或 Anthropic Messages 協議的客戶端無法調用該模型。

接不了的客戶端

Codex CLI 和 Claude Code 目前都用不了 Kimi K3。 Codex CLI 需要 /v1/responses,Claude Code 走 Anthropic Messages 協議,這兩條路對該模型都不通。可用的接入方式是 OpenAI SDK、curl,以及任何走 chat.completions 的客戶端(LobeChat、Dify、Cherry Studio 等)。

推理輸出與前綴緩存

  • Kimi K3 是推理模型,響應裡會帶 reasoning_content 字段承載思考過程;思考 token 計入輸出計費
  • max_tokens 建議設到 1024 以上。預算給得太小時,輸出可能被思考過程佔滿,最終只有思考沒有正文。
  • 前綴緩存實測有效,按 256 token 的塊粒度匹配。多輪 agent 會話在穩態下命中率約 88%–96%,把系統提示、工具定義等固定內容放在消息列表最前面即可穩定複用緩存。

OpenAI SDK / Python

from openai import OpenAI

client = OpenAI(
    base_url="https://api.hop-base.com/v1",
    api_key="sk-你的密鑰",
)

resp = client.chat.completions.create(
    model="kimi-k3",
    max_tokens=4096,
    messages=[{"role": "user", "content": "解釋一下 Kimi K3 的適用場景"}],
)
message = resp.choices[0].message
print(getattr(message, "reasoning_content", None))
print(message.content)

curl

curl https://api.hop-base.com/v1/chat/completions \
  -H "Authorization: Bearer sk-你的密鑰" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kimi-k3",
    "max_tokens": 4096,
    "messages": [{"role": "user", "content": "你好,介紹一下你自己"}]
  }'

本頁目錄