Kimi K3

通过 OpenAI Chat Completions 兼容协议接入 Kimi K3。

Kimi K3 走 HopBase 的 OpenAI Chat Completions 兼容协议。接入时统一使用 https://api.hop-base.com/v1,模型名填写 kimi-k3

Kimi K3 是月之暗面(Moonshot AI)最新的旗舰推理模型:1M 上下文(1,048,576 tokens),单次最大输出 131,072 tokens,经自部署专线接入。

分组与计费

  • 在控制台「API Key」新建密钥时,分组选择 Kimi K3 自部署专线,该 Key 即可调用 kimi-k3
  • 官方牌价为每百万 token 输入 $3、输出 $15,缓存命中的输入读取为 $0.30;实际结算价以登录后模型广场为准。
  • 一把 Key 绑定一个分组:绑定在其他分组的 Key 调用 kimi-k3 会收到明确的 404 提示——新建一把绑定本分组的 Key,或在控制台把现有 Key 改绑过来。

客户端字段

字段填写值
API 地址 / Base URLhttps://api.hop-base.com/v1
API Keysk-你的密钥
模型kimi-k3
API 格式OpenAI Chat Completions
上下文窗口1,048,576 tokens
单次最大输出131,072 tokens

Kimi K3 只提供 POST /v1/chat/completions。上游没有实现 /v1/responses(请求会返回 not implemented),因此只会说 OpenAI Responses 协议或 Anthropic Messages 协议的客户端无法调用该模型。

接不了的客户端

Codex CLI 和 Claude Code 目前都用不了 Kimi K3。 Codex CLI 需要 /v1/responses,Claude Code 走 Anthropic Messages 协议,这两条路对该模型都不通。可用的接入方式是 OpenAI SDK、curl,以及任何走 chat.completions 的客户端(LobeChat、Dify、Cherry Studio 等)。

推理输出与前缀缓存

  • Kimi K3 是推理模型,响应里会带 reasoning_content 字段承载思考过程;思考 token 计入输出计费
  • max_tokens 建议设到 1024 以上。预算给得太小时,输出可能被思考过程占满,最终只有思考没有正文。
  • 前缀缓存实测有效,按 256 token 的块粒度匹配。多轮 agent 会话在稳态下命中率约 88%–96%,把系统提示、工具定义等固定内容放在消息列表最前面即可稳定复用缓存。

OpenAI SDK / Python

from openai import OpenAI

client = OpenAI(
    base_url="https://api.hop-base.com/v1",
    api_key="sk-你的密钥",
)

resp = client.chat.completions.create(
    model="kimi-k3",
    max_tokens=4096,
    messages=[{"role": "user", "content": "解释一下 Kimi K3 的适用场景"}],
)
message = resp.choices[0].message
print(getattr(message, "reasoning_content", None))
print(message.content)

curl

curl https://api.hop-base.com/v1/chat/completions \
  -H "Authorization: Bearer sk-你的密钥" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kimi-k3",
    "max_tokens": 4096,
    "messages": [{"role": "user", "content": "你好,介绍一下你自己"}]
  }'

本页目录