Kimi K3
通过 OpenAI Chat Completions 兼容协议接入 Kimi K3。
Kimi K3 走 HopBase 的 OpenAI Chat Completions 兼容协议。接入时统一使用 https://api.hop-base.com/v1,模型名填写 kimi-k3。
Kimi K3 是月之暗面(Moonshot AI)最新的旗舰推理模型:1M 上下文(1,048,576 tokens),单次最大输出 131,072 tokens,经自部署专线接入。
分组与计费
- 在控制台「API Key」新建密钥时,分组选择 Kimi K3 自部署专线,该 Key 即可调用
kimi-k3。 - 官方牌价为每百万 token 输入 $3、输出 $15,缓存命中的输入读取为 $0.30;实际结算价以登录后模型广场为准。
- 一把 Key 绑定一个分组:绑定在其他分组的 Key 调用
kimi-k3会收到明确的 404 提示——新建一把绑定本分组的 Key,或在控制台把现有 Key 改绑过来。
客户端字段
| 字段 | 填写值 |
|---|---|
| API 地址 / Base URL | https://api.hop-base.com/v1 |
| API Key | sk-你的密钥 |
| 模型 | kimi-k3 |
| API 格式 | OpenAI Chat Completions |
| 上下文窗口 | 1,048,576 tokens |
| 单次最大输出 | 131,072 tokens |
Kimi K3 只提供 POST /v1/chat/completions。上游没有实现 /v1/responses(请求会返回 not implemented),因此只会说 OpenAI Responses 协议或 Anthropic Messages 协议的客户端无法调用该模型。
接不了的客户端
Codex CLI 和 Claude Code 目前都用不了 Kimi K3。 Codex CLI 需要 /v1/responses,Claude Code 走 Anthropic Messages 协议,这两条路对该模型都不通。可用的接入方式是 OpenAI SDK、curl,以及任何走 chat.completions 的客户端(LobeChat、Dify、Cherry Studio 等)。
推理输出与前缀缓存
- Kimi K3 是推理模型,响应里会带
reasoning_content字段承载思考过程;思考 token 计入输出计费。 max_tokens建议设到 1024 以上。预算给得太小时,输出可能被思考过程占满,最终只有思考没有正文。- 前缀缓存实测有效,按 256 token 的块粒度匹配。多轮 agent 会话在稳态下命中率约 88%–96%,把系统提示、工具定义等固定内容放在消息列表最前面即可稳定复用缓存。
OpenAI SDK / Python
from openai import OpenAI
client = OpenAI(
base_url="https://api.hop-base.com/v1",
api_key="sk-你的密钥",
)
resp = client.chat.completions.create(
model="kimi-k3",
max_tokens=4096,
messages=[{"role": "user", "content": "解释一下 Kimi K3 的适用场景"}],
)
message = resp.choices[0].message
print(getattr(message, "reasoning_content", None))
print(message.content)curl
curl https://api.hop-base.com/v1/chat/completions \
-H "Authorization: Bearer sk-你的密钥" \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k3",
"max_tokens": 4096,
"messages": [{"role": "user", "content": "你好,介绍一下你自己"}]
}'