GLM-5.3 Flash
通过 OpenAI Chat Completions 兼容协议接入 GLM-5.3 Flash,含流式用量、工具调用与思考过程。
GLM-5.3 Flash 走 HopBase 的 OpenAI Chat Completions 兼容协议。接入时统一使用 https://api.hop-base.com/v1,模型名填写 glm-5.3-flash。
GLM-5.3 Flash 由智谱在 2026-08-26 发布并开源,是 GLM-5 系列首个原生多模态成员:320B 总参、每 token 激活 18B 的 MoE 模型,1M 上下文,最大输出 128K。
模型与规格
| 项目 | 说明 |
|---|---|
| 模型 ID | glm-5.3-flash |
| 架构 | MoE,320B 总参,每 token 激活 18B |
| 注意力 | 混合稀疏 + 线性注意力:相对 GLM-5.3 注意力计算减少 3.01 倍、KV 缓存减少 4.44 倍 |
| 上下文 | 1M token |
| 最大输出 | 128K token |
| 输入模态 | 文本、图像、视频、文件 |
| 输出 | 文本 |
| 思考 | 始终开启,思考过程走 reasoning_content 返回 |
端点与 Base URL
| 字段 | 填写值 |
|---|---|
| API 地址 / Base URL | https://api.hop-base.com/v1 |
| 端点 | POST /v1/chat/completions |
| API Key | sk-你的密钥 |
| 模型 | glm-5.3-flash |
| API 格式(仅 CC Switch 等支持路由的客户端需要) | OpenAI Chat Completions(需开启路由) |
分组与计费
glm-5.3-flash在「GLM 5.3 Flash 专线」分组在售。在控制台「API Key」新建密钥时,分组选它;只有绑定该分组的密钥才能调到这个模型。- 一把 Key 绑定一个分组:绑定在其他分组的 Key 调用
glm-5.3-flash会收到明确的 404 提示——新建一把绑定本分组的 Key,或在控制台把现有 Key 改绑过来。 - 计费以智谱该模型的官方牌价为基准,公开价见价格页,实际结算单价以登录后的模型广场为准。
glm-5.3仍在原有分组,不受影响,详见 GLM-5.3。
推荐参数
下面是智谱对该模型公布的推荐取值:
| 参数 | 推荐值 | 说明 |
|---|---|---|
temperature | 1 | |
top_p | 0.95 | |
reasoning_effort | max | 思考模式只支持开启,无法关闭 |
stream_options.include_usage | true | 流式下要拿到 usage 必须带上 |
tool_stream | true | 请求带 tools 时,建议与流式一起开 |
curl
curl https://api.hop-base.com/v1/chat/completions \
-H "Authorization: Bearer sk-你的密钥" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-flash",
"temperature": 1,
"top_p": 0.95,
"reasoning_effort": "max",
"messages": [{"role": "user", "content": "你好,介绍一下你自己"}]
}'流式与用量
传 "stream": true 即可流式返回。想拿到 Token 计数,再加上 stream_options.include_usage,最后一个分片会带 usage 对象。请求同时带 tools 时,建议再开 tool_stream: true,让工具调用参数逐步流出,而不是最后一次性给出。
curl https://api.hop-base.com/v1/chat/completions \
-H "Authorization: Bearer sk-你的密钥" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-flash",
"stream": true,
"stream_options": {"include_usage": true},
"tool_stream": true,
"messages": [{"role": "user", "content": "写一首关于延迟的俳句"}]
}'工具调用
函数调用走标准的 OpenAI 字段:请求里传 tools,从返回的 choices[].message.tool_calls 里取出调用,执行后把结果作为 tool 消息发回。
curl https://api.hop-base.com/v1/chat/completions \
-H "Authorization: Bearer sk-你的密钥" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-flash",
"messages": [{"role": "user", "content": "东京现在天气怎么样?"}],
"tools": [{
"type": "function",
"function": {
"name": "get_weather",
"description": "查询某个城市的当前天气",
"parameters": {
"type": "object",
"properties": {"city": {"type": "string"}},
"required": ["city"]
}
}
}]
}'思考过程
该模型始终思考,没有关闭开关。思考过程走 reasoning_content 返回,正式回答仍在 content;流式下对应 delta.reasoning_content。请把两者分开渲染或直接丢弃思考部分,不要拼接进答案。max_tokens 要按「回答 + 思考」一起估算。
OpenAI SDK / Python
from openai import OpenAI
client = OpenAI(
base_url="https://api.hop-base.com/v1",
api_key="sk-你的密钥",
)
resp = client.chat.completions.create(
model="glm-5.3-flash",
temperature=1,
top_p=0.95,
reasoning_effort="max",
messages=[{"role": "user", "content": "解释一下 GLM-5.3 Flash 的适用场景"}],
)
print(resp.choices[0].message.content)
print(resp.usage)常见问题
- 调用
glm-5.3-flash返回 404 模型不存在。密钥没有绑定「GLM 5.3 Flash 专线」分组,请新建一把该分组的密钥,或在控制台改绑现有密钥。 - 流式没有
usage。请加上"stream_options": {"include_usage": true},否则最后一个分片不带 Token 计数。 - 思考关不掉。该模型只支持开启思考,请用
reasoning_effort调节深度,不要尝试关闭。