GLM-5.3 Flash

通过 OpenAI Chat Completions 兼容协议接入 GLM-5.3 Flash,含流式用量、工具调用与思考过程。

GLM-5.3 Flash 走 HopBase 的 OpenAI Chat Completions 兼容协议。接入时统一使用 https://api.hop-base.com/v1,模型名填写 glm-5.3-flash

GLM-5.3 Flash 由智谱在 2026-08-26 发布并开源,是 GLM-5 系列首个原生多模态成员:320B 总参、每 token 激活 18B 的 MoE 模型,1M 上下文,最大输出 128K。

模型与规格

项目说明
模型 IDglm-5.3-flash
架构MoE,320B 总参,每 token 激活 18B
注意力混合稀疏 + 线性注意力:相对 GLM-5.3 注意力计算减少 3.01 倍、KV 缓存减少 4.44 倍
上下文1M token
最大输出128K token
输入模态文本、图像、视频、文件
输出文本
思考始终开启,思考过程走 reasoning_content 返回

端点与 Base URL

字段填写值
API 地址 / Base URLhttps://api.hop-base.com/v1
端点POST /v1/chat/completions
API Keysk-你的密钥
模型glm-5.3-flash
API 格式(仅 CC Switch 等支持路由的客户端需要)OpenAI Chat Completions(需开启路由)

分组与计费

  • glm-5.3-flash「GLM 5.3 Flash 专线」分组在售。在控制台「API Key」新建密钥时,分组选它;只有绑定该分组的密钥才能调到这个模型。
  • 一把 Key 绑定一个分组:绑定在其他分组的 Key 调用 glm-5.3-flash 会收到明确的 404 提示——新建一把绑定本分组的 Key,或在控制台把现有 Key 改绑过来。
  • 计费以智谱该模型的官方牌价为基准,公开价见价格页,实际结算单价以登录后的模型广场为准。
  • glm-5.3 仍在原有分组,不受影响,详见 GLM-5.3

推荐参数

下面是智谱对该模型公布的推荐取值:

参数推荐值说明
temperature1
top_p0.95
reasoning_effortmax思考模式只支持开启,无法关闭
stream_options.include_usagetrue流式下要拿到 usage 必须带上
tool_streamtrue请求带 tools 时,建议与流式一起开

curl

curl https://api.hop-base.com/v1/chat/completions \
  -H "Authorization: Bearer sk-你的密钥" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "temperature": 1,
    "top_p": 0.95,
    "reasoning_effort": "max",
    "messages": [{"role": "user", "content": "你好,介绍一下你自己"}]
  }'

流式与用量

"stream": true 即可流式返回。想拿到 Token 计数,再加上 stream_options.include_usage,最后一个分片会带 usage 对象。请求同时带 tools 时,建议再开 tool_stream: true,让工具调用参数逐步流出,而不是最后一次性给出。

curl https://api.hop-base.com/v1/chat/completions \
  -H "Authorization: Bearer sk-你的密钥" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "stream": true,
    "stream_options": {"include_usage": true},
    "tool_stream": true,
    "messages": [{"role": "user", "content": "写一首关于延迟的俳句"}]
  }'

工具调用

函数调用走标准的 OpenAI 字段:请求里传 tools,从返回的 choices[].message.tool_calls 里取出调用,执行后把结果作为 tool 消息发回。

curl https://api.hop-base.com/v1/chat/completions \
  -H "Authorization: Bearer sk-你的密钥" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [{"role": "user", "content": "东京现在天气怎么样?"}],
    "tools": [{
      "type": "function",
      "function": {
        "name": "get_weather",
        "description": "查询某个城市的当前天气",
        "parameters": {
          "type": "object",
          "properties": {"city": {"type": "string"}},
          "required": ["city"]
        }
      }
    }]
  }'

思考过程

该模型始终思考,没有关闭开关。思考过程走 reasoning_content 返回,正式回答仍在 content;流式下对应 delta.reasoning_content。请把两者分开渲染或直接丢弃思考部分,不要拼接进答案。max_tokens 要按「回答 + 思考」一起估算。

OpenAI SDK / Python

from openai import OpenAI

client = OpenAI(
    base_url="https://api.hop-base.com/v1",
    api_key="sk-你的密钥",
)

resp = client.chat.completions.create(
    model="glm-5.3-flash",
    temperature=1,
    top_p=0.95,
    reasoning_effort="max",
    messages=[{"role": "user", "content": "解释一下 GLM-5.3 Flash 的适用场景"}],
)
print(resp.choices[0].message.content)
print(resp.usage)

常见问题

  • 调用 glm-5.3-flash 返回 404 模型不存在。密钥没有绑定「GLM 5.3 Flash 专线」分组,请新建一把该分组的密钥,或在控制台改绑现有密钥。
  • 流式没有 usage请加上 "stream_options": {"include_usage": true},否则最后一个分片不带 Token 计数。
  • 思考关不掉。该模型只支持开启思考,请用 reasoning_effort 调节深度,不要尝试关闭。

本页目录