Skip to content
上新MiniMax Speech 2.8 语音合成已上线:OpenAI 兼容 /v1/audio/speech 与原生 t2a_v2 双入口,官方牌价接入(HD $100 / Turbo $60 每百万字符)查看可用模型
HopBase
← 返回博客

GLM-5.3-Flash API 接入:官方牌价 ¥0.80 / ¥2.80,1M 上下文 | HopBase

GLM-5.3-Flash API 接入:官方牌价 ¥0.80 / ¥2.80,1M 上下文 | HopBase

智谱 GLM-5.3-Flash(模型 ID glm-5.3-flash)已经上线 HopBase,走 OpenAI 兼容的 POST /v1/chat/completions,任何 OpenAI SDK 换个模型名就能调。它是 320B 总参、每 token 激活 18B 的 MoE 模型,也是 GLM-5 系列首个原生多模态成员:输入支持文本、图像、视频与文件,输出文本;上下文 1M,单次最多 128K 输出,思考过程在 reasoning_content 返回。计费按智谱官方牌价:每百万 token 输入 ¥0.80、缓存命中 ¥0.23、输出 ¥2.80,是 GLM-5.3 官方定价的十分之一。绑定「GLM 5.3 Flash 专线」分组的密钥即刻可用。

怎么调用

  • OpenAI 兼容单端点POST /v1/chat/completions,Base URL 为 https://api.hop-base.com/v1,SDK 零改造。
  • 模型 ID 写全glm-5.3-flash。裸名或自己缩写调不通,完整 ID 以 GET /v1/models 返回为准。
  • 分组绑定:该模型放在「GLM 5.3 Flash 专线」套餐分组,绑定该分组的密钥才调得到;GLM-5.3 的密钥不共用。
  • 思考过程单独字段:推理内容走 reasoning_content,正文在 content,两者分开,前端不必自己切分。

价格:按官方牌价接入

项目(每百万 token)GLM-5.3-Flash
输入¥0.80
缓存命中读取¥0.23
输出¥2.80

这是智谱公布的官方牌价,官方定价口径为 GLM-5.3 的十分之一。结算按「牌价 × 实际用量」,控制台按请求给出分项成本,实际单价以你所在分组为准。缓存命中读取不到输入价的三分之一,反复读同一前缀的 Agent 循环与长会话省得最多。企业用量请通过价格页联系商务报价。

规格与实测

  • 上下文与输出:1M 上下文,单次最多 128K 输出 token。
  • 原生多模态输入:文本、图像、视频、文件,输出为文本。
  • 架构:混合稀疏与线性注意力。按智谱官方数据,相对 GLM-5.3 注意力计算减少 3.01 倍、KV 缓存减少 4.44 倍,这也是它能把价格压到十分之一的底气。
  • 我方实测通过:非流式、流式(stream_options.include_usage 能正常拿到 usage)、函数调用(tool_calls 结构完整)、reasoning_content 思考过程,四项都在生产链路上跑过。

参数建议

  • 官方推荐 temperature: 1top_p: 0.95reasoning_effort: "max",不要照搬其它模型的低温度习惯。
  • 思考模式只支持开启:没有关闭思考的开关,需要短回复就用提示词和 max_tokens 控制。
  • 流式场景建议同时开 stream: truetool_stream: true;要在流式里拿 usage,记得带 stream_options: {"include_usage": true}

三分钟接入

curl https://api.hop-base.com/v1/chat/completions \
  -H "Authorization: Bearer sk-your-key" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [{"role": "user", "content": "用三句话介绍你自己"}],
    "temperature": 1,
    "top_p": 0.95,
    "stream": true,
    "stream_options": {"include_usage": true}
  }'

完整接入说明、工具调用与多模态示例见GLM-5.3-Flash 接入文档。已有密钥的用户把分组绑定到「GLM 5.3 Flash 专线」即可开始用。

常见问题

GLM-5.3-Flash 怎么调用?

走 OpenAI 兼容端点 POST https://api.hop-base.com/v1/chat/completions,模型 ID 填 glm-5.3-flash,任何 OpenAI SDK 换个模型名即可,不用改认证方式。前提是密钥绑定了「GLM 5.3 Flash 专线」分组;完整可用模型清单以 GET /v1/models 返回为准。

GLM-5.3-Flash 的价格是多少?

按智谱官方牌价接入:每百万 token 输入 ¥0.80、缓存命中读取 ¥0.23、输出 ¥2.80,官方定价口径为 GLM-5.3 的十分之一。结算按牌价乘实际用量,控制台按请求给出分项成本,实际单价以所在分组为准。企业用量可通过价格页联系商务报价。

支持多模态和工具调用吗?

支持。它是 GLM-5 系列首个原生多模态成员,输入接受文本、图像、视频与文件,输出为文本。函数调用(tools / tool_calls)在我方生产链路实测通过;流式建议同时开 tool_stream: true,思考过程在 reasoning_content 字段返回。

和 GLM-5.3 怎么选?

两者都是 1M 上下文。Flash 的官方定价是 GLM-5.3 的十分之一,日常对话、Agent 循环、长上下文批量处理这类量大的负载优先用 Flash;需要 GLM-5.3 既有效果基线的存量业务可以继续用原模型,两者是不同的套餐分组,密钥不共用,可以并行接入按实际效果切流。

最大能输出多少 token?

单次最多 128K 输出 token,上下文窗口 1M。长输出建议用流式,避免长连接被边缘超时掐断;要在流式里拿到 usage 统计,请求里带上 stream_options: {"include_usage": true}