GLM-5.3 Flash

通過 OpenAI Chat Completions 兼容協議接入 GLM-5.3 Flash,含流式用量、工具調用與思考過程。

GLM-5.3 Flash 走 HopBase 的 OpenAI Chat Completions 兼容協議。接入時統一使用 https://api.hop-base.com/v1,模型名填寫 glm-5.3-flash

GLM-5.3 Flash 由智譜在 2026-08-26 發布並開源,是 GLM-5 系列首個原生多模態成員:320B 總參、每 token 激活 18B 的 MoE 模型,1M 上下文,最大輸出 128K。

模型與規格

項目說明
模型 IDglm-5.3-flash
架構MoE,320B 總參,每 token 激活 18B
注意力混合稀疏 + 線性注意力:相對 GLM-5.3 注意力計算減少 3.01 倍、KV 快取減少 4.44 倍
上下文1M token
最大輸出128K token
輸入模態文本、圖像、視頻、文件
輸出文本
思考始終開啟,思考過程走 reasoning_content 返回

端點與 Base URL

字段填寫值
API 地址 / Base URLhttps://api.hop-base.com/v1
端點POST /v1/chat/completions
API Keysk-你的密鑰
模型glm-5.3-flash
API 格式(僅 CC Switch 等支援路由的客戶端需要)OpenAI Chat Completions(需開啟路由)

分組與計費

  • glm-5.3-flash「GLM 5.3 Flash 專線」分組在售。在控制台「API Key」新建密鑰時,分組選它;只有綁定該分組的密鑰才能調到這個模型。
  • 一把 Key 綁定一個分組:綁定在其他分組的 Key 調用 glm-5.3-flash 會收到明確的 404 提示——新建一把綁定本分組的 Key,或在控制台把現有 Key 改綁過來。
  • 計費以智譜該模型的官方牌價為基準,公開價見價格頁,實際結算單價以登入後的模型廣場為準。
  • glm-5.3 仍在原有分組,不受影響,詳見 GLM-5.3

推薦參數

下面是智譜對該模型公布的推薦取值:

參數推薦值說明
temperature1
top_p0.95
reasoning_effortmax思考模式只支援開啟,無法關閉
stream_options.include_usagetrue流式下要拿到 usage 必須帶上
tool_streamtrue請求帶 tools 時,建議與流式一起開

curl

curl https://api.hop-base.com/v1/chat/completions \
  -H "Authorization: Bearer sk-你的密鑰" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "temperature": 1,
    "top_p": 0.95,
    "reasoning_effort": "max",
    "messages": [{"role": "user", "content": "你好,介紹一下你自己"}]
  }'

流式與用量

"stream": true 即可流式返回。想拿到 Token 計數,再加上 stream_options.include_usage,最後一個分片會帶 usage 對象。請求同時帶 tools 時,建議再開 tool_stream: true,讓工具調用參數逐步流出,而不是最後一次性給出。

curl https://api.hop-base.com/v1/chat/completions \
  -H "Authorization: Bearer sk-你的密鑰" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "stream": true,
    "stream_options": {"include_usage": true},
    "tool_stream": true,
    "messages": [{"role": "user", "content": "寫一首關於延遲的俳句"}]
  }'

工具調用

函數調用走標準的 OpenAI 字段:請求裡傳 tools,從返回的 choices[].message.tool_calls 裡取出調用,執行後把結果作為 tool 消息發回。

curl https://api.hop-base.com/v1/chat/completions \
  -H "Authorization: Bearer sk-你的密鑰" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [{"role": "user", "content": "東京現在天氣怎麼樣?"}],
    "tools": [{
      "type": "function",
      "function": {
        "name": "get_weather",
        "description": "查詢某個城市的當前天氣",
        "parameters": {
          "type": "object",
          "properties": {"city": {"type": "string"}},
          "required": ["city"]
        }
      }
    }]
  }'

思考過程

該模型始終思考,沒有關閉開關。思考過程走 reasoning_content 返回,正式回答仍在 content;流式下對應 delta.reasoning_content。請把兩者分開渲染或直接丟棄思考部分,不要拼接進答案。max_tokens 要按「回答 + 思考」一起估算。

OpenAI SDK / Python

from openai import OpenAI

client = OpenAI(
    base_url="https://api.hop-base.com/v1",
    api_key="sk-你的密鑰",
)

resp = client.chat.completions.create(
    model="glm-5.3-flash",
    temperature=1,
    top_p=0.95,
    reasoning_effort="max",
    messages=[{"role": "user", "content": "解釋一下 GLM-5.3 Flash 的適用場景"}],
)
print(resp.choices[0].message.content)
print(resp.usage)

常見問題

  • 調用 glm-5.3-flash 返回 404 模型不存在。密鑰沒有綁定「GLM 5.3 Flash 專線」分組,請新建一把該分組的密鑰,或在控制台改綁現有密鑰。
  • 流式沒有 usage請加上 "stream_options": {"include_usage": true},否則最後一個分片不帶 Token 計數。
  • 思考關不掉。該模型只支援開啟思考,請用 reasoning_effort 調節深度,不要嘗試關閉。

本頁目錄