GLM-5.3 Flash
通過 OpenAI Chat Completions 兼容協議接入 GLM-5.3 Flash,含流式用量、工具調用與思考過程。
GLM-5.3 Flash 走 HopBase 的 OpenAI Chat Completions 兼容協議。接入時統一使用 https://api.hop-base.com/v1,模型名填寫 glm-5.3-flash。
GLM-5.3 Flash 由智譜在 2026-08-26 發布並開源,是 GLM-5 系列首個原生多模態成員:320B 總參、每 token 激活 18B 的 MoE 模型,1M 上下文,最大輸出 128K。
模型與規格
| 項目 | 說明 |
|---|---|
| 模型 ID | glm-5.3-flash |
| 架構 | MoE,320B 總參,每 token 激活 18B |
| 注意力 | 混合稀疏 + 線性注意力:相對 GLM-5.3 注意力計算減少 3.01 倍、KV 快取減少 4.44 倍 |
| 上下文 | 1M token |
| 最大輸出 | 128K token |
| 輸入模態 | 文本、圖像、視頻、文件 |
| 輸出 | 文本 |
| 思考 | 始終開啟,思考過程走 reasoning_content 返回 |
端點與 Base URL
| 字段 | 填寫值 |
|---|---|
| API 地址 / Base URL | https://api.hop-base.com/v1 |
| 端點 | POST /v1/chat/completions |
| API Key | sk-你的密鑰 |
| 模型 | glm-5.3-flash |
| API 格式(僅 CC Switch 等支援路由的客戶端需要) | OpenAI Chat Completions(需開啟路由) |
分組與計費
glm-5.3-flash在「GLM 5.3 Flash 專線」分組在售。在控制台「API Key」新建密鑰時,分組選它;只有綁定該分組的密鑰才能調到這個模型。- 一把 Key 綁定一個分組:綁定在其他分組的 Key 調用
glm-5.3-flash會收到明確的 404 提示——新建一把綁定本分組的 Key,或在控制台把現有 Key 改綁過來。 - 計費以智譜該模型的官方牌價為基準,公開價見價格頁,實際結算單價以登入後的模型廣場為準。
glm-5.3仍在原有分組,不受影響,詳見 GLM-5.3。
推薦參數
下面是智譜對該模型公布的推薦取值:
| 參數 | 推薦值 | 說明 |
|---|---|---|
temperature | 1 | |
top_p | 0.95 | |
reasoning_effort | max | 思考模式只支援開啟,無法關閉 |
stream_options.include_usage | true | 流式下要拿到 usage 必須帶上 |
tool_stream | true | 請求帶 tools 時,建議與流式一起開 |
curl
curl https://api.hop-base.com/v1/chat/completions \
-H "Authorization: Bearer sk-你的密鑰" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-flash",
"temperature": 1,
"top_p": 0.95,
"reasoning_effort": "max",
"messages": [{"role": "user", "content": "你好,介紹一下你自己"}]
}'流式與用量
傳 "stream": true 即可流式返回。想拿到 Token 計數,再加上 stream_options.include_usage,最後一個分片會帶 usage 對象。請求同時帶 tools 時,建議再開 tool_stream: true,讓工具調用參數逐步流出,而不是最後一次性給出。
curl https://api.hop-base.com/v1/chat/completions \
-H "Authorization: Bearer sk-你的密鑰" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-flash",
"stream": true,
"stream_options": {"include_usage": true},
"tool_stream": true,
"messages": [{"role": "user", "content": "寫一首關於延遲的俳句"}]
}'工具調用
函數調用走標準的 OpenAI 字段:請求裡傳 tools,從返回的 choices[].message.tool_calls 裡取出調用,執行後把結果作為 tool 消息發回。
curl https://api.hop-base.com/v1/chat/completions \
-H "Authorization: Bearer sk-你的密鑰" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-flash",
"messages": [{"role": "user", "content": "東京現在天氣怎麼樣?"}],
"tools": [{
"type": "function",
"function": {
"name": "get_weather",
"description": "查詢某個城市的當前天氣",
"parameters": {
"type": "object",
"properties": {"city": {"type": "string"}},
"required": ["city"]
}
}
}]
}'思考過程
該模型始終思考,沒有關閉開關。思考過程走 reasoning_content 返回,正式回答仍在 content;流式下對應 delta.reasoning_content。請把兩者分開渲染或直接丟棄思考部分,不要拼接進答案。max_tokens 要按「回答 + 思考」一起估算。
OpenAI SDK / Python
from openai import OpenAI
client = OpenAI(
base_url="https://api.hop-base.com/v1",
api_key="sk-你的密鑰",
)
resp = client.chat.completions.create(
model="glm-5.3-flash",
temperature=1,
top_p=0.95,
reasoning_effort="max",
messages=[{"role": "user", "content": "解釋一下 GLM-5.3 Flash 的適用場景"}],
)
print(resp.choices[0].message.content)
print(resp.usage)常見問題
- 調用
glm-5.3-flash返回 404 模型不存在。密鑰沒有綁定「GLM 5.3 Flash 專線」分組,請新建一把該分組的密鑰,或在控制台改綁現有密鑰。 - 流式沒有
usage。請加上"stream_options": {"include_usage": true},否則最後一個分片不帶 Token 計數。 - 思考關不掉。該模型只支援開啟思考,請用
reasoning_effort調節深度,不要嘗試關閉。