GLM-5.3 Flash
Conéctese a GLM-5.3 Flash mediante la API compatible con OpenAI Chat Completions, incluidos el uso en streaming, las llamadas a herramientas y el rastro de pensamiento.
GLM-5.3 Flash usa el protocolo de HopBase compatible con OpenAI Chat Completions. Use https://api.hop-base.com/v1 y configure el modelo como glm-5.3-flash.
GLM-5.3 Flash fue publicado y liberado como código abierto por Zhipu el 2026-08-26 y es el primer miembro nativamente multimodal de la serie GLM-5: un modelo de mezcla de expertos con 320B de parámetros totales y 18B activos por token, ventana de contexto de 1M y hasta 128K tokens de salida.
Modelo y especificaciones
| Elemento | Valor |
|---|---|
| ID del modelo | glm-5.3-flash |
| Arquitectura | MoE, 320B de parámetros totales, 18B activos por token |
| Atención | Atención híbrida dispersa más lineal: 3,01 veces menos cómputo de atención y una caché KV 4,44 veces menor que GLM-5.3 |
| Ventana de contexto | 1M tokens |
| Salida máxima | 128K tokens |
| Modalidades de entrada | Texto, imagen, video, archivo |
| Salida | Texto |
| Pensamiento | Siempre activo; el rastro se devuelve en reasoning_content |
Endpoint y Base URL
| Campo | Valor |
|---|---|
| Dirección de la API / Base URL | https://api.hop-base.com/v1 |
| Endpoint | POST /v1/chat/completions |
| Clave API | sk-su-clave |
| Modelo | glm-5.3-flash |
| Formato de API (solo CC Switch y otros clientes con enrutamiento) | OpenAI Chat Completions (requiere enrutamiento) |
Selección de grupo y facturación
glm-5.3-flashse vende en el grupo GLM 5.3 Flash 专线 (línea dedicada GLM 5.3 Flash). Al crear una clave API en API Keys en la consola, establezca el grupo de la clave en este; solo una clave vinculada a él puede llamar al modelo.- Una clave está vinculada a un grupo. Las claves vinculadas a otros grupos reciben un 404 explícito al llamar a
glm-5.3-flash— cree una nueva clave en este grupo, o vuelva a vincular una clave existente en la consola. - Las tarifas toman como base el precio oficial de lista de Zhipu para este modelo y se publican en la página de precios; su tarifa efectiva se muestra en la Plaza de modelos tras iniciar sesión.
glm-5.3mantiene sus propios grupos y no se ve afectado; consulte GLM-5.3.
Parámetros recomendados
Estos son los valores recomendados que Zhipu publica para este modelo:
| Parámetro | Recomendado | Notas |
|---|---|---|
temperature | 1 | |
top_p | 0.95 | |
reasoning_effort | max | El pensamiento siempre está activo y no se puede desactivar |
stream_options.include_usage | true | Necesario para recibir usage en el último fragmento del streaming |
tool_stream | true | Recomendado junto con el streaming cuando la solicitud incluye tools |
curl
curl https://api.hop-base.com/v1/chat/completions \
-H "Authorization: Bearer sk-su-clave" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-flash",
"temperature": 1,
"top_p": 0.95,
"reasoning_effort": "max",
"messages": [{"role": "user", "content": "Hola, preséntate"}]
}'Streaming y uso
Envíe "stream": true. Para recibir el recuento de tokens, añada stream_options.include_usage: el último fragmento incluirá entonces un objeto usage. Cuando la solicitud también incluya tools, active tool_stream: true para que los argumentos de las llamadas a herramientas lleguen de forma incremental en lugar de en un solo bloque.
curl https://api.hop-base.com/v1/chat/completions \
-H "Authorization: Bearer sk-su-clave" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-flash",
"stream": true,
"stream_options": {"include_usage": true},
"tool_stream": true,
"messages": [{"role": "user", "content": "Escribe un haiku sobre la latencia"}]
}'Llamadas a herramientas
Las llamadas a funciones funcionan con los campos estándar de OpenAI. Envíe tools, lea choices[].message.tool_calls en la respuesta, ejecute la función y devuelva el resultado como un mensaje tool.
curl https://api.hop-base.com/v1/chat/completions \
-H "Authorization: Bearer sk-su-clave" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-flash",
"messages": [{"role": "user", "content": "¿Qué tiempo hace en Tokio?"}],
"tools": [{
"type": "function",
"function": {
"name": "get_weather",
"description": "Obtiene el tiempo actual de una ciudad",
"parameters": {
"type": "object",
"properties": {"city": {"type": "string"}},
"required": ["city"]
}
}
}]
}'Rastro de pensamiento
El modelo siempre piensa; no hay un interruptor para desactivarlo. El rastro se devuelve en reasoning_content junto con la respuesta en content, y en modo streaming llega como delta.reasoning_content. Muéstrelo por separado o descártelo, pero no lo concatene con la respuesta. Dimensione max_tokens contando la respuesta y el rastro juntos.
SDK de OpenAI / Python
from openai import OpenAI
client = OpenAI(
base_url="https://api.hop-base.com/v1",
api_key="sk-su-clave",
)
resp = client.chat.completions.create(
model="glm-5.3-flash",
temperature=1,
top_p=0.95,
reasoning_effort="max",
messages=[{"role": "user", "content": "Explica dónde funciona mejor GLM-5.3 Flash"}],
)
print(resp.choices[0].message.content)
print(resp.usage)Preguntas frecuentes
- Llamar a
glm-5.3-flashdevuelve 404 model not found. La clave no está en el grupo de la línea dedicada GLM 5.3 Flash; cree una nueva clave en ese grupo o vuelva a vincular la existente en la consola. - El streaming no devuelve
usage. Añada"stream_options": {"include_usage": true}; sin ello el último fragmento no incluye el recuento de tokens. - El pensamiento no se puede desactivar. Este modelo siempre piensa. Use
reasoning_effortpara elegir la profundidad en lugar de intentar desactivarlo.