GLM-5.3 Flash

Conéctese a GLM-5.3 Flash mediante la API compatible con OpenAI Chat Completions, incluidos el uso en streaming, las llamadas a herramientas y el rastro de pensamiento.

GLM-5.3 Flash usa el protocolo de HopBase compatible con OpenAI Chat Completions. Use https://api.hop-base.com/v1 y configure el modelo como glm-5.3-flash.

GLM-5.3 Flash fue publicado y liberado como código abierto por Zhipu el 2026-08-26 y es el primer miembro nativamente multimodal de la serie GLM-5: un modelo de mezcla de expertos con 320B de parámetros totales y 18B activos por token, ventana de contexto de 1M y hasta 128K tokens de salida.

Modelo y especificaciones

ElementoValor
ID del modeloglm-5.3-flash
ArquitecturaMoE, 320B de parámetros totales, 18B activos por token
AtenciónAtención híbrida dispersa más lineal: 3,01 veces menos cómputo de atención y una caché KV 4,44 veces menor que GLM-5.3
Ventana de contexto1M tokens
Salida máxima128K tokens
Modalidades de entradaTexto, imagen, video, archivo
SalidaTexto
PensamientoSiempre activo; el rastro se devuelve en reasoning_content

Endpoint y Base URL

CampoValor
Dirección de la API / Base URLhttps://api.hop-base.com/v1
EndpointPOST /v1/chat/completions
Clave APIsk-su-clave
Modeloglm-5.3-flash
Formato de API (solo CC Switch y otros clientes con enrutamiento)OpenAI Chat Completions (requiere enrutamiento)

Selección de grupo y facturación

  • glm-5.3-flash se vende en el grupo GLM 5.3 Flash 专线 (línea dedicada GLM 5.3 Flash). Al crear una clave API en API Keys en la consola, establezca el grupo de la clave en este; solo una clave vinculada a él puede llamar al modelo.
  • Una clave está vinculada a un grupo. Las claves vinculadas a otros grupos reciben un 404 explícito al llamar a glm-5.3-flash — cree una nueva clave en este grupo, o vuelva a vincular una clave existente en la consola.
  • Las tarifas toman como base el precio oficial de lista de Zhipu para este modelo y se publican en la página de precios; su tarifa efectiva se muestra en la Plaza de modelos tras iniciar sesión.
  • glm-5.3 mantiene sus propios grupos y no se ve afectado; consulte GLM-5.3.

Parámetros recomendados

Estos son los valores recomendados que Zhipu publica para este modelo:

ParámetroRecomendadoNotas
temperature1
top_p0.95
reasoning_effortmaxEl pensamiento siempre está activo y no se puede desactivar
stream_options.include_usagetrueNecesario para recibir usage en el último fragmento del streaming
tool_streamtrueRecomendado junto con el streaming cuando la solicitud incluye tools

curl

curl https://api.hop-base.com/v1/chat/completions \
  -H "Authorization: Bearer sk-su-clave" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "temperature": 1,
    "top_p": 0.95,
    "reasoning_effort": "max",
    "messages": [{"role": "user", "content": "Hola, preséntate"}]
  }'

Streaming y uso

Envíe "stream": true. Para recibir el recuento de tokens, añada stream_options.include_usage: el último fragmento incluirá entonces un objeto usage. Cuando la solicitud también incluya tools, active tool_stream: true para que los argumentos de las llamadas a herramientas lleguen de forma incremental en lugar de en un solo bloque.

curl https://api.hop-base.com/v1/chat/completions \
  -H "Authorization: Bearer sk-su-clave" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "stream": true,
    "stream_options": {"include_usage": true},
    "tool_stream": true,
    "messages": [{"role": "user", "content": "Escribe un haiku sobre la latencia"}]
  }'

Llamadas a herramientas

Las llamadas a funciones funcionan con los campos estándar de OpenAI. Envíe tools, lea choices[].message.tool_calls en la respuesta, ejecute la función y devuelva el resultado como un mensaje tool.

curl https://api.hop-base.com/v1/chat/completions \
  -H "Authorization: Bearer sk-su-clave" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [{"role": "user", "content": "¿Qué tiempo hace en Tokio?"}],
    "tools": [{
      "type": "function",
      "function": {
        "name": "get_weather",
        "description": "Obtiene el tiempo actual de una ciudad",
        "parameters": {
          "type": "object",
          "properties": {"city": {"type": "string"}},
          "required": ["city"]
        }
      }
    }]
  }'

Rastro de pensamiento

El modelo siempre piensa; no hay un interruptor para desactivarlo. El rastro se devuelve en reasoning_content junto con la respuesta en content, y en modo streaming llega como delta.reasoning_content. Muéstrelo por separado o descártelo, pero no lo concatene con la respuesta. Dimensione max_tokens contando la respuesta y el rastro juntos.

SDK de OpenAI / Python

from openai import OpenAI

client = OpenAI(
    base_url="https://api.hop-base.com/v1",
    api_key="sk-su-clave",
)

resp = client.chat.completions.create(
    model="glm-5.3-flash",
    temperature=1,
    top_p=0.95,
    reasoning_effort="max",
    messages=[{"role": "user", "content": "Explica dónde funciona mejor GLM-5.3 Flash"}],
)
print(resp.choices[0].message.content)
print(resp.usage)

Preguntas frecuentes

  • Llamar a glm-5.3-flash devuelve 404 model not found. La clave no está en el grupo de la línea dedicada GLM 5.3 Flash; cree una nueva clave en ese grupo o vuelva a vincular la existente en la consola.
  • El streaming no devuelve usage. Añada "stream_options": {"include_usage": true}; sin ello el último fragmento no incluye el recuento de tokens.
  • El pensamiento no se puede desactivar. Este modelo siempre piensa. Use reasoning_effort para elegir la profundidad en lugar de intentar desactivarlo.

En esta página