The high-speed variant of Z.ai's GLM-5.3-Flash, a natively multimodal model delivering inference speeds of up to 200 tokens per second. Built on the same hybrid sparse and linear attention architecture, with image and video input, reasoning, tool use, and a 1M-token context window.
Ordenados por coste total (entrada y salida por 1 millón de tokens). Selecciona una fila para ver los detalles del proveedor.
| Proveedor | Precio (por 1 M) | Límites | Regiones | Estado | Latencia |
|---|---|---|---|---|---|
Entrada: $0.37Salida: $1.25 | 60 RPM / 200K TPM | us-east-1 | Operativo | 0ms |
Usa este modelo mediante OpenRouter con un SDK compatible con OpenAI.
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://openrouter.ai/api/v1",
apiKey: process.env.OPENROUTER_API_KEY,
});
const response = await client.chat.completions.create({
model: "z-ai/glm-5.3-flashx",
messages: [
{ role: "user", content: "Hello!" }
],
});
console.log(response.choices[0].message.content);API de OpenRouter · SDK compatible con OpenAI
Todos los precios registrados para este modelo, por proveedor. Precios por 1M de tokens en USD.
Sin cambios de precio registrados desde 1 oct 2026.
| Fecha | Proveedor | Entrada | Salida |
|---|---|---|---|
| 1 oct 2026Publicado · Actual | OpenRouter | $0.37 | $1.25 |