Guia da API GLM-5.3 2026: contexto de 1M e preço 8x
O GLM-5.3 foi lançado em 14 de agosto de 2026 e já está disponível neste gateway com o ID de modelo glm-5.3 e uma janela de contexto de 1 milhão de tokens. A cobrança no gateway é igual à do GLM-5.2: um único multiplicador uniforme de 8x, aproximadamente CNY 3,2 por milhão de tokens. O gateway não apresenta uma tarifa de 37,5x para o GLM-5.3.
A Z.ai afirma que o GLM-5.3 usa o mesmo modelo-base do GLM-5.2 e que seus avanços vêm de um pós-treinamento concentrado em programação complexa, agentes de longa duração e capacidades emergentes de cibersegurança. Este guia separa as declarações e os benchmarks oficiais da Z.ai dos dados de rota e preço deste gateway. As pontuações publicadas não são testes independentes deste site.
Valide primeiro com uma solicitação pequena: confira os preços atuais dos modelos ou comece pela página de compra da API. A disponibilidade, a ponderação da saída e o extrato da conta no momento da solicitação continuam sendo a referência definitiva.
Principais dados do GLM-5.3
| Item | Informação verificada |
|---|---|
| Lançamento oficial | 14 de agosto de 2026 |
| ID do modelo na API | glm-5.3 |
| Janela de contexto | 1 milhão de tokens |
| Multiplicador do gateway | 8x uniforme, igual ao glm-5.2 |
| Tarifa de referência do gateway | Cerca de CNY 3,2 por milhão de tokens |
| Parâmetro de pensamento | thinking.type: "enabled" |
| Esforço de raciocínio | low, high ou max; o padrão oficial é max |
| Foco principal | Programação complexa, agentes de longa duração, terminal e pesquisa de cibersegurança |
| Formatos compatíveis | O catálogo do gateway lista os formatos OpenAI e Anthropic |
| Entrada de imagens | Não confirmada neste gateway; não presuma que há suporte |
Última verificação em 14 de agosto de 2026. Antes de uma implantação em produção, consulte novamente a página de preços e o catálogo de modelos.

Fonte: lançamento oficial do GLM-5.3 pela Z.ai. Os números são resultados de avaliação publicados pelo fornecedor, não testes independentes deste site.
O que mudou do GLM-5.2 para o GLM-5.3?
O GLM-5.3 não é um substituto construído sobre um modelo-base maior. Segundo a Z.ai, ele compartilha a mesma base do GLM-5.2 e obtém suas melhorias pelo pós-treinamento. Portanto, a questão importante é a confiabilidade com que o modelo conclui trabalhos difíceis, não apenas o seu tamanho.
| Comparação | GLM-5.2 | GLM-5.3 |
|---|---|---|
| Modelo-base | Base do GLM-5.2 | Igual ao GLM-5.2 |
| Principal atualização | Recursos gerais, de programação e de agente existentes | Pós-treinamento reforçado para programação complexa e tarefas longas |
| Janela de contexto | 1 milhão de tokens | 1 milhão de tokens |
| Multiplicador do gateway | 8x | 8x |
| Tarifa de referência do gateway | Cerca de CNY 3,2/M de tokens | Cerca de CNY 3,2/M de tokens |
| Configuração de pensamento | Confirme na rota ativa | Pensamento obrigatório; esforço low/high/max |
Se o GLM-5.2 já funciona de forma confiável em produção, um novo número de versão, por si só, não justifica uma migração total imediata. Compare os dois modelos nos mesmos repositórios e com as mesmas permissões de ferramentas, limites de tempo, níveis de esforço de raciocínio e comandos de aceitação, usando uma pequena parcela do tráfego.
Como interpretar os benchmarks oficiais da Z.ai
A Z.ai apresenta o GLM-5.3 como seu modelo de programação mais poderoso destinado a um lançamento com pesos abertos e publicou vários avanços importantes. Em 14 de agosto de 2026, os pesos ainda não tinham sido disponibilizados: estavam planejados para cerca de duas semanas após o lançamento. Trata-se de declarações do fornecedor, não de uma conclusão independente. Alguns dados publicados são:
| Benchmark publicado pelo fornecedor | GLM-5.2 | GLM-5.3 |
|---|---|---|
| Terminal Bench 3.0 | 4.6 | 28.3 |
| DeepSWE v1.1 | 46.2 | 66.9 |
| Agents' Last Exam | 23.8 | 28.5 |
| CyberGym | 77.2 | 84.5 |
| ExploitBench | 24.4 | 54.4 |
| ExploitGym 2h / 6h | 29 / 39 | 105 / 130 |
Esses números vêm do lançamento da Z.ai, não de uma nova execução independente feita por este site. Os ambientes de agente, o acesso a ferramentas, os orçamentos de raciocínio e as versões dos benchmarks podem variar entre modelos. Portanto, as diferenças não podem ser convertidas diretamente em uma taxa de sucesso para o seu repositório. A Z.ai também informa uma melhoria de 50% sobre o GLM-5.2 em seu Code Bench interno. Considere isso uma evidência da direção de otimização do fornecedor, não um resultado de classificação neutro.

Gráfico do Code Bench interno da Z.ai. Acrescente testes de aceitação em seus próprios repositórios antes de escolher um modelo de produção.
O que significam “capacidades emergentes de cibersegurança”?
A Z.ai destaca a capacidade do GLM-5.3 de executar trajetórias mais longas de descoberta e validação de vulnerabilidades quando recebe código, acesso ao terminal e feedback. Isso pode ser útil em análises de segurança autorizadas, ambientes CTF, validação de atualizações de dependências e exercícios internos de red team. Não é permissão para testar sistemas sem autorização.
Para agentes de segurança, limite os domínios-alvo, repositórios, credenciais, saída de rede e comandos executáveis a um escopo explícito. Mantenha aprovação humana para exclusão de dados, alterações de permissões, implantações em produção e ações em redes externas. Uma capacidade maior exige uma sandbox melhor, logs de auditoria completos e um controle de parada confiável.

Gráfico oficial da Z.ai sobre capacidades cibernéticas. Ele descreve a direção publicada pelo fornecedor e não recomenda testes não autorizados.
Preço do GLM-5.3: igual ao GLM-5.2 aqui
Atualmente, este gateway atribui ao glm-5.3 e ao glm-5.2 o mesmo multiplicador uniforme de 8x, com tarifa de referência de aproximadamente CNY 3,2 por milhão de tokens. O GLM-5.3 não está listado a 37,5x, e o multiplicador não muda quando o prompt fica mais longo.
Os valores de 8x e CNY 3,2 são as condições de cobrança deste gateway, não o preço de tabela da API direta da Z.ai. A ponderação de saída, os grupos de conta, o tratamento de cache, as promoções ou futuras alterações podem afetar o extrato final. Comece com uma solicitação curta e sem streaming e registre os tokens de entrada, os tokens de saída e o valor realmente cobrado.
Quer conferir o custo de forma controlada? Adquira um saldo pequeno na página de compra da API ou recarregue uma chave existente. Depois, faça uma solicitação de teste antes de aumentar o tráfego.
Como chamar a API GLM-5.3
Use o ID de modelo exato glm-5.3. O GLM-5.3 exige que o pensamento permaneça ativado. Se um aplicativo existente enviar thinking.type: "disabled", altere esse parâmetro antes de trocar o modelo, ou a solicitação falhará.
curl https://api.llm-token.cn/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"messages": [
{"role": "user", "content": "Analise os testes que falharam neste repositório. Explique a causa raiz antes de fazer alterações."}
],
"thinking": {"type": "enabled"},
"reasoning_effort": "max"
}'
reasoning_effort aceita low, high ou max, e o padrão oficial é max. A Z.ai recomenda max para programação, mas as equipes de produção ainda devem medir a latência e o uso de tokens. Um roteador prático pode usar low para classificação e pequenas edições, reservando high ou max para depuração difícil, implementações em todo o repositório e análises de segurança.
O catálogo do gateway lista formatos compatíveis com OpenAI e Anthropic. Ao configurar Claude Code, OpenCode, ZCode ou outro agente, teste separadamente a URL base, o ID do modelo, as chamadas de ferramentas, o streaming, os campos de uso e os tempos limite. Uma única resposta de texto bem-sucedida não é um teste completo de compatibilidade.
Melhores casos de uso do GLM-5.3 para agentes de código
- Implementação em todo o repositório, abrangendo vários arquivos e módulos
- Agentes de longa duração que inspecionam, editam, testam e corrigem
- Diagnóstico complexo de terminal, builds e conflitos de dependências
- Pesquisa autorizada de vulnerabilidades, regressão de segurança e CTF
- Fluxos com contexto de 1M sobre grandes repositórios ou conjuntos de documentos
- Tarefas com várias ferramentas que precisam planejar, executar e verificar ao longo de uma trajetória extensa
Classificação, resumos curtos, preenchimento de modelos e conversas simples em grande volume podem ser mais econômicos com menor esforço ou com um modelo de multiplicador inferior. Compare as rotas na lista de modelos e confronte o contexto de 1M e as condições de cobrança com o guia do DeepSeek-V4-Pro-0813.
Checklist de avaliação para produção
- Copie
glm-5.3do catálogo ativo em vez de adivinhar um alias com data. - Remova ou altere
thinking.type: "disabled"nos payloads antigos. - Meça a taxa de aceitação, a latência e o uso com
low,highemax. - Fixe o commit do repositório, o texto da tarefa, as permissões de ferramentas e os comandos de aceitação para as comparações.
- Limite as chamadas de ferramentas, a saída máxima, o tempo por chamada e o orçamento total da tarefa.
- Registre o ID da solicitação, a rota escolhida, o status, o tempo até o primeiro token, a duração total, o uso e o resultado aceito.
- Mantenha aprovação humana para escrita de arquivos, implantação, pagamentos, permissões da conta e ações em sistemas externos.
- Tenha uma rota alternativa para tempos limite, falta de capacidade e incidentes do upstream.
Principais conclusões
- O ID exato do modelo é
glm-5.3, com uma janela de contexto de 1 milhão de tokens. - Neste gateway, o GLM-5.3 tem o mesmo multiplicador 8x do GLM-5.2, cerca de CNY 3,2 por milhão de tokens.
- O pensamento precisa permanecer ativado; o GLM-5.3 aceita
low,highemaxcomo esforço de raciocínio, commaxcomo padrão. - Os resultados da Z.ai para programação, agentes e cibersegurança são dados publicados pelo fornecedor, não testes independentes deste site.
- Uma janela de modelo de 1M não garante que todos os clientes possam enviar exatamente 1M de tokens de entrada.
- A escolha para produção deve medir tarefas aceitas, uso de tokens, latência e retrabalho da equipe em cargas reais.
Perguntas frequentes
O GLM-5.3 foi lançado oficialmente?
Sim. A Z.ai lançou o GLM-5.3 em 14 de agosto de 2026, e este gateway já lista a rota glm-5.3.
Qual é a janela de contexto do GLM-5.3?
Ela tem 1 milhão de tokens. A entrada realmente utilizável também depende das instruções do sistema, dos registros das ferramentas, dos limites do cliente e da saída reservada.
Qual é o multiplicador do GLM-5.3 neste gateway?
É um multiplicador uniforme de 8x, igual ao GLM-5.2, com tarifa de referência de cerca de CNY 3,2 por milhão de tokens. Não é 37,5x e não varia de acordo com o tamanho do contexto.
Posso desativar o pensamento no GLM-5.3?
Não. O lançamento oficial informa que thinking.type deve ser enabled; disabled deixou de ser aceito. Corrija os payloads antigos antes da migração.
Qual reasoning_effort devo escolher?
Comece com low para trabalhos simples e teste high ou o max oficialmente recomendado para programação complexa. Use sua suíte de aceitação para equilibrar qualidade, latência e custo.
O GLM-5.3 funciona com Claude Code ou OpenCode?
A Z.ai lista Claude Code, OpenCode e ZCode como formas de uso. Este gateway oferece rotas compatíveis com OpenAI e Anthropic; valide mensagens, ferramentas, streaming, tempos limite e cobrança no seu cliente específico.
Os pesos abertos do GLM-5.3 já estão disponíveis?
Não na data de verificação deste artigo. A Z.ai informou que planejava publicá-los cerca de duas semanas após o lançamento, depois de mais trabalho de segurança e reforço. Consulte o repositório oficial para confirmar o estado real.
Onde posso comprar ou recarregar o acesso à API GLM-5.3?
Novos usuários podem começar na página de compra da API. Quem já possui uma chave pode usar a página de recarga.
Fontes principais
- Z.ai: GLM-5.3: Frontier Coding with Emergent Cyber Capabilities: data de lançamento, modelo-base compartilhado, pós-treinamento, parâmetros de pensamento, avaliações de programação e cibersegurança e publicação planejada dos pesos
- Z.ai: GLM-5.2: contexto do modelo-base e da janela de 1M
- Guia de modelos do gateway: ID atual da rota, contexto de 1M, multiplicador 8x e formatos compatíveis