Your privacy choices

Allow optional cookies for referral attribution, visit analytics, and Google Ads purchase measurement.

Retour au blog

Guide de l’API GLM-5.3 2026 : contexte 1M et tarif 8x

GLM-5.3API GLMmodèle de programmationagents de codecontexte 1M

GLM-5.3 a été lancé le 14 août 2026 et est désormais disponible sur cette passerelle sous l’identifiant glm-5.3, avec une fenêtre de contexte de 1 million de tokens. Sa facturation sur la passerelle est identique à celle de GLM-5.2 : un multiplicateur uniforme de 8x, soit environ 3,2 CNY par million de tokens. La passerelle n’applique pas de tarif de 37,5x à GLM-5.3.

Z.ai indique que GLM-5.3 repose sur le même modèle de base que GLM-5.2 et que ses progrès proviennent d’un post-entraînement axé sur la programmation complexe, les agents de longue durée et l’émergence de capacités en cybersécurité. Ce guide distingue clairement les affirmations officielles de Z.ai sur les capacités et les benchmarks des données de routage et de tarification de cette passerelle. Les scores publiés ne sont pas des tests indépendants réalisés par ce site.

Commencez par une petite requête : consultez le tarif actuel des modèles ou la page d’achat de l’API. La disponibilité, la pondération des sorties et le relevé du compte au moment de la requête restent les références.

Chiffres clés de GLM-5.3

Élément Information vérifiée
Sortie officielle 14 août 2026
Identifiant du modèle API glm-5.3
Fenêtre de contexte 1 million de tokens
Multiplicateur de la passerelle 8x uniforme, comme glm-5.2
Tarif indicatif de la passerelle Environ 3,2 CNY par million de tokens
Paramètre de réflexion thinking.type: "enabled"
Effort de raisonnement low, high ou max ; valeur officielle par défaut : max
Principaux usages Programmation complexe, agents de longue durée, terminal et recherche en cybersécurité
Formats compatibles Le catalogue de la passerelle indique les formats OpenAI et Anthropic
Entrée image Non confirmée sur cette passerelle ; ne présumez pas de sa prise en charge

Informations vérifiées pour la dernière fois le 14 août 2026. Avant un déploiement en production, consultez à nouveau la page des tarifs et le catalogue des modèles.

Vue d’ensemble officielle de Z.ai sur les capacités de GLM-5.3 en programmation, agents et cybersécurité

Source : annonce officielle de GLM-5.3 par Z.ai. Les chiffres sont des résultats d’évaluation publiés par le fournisseur et non des tests indépendants de ce site.

Qu’est-ce qui change entre GLM-5.2 et GLM-5.3 ?

GLM-5.3 ne remplace pas GLM-5.2 par un modèle de base plus grand. Selon Z.ai, il partage la même base que GLM-5.2 et doit ses améliorations au post-entraînement. La question essentielle est donc la fiabilité avec laquelle le modèle mène à bien les tâches difficiles, et pas seulement sa taille.

Comparaison GLM-5.2 GLM-5.3
Modèle de base Base de GLM-5.2 Identique à GLM-5.2
Mise à jour principale Capacités générales, de programmation et d’agent existantes Post-entraînement renforcé pour la programmation complexe et les tâches longues
Fenêtre de contexte 1 million de tokens 1 million de tokens
Multiplicateur de la passerelle 8x 8x
Tarif indicatif de la passerelle Environ 3,2 CNY/M de tokens Environ 3,2 CNY/M de tokens
Configuration de réflexion À confirmer sur la route active Réflexion obligatoire ; effort low/high/max

Si GLM-5.2 fonctionne déjà de manière fiable en production, un nouveau numéro de version ne justifie pas à lui seul une migration complète immédiate. Comparez les deux modèles sur les mêmes dépôts, autorisations d’outils, délais, niveaux d’effort de raisonnement et commandes de validation, avec une faible part du trafic.

Comment interpréter les benchmarks officiels de Z.ai ?

Z.ai présente GLM-5.3 comme son modèle de programmation le plus performant destiné à une publication en poids ouverts et annonce plusieurs progrès importants. Au 14 août 2026, ces poids n’étaient pas encore publiés : leur mise à disposition était prévue environ deux semaines après le lancement. Il s’agit d’affirmations du fournisseur, et non d’une conclusion indépendante. Voici une sélection des données de l’annonce :

Benchmark publié par le fournisseur GLM-5.2 GLM-5.3
Terminal Bench 3.0 4.6 28.3
DeepSWE v1.1 46.2 66.9
Agents' Last Exam 23.8 28.5
CyberGym 77.2 84.5
ExploitBench 24.4 54.4
ExploitGym 2h / 6h 29 / 39 105 / 130

Ces chiffres proviennent de l’annonce de Z.ai, et non d’une nouvelle exécution indépendante par ce site. Les environnements d’agent, l’accès aux outils, les budgets de raisonnement et les versions des benchmarks peuvent varier selon les modèles. Ces écarts ne peuvent donc pas être directement convertis en taux de réussite pour votre dépôt. Z.ai annonce également une amélioration de 50 % par rapport à GLM-5.2 sur son Code Bench interne. Considérez-la comme un indice sur l’orientation de l’optimisation du fournisseur, pas comme le résultat d’un classement neutre.

Graphique officiel de Z.ai sur le Code Bench et l’efficacité en tokens de GLM-5.3

Graphique du Code Bench interne de Z.ai. Ajoutez des tests d’acceptation propres à vos dépôts avant de choisir un modèle de production.

Que signifie « émergence de capacités en cybersécurité » ?

Z.ai souligne la capacité de GLM-5.3 à suivre des trajectoires plus longues de découverte et de validation de vulnérabilités lorsqu’il dispose du code, d’un terminal et de retours. Cela peut être utile pour les audits de sécurité autorisés, les environnements CTF, la validation de mises à jour de dépendances et les exercices internes de red team. Cela n’autorise pas à tester un système sans permission.

Pour les agents de sécurité, limitez les domaines cibles, dépôts, identifiants, sorties réseau et commandes exécutables à un périmètre explicite. Conservez une validation humaine pour la suppression de données, les changements de droits, les déploiements en production et les actions sur des réseaux externes. Des capacités plus fortes exigent un meilleur bac à sable, des journaux d’audit complets et un mécanisme d’arrêt fiable.

Graphique officiel de Z.ai sur GLM-5.3 pour les tâches de cybersécurité et de vulnérabilité

Graphique officiel de Z.ai sur les capacités en cybersécurité. Il illustre l’orientation publiée par le fournisseur et ne recommande aucun test non autorisé.

Tarif de GLM-5.3 : identique à GLM-5.2 sur cette passerelle

Cette passerelle applique actuellement à glm-5.3 et glm-5.2 un multiplicateur uniforme de 8x, pour un tarif indicatif d’environ 3,2 CNY par million de tokens. GLM-5.3 n’est pas affiché à 37,5x et le multiplicateur ne change pas avec la longueur du prompt.

Les valeurs 8x et 3,2 CNY correspondent à la facturation de cette passerelle, et non au prix catalogue de l’API directe de Z.ai. La pondération de la sortie, le groupe du compte, la mise en cache, les promotions ou de futurs ajustements peuvent modifier le relevé final. Commencez par une courte requête non diffusée en continu et relevez les tokens d’entrée, les tokens de sortie et le montant réellement facturé.

Vous voulez contrôler le coût réel ? Ouvrez un petit solde depuis la page d’achat de l’API, ou rechargez une clé existante, puis effectuez une requête de contrôle avant d’augmenter le trafic.

Comment appeler l’API GLM-5.3

Utilisez l’identifiant exact glm-5.3. GLM-5.3 impose de conserver la réflexion activée. Si une application envoie encore thinking.type: "disabled", modifiez ce paramètre avant de changer de modèle, sans quoi la requête échouera.

curl https://api.llm-token.cn/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3",
    "messages": [
      {"role": "user", "content": "Analyse les tests en échec dans ce dépôt. Explique la cause racine avant toute modification."}
    ],
    "thinking": {"type": "enabled"},
    "reasoning_effort": "max"
  }'

reasoning_effort accepte low, high ou max, avec max comme valeur officielle par défaut. Z.ai recommande max pour la programmation, mais les équipes de production doivent tout de même mesurer la latence et la consommation de tokens. Un routeur pratique peut employer low pour la classification et les petites modifications, puis réserver high ou max au débogage difficile, aux changements à l’échelle du dépôt et aux audits de sécurité.

Le catalogue de la passerelle indique des formats compatibles OpenAI et Anthropic. Lors de la configuration de Claude Code, OpenCode, ZCode ou d’un autre agent, testez séparément l’URL de base, l’identifiant du modèle, les appels d’outils, le streaming, les champs d’usage et les délais. Une seule réponse textuelle réussie ne constitue pas un test de compatibilité complet.

Meilleurs cas d’usage de GLM-5.3 pour les agents de code

  • Implémentations à l’échelle d’un dépôt, sur plusieurs fichiers et modules
  • Agents de longue durée qui inspectent, modifient, testent et réparent
  • Diagnostic complexe dans le terminal, des builds et des conflits de dépendances
  • Recherche de vulnérabilités autorisée, tests de régression de sécurité et CTF
  • Flux à contexte de 1M couvrant de grands dépôts ou ensembles documentaires
  • Tâches multi-outils qui doivent planifier, exécuter et vérifier sur une longue trajectoire

La classification, les résumés courts, le remplissage de modèles et les conversations simples à grand volume peuvent coûter moins cher avec un effort plus faible ou un modèle à multiplicateur inférieur. Comparez les routes dans la liste des modèles et confrontez le contexte 1M et la facturation au guide de DeepSeek-V4-Pro-0813.

Liste de contrôle pour l’évaluation en production

  1. Copiez glm-5.3 depuis le catalogue actif plutôt que d’inventer un alias daté.
  2. Supprimez ou modifiez thinking.type: "disabled" dans les charges utiles existantes.
  3. Mesurez le taux d’acceptation, la latence et l’usage avec low, high et max.
  4. Fixez le commit du dépôt, l’énoncé de la tâche, les autorisations d’outils et les commandes de validation pour chaque comparaison.
  5. Limitez le nombre d’appels d’outils, la sortie maximale, le délai par appel et le budget global de la tâche.
  6. Journalisez l’identifiant de requête, la route choisie, l’état, le délai du premier token, la durée totale, l’usage et le résultat accepté.
  7. Conservez une validation humaine pour l’écriture de fichiers, le déploiement, les paiements, les droits de compte et les actions sur des systèmes externes.
  8. Prévoyez une route de secours en cas de délai dépassé, de capacité insuffisante ou d’incident en amont.

À retenir

  • L’identifiant exact est glm-5.3, avec une fenêtre de contexte de 1 million de tokens.
  • Sur cette passerelle, GLM-5.3 reprend le multiplicateur 8x de GLM-5.2, soit environ 3,2 CNY par million de tokens.
  • La réflexion doit rester activée ; GLM-5.3 accepte les efforts low, high et max, et utilise max par défaut.
  • Les résultats de Z.ai en programmation, agents et cybersécurité sont des données publiées par le fournisseur, pas des tests indépendants de ce site.
  • Une fenêtre de modèle de 1M ne garantit pas que chaque client puisse envoyer exactement 1M de tokens en entrée.
  • Le choix en production doit mesurer les tâches acceptées, l’usage des tokens, la latence et le travail de reprise des ingénieurs sur des cas réels.

Questions fréquentes

GLM-5.3 est-il officiellement sorti ?

Oui. Z.ai a publié GLM-5.3 le 14 août 2026, et cette passerelle propose désormais la route glm-5.3.

Quelle est la fenêtre de contexte de GLM-5.3 ?

Elle est de 1 million de tokens. L’entrée réellement utilisable dépend aussi des instructions système, des transcriptions d’outils, des limites du client et de la sortie réservée.

Quel est le multiplicateur de GLM-5.3 sur cette passerelle ?

Il s’agit d’un multiplicateur uniforme de 8x, identique à GLM-5.2, avec un tarif indicatif d’environ 3,2 CNY par million de tokens. Ce n’est pas 37,5x et il n’y a pas de palier selon la longueur du contexte.

Puis-je désactiver la réflexion pour GLM-5.3 ?

Non. L’annonce officielle précise que thinking.type doit être enabled ; disabled n’est plus pris en charge. Corrigez les anciennes charges utiles avant la migration.

Quel niveau de reasoning_effort choisir ?

Commencez par low pour les tâches simples et testez high ou la valeur max recommandée officiellement pour la programmation complexe. Utilisez votre suite de validation afin d’équilibrer qualité, latence et coût.

GLM-5.3 fonctionne-t-il avec Claude Code ou OpenCode ?

Z.ai cite Claude Code, OpenCode et ZCode parmi les modes d’utilisation. Cette passerelle propose des routes compatibles OpenAI et Anthropic ; validez les messages, outils, flux, délais et la facturation avec votre client précis.

Les poids ouverts de GLM-5.3 sont-ils déjà disponibles ?

Pas à la date de vérification de cet article. Z.ai a annoncé prévoir leur publication environ deux semaines après le lancement, après des travaux supplémentaires de sécurité et de durcissement. Consultez le dépôt officiel pour connaître l’état réel de la publication.

Où acheter ou recharger un accès à l’API GLM-5.3 ?

Les nouveaux utilisateurs peuvent commencer sur la page d’achat de l’API. Les détenteurs d’une clé peuvent utiliser la page de recharge.

Sources principales