GLM-5.3 est le modèle AI open-source phare — le modèle open-weights le plus capable pour le codage, avec un contexte stable de un million de tokens. Il rapporte 88,2 sur Terminal-Bench 2.1, 78,1 sur FrontierSWE et un état de l'art de 84,5 sur CyberGym pour la découverte de vulnérabilités. Ci-dessous, vous pouvez comparer chaque modèle — ou expérimenter d'abord le sandbox AI gratuit.
Aucune inscription requise, aucun compte requis, aucun quota requis. Des réponses en flux en temps réel peuvent être obtenues en saisissant des mots d'invite.
La réponse sera diffusée ici...
Cette expérience utilise le modèle de langage grand GLM, et des réponses en temps réel peuvent être obtenues en entrant des mots d'invite.
Quatre capacités définissent la génération actuelle des modèles — tous signalés par les auteurs du modèle et réproductibles à partir de droits ouverts.
Un contexte de un million de tokens n'est pas seulement disponible, mais il maintient également la qualité : GLM-5.3 continue l'entraînement sur des trajectoires d'agents de codage à long contexte telles que la mise en œuvre à grande échelle, la recherche automatisée et le débogage complexe.
État de l'art sur CyberGym (84.5) pour la découverte de vulnérabilités. Dans des tests réels, il a identifié 2 436 vulnérabilités au sein de 269 projets open-source — la plus ancienne datant de 1981.
Chaque quatre couches d'attention espacées partagent un indexeur léger, réduisant les FLOPs par token de 2,9 fois sous une longueur de contexte de un million, tout en maintenant la qualité à long distance sans perte.
Modèles open-source sous licence MIT : les poids sont publiés sur HuggingFace et ModelScope, sans restriction géographique, et supportent le déploiement local via transformers, vLLM, SGLang, xLLM et ktransformers.
Toutes les données suivantes sont les résultats du GLM-5.3 et des modèles comparatifs publiés par les auteurs du modèle. glmmodel.net ne fournit que des rapports et ne réalise pas ces évaluations.
La durée de la tâche peut atteindre 20 heures
Jusqu'à 10 heures sur une seule carte H100
Ingénierie logicielle à cycle ultra-long, jusqu'à 10 heures
Sur ces benchmarks à horizon long, GLM-5.3 est le modèle open-source le plus bien classé — preuve que son contexte de million de tokens se transforme en sortie réelle. Il passe de 4.6 à 28.3 sur Terminal-Bench 3.0, de 46.2 à 66.9 sur DeepSWE v1.1, et double plus que le GLM-5.2 sur les benchmarks d'exploitation — chaque gain venant de l'entraînement postérieur sur le même modèle de base.
Résultats de benchmark GLMMODEL publiés, couvrant 16 évaluations de 8 modèles.
| Test de benchmark | GLM-5.3 | GLM-5.2 | Kimi K3 | DeepSeek-V4 Pro | Qwen3.8-Max | Claude Opus 4.8 | Fable 5* | GPT-5.6 Sol |
|---|---|---|---|---|---|---|---|---|
| Codage | ||||||||
| Terminal-Bench 2.1 | 88.2 | 81.0 | 88.3 | 87.9 | 86.6 | 85.0 | 88.0 | 88.8 |
| Terminal-Bench 3.0 | 28.3 | 4.6 | 17.4 | – | – | 21.1 | 33.7 | 34.6 |
| DeepSWE v1.1 | 66.9 | 46.2 | 67.5 | 62.7 | 56.6 | 58.0 | 69.7 | 72.7 |
| NL2Repo | 58.0 | 48.9 | 58.0 | 61.1 | 55.9 | 69.7 | – | – |
| ProgramBench (Almost Solved) | 19.0 | 9.5 | 17.5 | – | 10.5 | 15.5 | 33.0 | 23.0 |
| FrontierSWE | 78.1 | 67.5 | – | – | – | 66.5 | 88.2 | – |
| SWE-Marathon v1.1 | 42.5 | 19.4 | 48.1 | – | – | 48.8 | 33.1 | 42.5 |
| PostTrainBench | 39.8 | 31.7 | 32.0 | – | – | 32.9 | 41.8 | 36.2 |
| Cyber | ||||||||
| CyberGym | 84.5 | 77.2 | 80.0 | 83.3 | 78.5 | 78.1 | 83.8 | 83.6 |
| ExploitGym (2h / 6h) | 105 / 130 | 29 / 39 | 36 / 70 | – | 14 / 26 | 80 / 120 | 181 / 247 | 216 / 293 |
| ExploitBench | 54.4 | 24.4 | 32.2 | – | 28.8 | 40.0 | 78.0 | 76.5 |
| Agent | ||||||||
| Toolathlon Verified | 73.0 | 59.9 | 76.5 | 74.1 | 72.5 | 76.2 | 74.7 | 74.9 |
| AutomationBench v1.0.6 | 48.2 | 26.2 | 46.7 | 43.2 | 39.8 | 41.0 | 46.2 | 45.8 |
| Agents' Last Exam (ALE-CLI) | 28.5 | 23.8 | 27.6 | 25.7 | 27.0 | 25.7 | 23.8 | 28.6 |
| HLE (With Tools) | 62.5 | 54.7 | 59.8 | 60.0 | 56.2 | 57.9 | 63.9 | 64.5 |
| GDPval-AA v2 | 1769 | 1508 | 1682 | 1590 | 1739 | 1588 | 1743 | 1730 |
* Les résultats de Fable 5 sont signalés avec basculement. Tous les données sont des résultats publiés par les auteurs du modèle.
GLM-5.3 pense toujours, à trois niveaux d'intensité. Le contrôle de l'effort vous permet de dépenser des ressources de calcul uniquement lorsque la tâche le nécessite — GLM-5.3 bat GLM-5.2 à chaque niveau d'effort tout en consommant moins de tokens de sortie.
raisonnement léger
Scénarios où la latence compte plus que la profondeur, tels que la rédaction rapide, le code modèle et le refactorage habituel — GLM-5.3 ne désactive plus la pensée, donc la raison légère reste activée par défaut.
~50K tokens moyens
La valeur par défaut pour la plupart du codage des agents : à un effort élevé, GLM-5.3 atteint 31.4% avec environ 50K tokens de sortie, surpassant Claude Opus 4.8 (29.5% à 120K).
~75K tokens moyens
Les problèmes à long horizon les plus difficiles : 34,5% environ à 75K tokens de sortie, contre 23,4% pour le GLM-5.2 à 96K — plus de résultats avec moins de tokens.
Les données de Z.ai Code Bench v1.0, un benchmark interne qui évalue les agents de codage dans des environnements de développement locaux réels, mesurant la complétion de tâche de bout en bout à des niveaux d'effort contrôlés. Rapportées par les auteurs du modèle. GLM-5.3 améliore à chaque niveau d'effort à la fois les performances et l'efficacité des tokens par rapport à GLM-5.2.
Augmenter la limite de contexte de 200K à un million de tokens est un problème d'ingénierie plutôt qu'un paramètre de configuration. Trois modifications sont clés.
Chaque quatre couches Transformer partagent un indexeur léger. Il est situé à la première couche parmi les quatre, et son index top-k est réutilisé par les trois autres couches — éliminant le produit scalaire et le calcul top-k dans trois quarts des couches. Résultat : Les FLOPs de chaque token sont réduits de 2,9 fois sous une longueur de contexte de un million. IndexShare a été introduit à partir d'une longueur de séquence de 128K pendant la phase intermédiaire de l'entraînement.
La couche de prédiction multi-token exécute l'indexeur une fois au premier étape de brouillon et le réutilise dans les étapes suivantes, éliminant le désalignement entre le cache KV d'entraînement/inference de la génération précédente. Combiné avec le rejet de l'échantillonnage et la perte TV de bout en bout, la longueur acceptée augmente de 4.56 à 5.47 — environ 20% — sur 7 étapes MTP.
| Base | 4.56 |
| + IndexShare + KVShare | 5.10 |
| + Échantillonnage Rejeté | 5.29 |
| + Perte TV Finale | 5.47 (+20%) |
Après plus de quelques dizaines de milliers de tokens, le goulet d'étranglement n'est plus la computation, mais la capacité du cache KV, le noyau de contexte long et les surcoûts CPU. Trois correctifs : gestion fine de la mémoire et parallélisation basée sur LayerSplit, optimisation du noyau pour l'échelle de la longueur du contexte coordonnée avec le pipeline de transfert de cache, et gestion du cache côté CPU, planification des demandes et optimisation du chemin d'exécution. L'avantage de débit s'élargit avec la croissance du contexte.
Avantage de débit normalisé
Le stack d'entraînement (slime) combine des rollouts white-box et black-box, des trajectoires compactes et des workflows sous-agents. L'entraînement par OPD parallèle fusionne plus d'une douzaine de modèles experts en environ deux jours, et le caching FP8 KV conserve la mémoire de rollout dans les limites budgétaires. Grâce à GLM-5.3, les optimisations au niveau du système ont amélioré le débit d'entraînement RL de bout en bout par plus de 2,3×.
Le RL à long terme peut induire des raccourcis, donc les actions suspectes sont d'abord passées par un filtre de rappel basé sur des règles, puis vérifiées pour l'exactitude par le juge LLM. Les actions malveillantes confirmées sont interceptées en ligne et répondues avec des résultats d'outils virtuels, permettant aux rollouts de continuer plutôt que d'être jetés. Basé sur le PPO de Critic, des sous-traces compressibles sont maintenues pour l'entraînement sur un seul rollout.
De niveau Flash 30B à un modèle de drapeau d'un million de contextes — choisissez un modèle pour consulter le tableau de spécification complet et les données de benchmark.
Le modèle open-weights le plus capable pour le codage : +50% sur Z.ai Code Bench, SOTA open-source sur Terminal-Bench 3.0 et Agents' Last Exam, état de l'art sur CyberGym.
Premier modèle-5 multimodal natif : 320B en total / 18B paramètres actifs, attention hybride, 1M de contexte — performance supérieure à GLM-5.2 à un dixième du prix.
Modèle de génération précédente : un contexte de un million de tokens et une fondation à long horizon sur laquelle s'appuie le GLM-5.3 après l'entraînement.
Spécialiste à long horizon : améliorations significatives des capacités à long terme et des sorties de niveau d'ingénierie qui peuvent fonctionner de manière autonome pendant plusieurs heures.
Capacités de programmation plus fortes, exécution multi-étape plus fiable et comportement d'agent complexe amélioré.
Modèle de base, optimisé pour des scénarios de chaînes longues et d'agents intelligents dynamiques.
Capacités de programmation améliorées, inférence multi-étape stable et génération frontend améliorée.
300 milliards de paramètres ; haute efficacité et performance, en tête des modèles de la même échelle.
Fonctionnalité multi-fichier au-delà d'une seule fenêtre de contexte : le modèle conserve l'état complet du dépôt à vue, plutôt que de le relire à chaque quelques tours.
Plusieurs heures de cycles expérimentaux, les agents doivent planifier, exécuter, lire les résultats et corriger — c'est exactement le volume de travail conçu pour être évalué par FrontierSWE et PostTrainBench.
Des graphiques de appels complets, les sorties de l'analyseur, et maintenir le noyau et le système sur la même piste que les tentatives précédentes sont nécessaires.
Suivi de la répétabilité à long terme, tests instables et échecs interservices ; la troncation du contexte est la raison de la perte de bugs.
Tous les scénarios ci-dessus peuvent être exécutés sur votre propre matériel — poids MIT, transformers · vLLM · SGLang · xLLM · ktransformers.Comment exécuter le modèle localement →
Lisez les tests de benchmark du modèle, puis laissez le modèle réel commencer à travailler. Le sandbox ci-dessus est gratuit et ne nécessite aucune information ; si vous souhaitez un kit d'outils IA plus complet, le paquet gratuit des partenaires commence ici.