GLMMODEL — IA open-source conçu pour des tâches à long terme avec un million de contextes

GLM-5.3 est le modèle AI open-source phare — le modèle open-weights le plus capable pour le codage, avec un contexte stable de un million de tokens. Il rapporte 88,2 sur Terminal-Bench 2.1, 78,1 sur FrontierSWE et un état de l'art de 84,5 sur CyberGym pour la découverte de vulnérabilités. Ci-dessous, vous pouvez comparer chaque modèle — ou expérimenter d'abord le sandbox AI gratuit.

1M
Contexte de token
Amélioré par rapport à 200K, maintenir la stabilité sous charge d'agent
88.2
Terminal-Bench 2.1
GLM-5.3 scores, une amélioration par rapport à 81.0 de GLM-5.2.
MIT
Licence Open Source
Poids ouverts, sans restrictions géographiques

Centre d'expérience AI gratuit — Expérimentez des modèles de langage à grande échelle open-source en temps réel

Aucune inscription requise, aucun compte requis, aucun quota requis. Des réponses en flux en temps réel peuvent être obtenues en saisissant des mots d'invite.

La réponse sera diffusée ici...

Cette expérience utilise le modèle de langage grand GLM, et des réponses en temps réel peuvent être obtenues en entrant des mots d'invite.

Capacités centrales de la famille GLMMODEL

Quatre capacités définissent la génération actuelle des modèles — tous signalés par les auteurs du modèle et réproductibles à partir de droits ouverts.

Contexte stable d'un million de tokens

Un contexte de un million de tokens n'est pas seulement disponible, mais il maintient également la qualité : GLM-5.3 continue l'entraînement sur des trajectoires d'agents de codage à long contexte telles que la mise en œuvre à grande échelle, la recherche automatisée et le débogage complexe.

Capacité cybernétique émergente

État de l'art sur CyberGym (84.5) pour la découverte de vulnérabilités. Dans des tests réels, il a identifié 2 436 vulnérabilités au sein de 269 projets open-source — la plus ancienne datant de 1981.

Architecture d'IndexShare

Chaque quatre couches d'attention espacées partagent un indexeur léger, réduisant les FLOPs par token de 2,9 fois sous une longueur de contexte de un million, tout en maintenant la qualité à long distance sans perte.

Poids Open Source MIT

Modèles open-source sous licence MIT : les poids sont publiés sur HuggingFace et ModelScope, sans restriction géographique, et supportent le déploiement local via transformers, vLLM, SGLang, xLLM et ktransformers.

GLM-5.3 Benchmark Test : Codage, Agents & Cyber

Toutes les données suivantes sont les résultats du GLM-5.3 et des modèles comparatifs publiés par les auteurs du modèle. glmmodel.net ne fournit que des rapports et ne réalise pas ces évaluations.

SOTA Open-Source
78.1%

FrontierSWE

La durée de la tâche peut atteindre 20 heures

GLM-5.378.1
Fable 588.2
Opus 4.866.5
GLM-5.267.5
Beats Opus 4.8 & GPT-5.6
39.8%

PostTrainBench

Jusqu'à 10 heures sur une seule carte H100

GLM-5.339.8
Fable 541.8
GPT-5.6 Sol36.2
Opus 4.832.9
2.2× over GLM-5.2
42.5%

SWE-Marathon

Ingénierie logicielle à cycle ultra-long, jusqu'à 10 heures

GLM-5.342.5
Opus 4.848.8
Kimi K348.1
GLM-5.219.4

Sur ces benchmarks à horizon long, GLM-5.3 est le modèle open-source le plus bien classé — preuve que son contexte de million de tokens se transforme en sortie réelle. Il passe de 4.6 à 28.3 sur Terminal-Bench 3.0, de 46.2 à 66.9 sur DeepSWE v1.1, et double plus que le GLM-5.2 sur les benchmarks d'exploitation — chaque gain venant de l'entraînement postérieur sur le même modèle de base.

Terminal-Bench 2.1+7.2
GLM-5.388.2
GPT-5.6 Sol88.8
Kimi K388.3
GLM-5.281.0
Terminal-Bench 3.0+23.7 (6.2×)
GLM-5.328.3
GPT-5.6 Sol34.6
Fable 533.7
GLM-5.24.6
NL2Repo+9.1
GLM-5.358.0
Opus 4.869.7
DeepSeek-V4 Pro61.1
GLM-5.248.9
DeepSWE v1.1+20.7 (1.4×)
GLM-5.366.9
GPT-5.6 Sol72.7
Kimi K367.5
GLM-5.246.2
ProgramBench (Solved)+9.5 (2.0×)
GLM-5.319.0
Fable 533.0
GPT-5.6 Sol23.0
GLM-5.29.5
Toolathlon Verified+13.1
GLM-5.373.0
Kimi K376.5
Opus 4.876.2
GLM-5.259.9
AutomationBench+22.0 (1.8×)
GLM-5.348.2
Kimi K346.7
GPT-5.6 Sol45.8
GLM-5.226.2
HLE (With Tools)+7.8
GLM-5.362.5
GPT-5.6 Sol64.5
Fable 563.9
GLM-5.254.7

Scores GLMMODEL dans 16 tests de benchmark

Résultats de benchmark GLMMODEL publiés, couvrant 16 évaluations de 8 modèles.

Résultats de benchmark GLMMODEL publiés, couvrant chaque évaluation et modèle
Test de benchmarkGLM-5.3GLM-5.2Kimi K3DeepSeek-V4 ProQwen3.8-MaxClaude Opus 4.8Fable 5*GPT-5.6 Sol
Codage
Terminal-Bench 2.188.281.088.387.986.685.088.088.8
Terminal-Bench 3.028.34.617.421.133.734.6
DeepSWE v1.166.946.267.562.756.658.069.772.7
NL2Repo58.048.958.061.155.969.7
ProgramBench (Almost Solved)19.09.517.510.515.533.023.0
FrontierSWE78.167.566.588.2
SWE-Marathon v1.142.519.448.148.833.142.5
PostTrainBench39.831.732.032.941.836.2
Cyber
CyberGym84.577.280.083.378.578.183.883.6
ExploitGym (2h / 6h)105 / 13029 / 3936 / 7014 / 2680 / 120181 / 247216 / 293
ExploitBench54.424.432.228.840.078.076.5
Agent
Toolathlon Verified73.059.976.574.172.576.274.774.9
AutomationBench v1.0.648.226.246.743.239.841.046.245.8
Agents' Last Exam (ALE-CLI)28.523.827.625.727.025.723.828.6
HLE (With Tools)62.554.759.860.056.257.963.964.5
GDPval-AA v217691508168215901739158817431730

* Les résultats de Fable 5 sont signalés avec basculement. Tous les données sont des résultats publiés par les auteurs du modèle.

Effort de raisonnement : faible, élevé et max

GLM-5.3 pense toujours, à trois niveaux d'intensité. Le contrôle de l'effort vous permet de dépenser des ressources de calcul uniquement lorsque la tâche le nécessite — GLM-5.3 bat GLM-5.2 à chaque niveau d'effort tout en consommant moins de tokens de sortie.

Faible

Rapide

raisonnement léger

Scénarios où la latence compte plus que la profondeur, tels que la rédaction rapide, le code modèle et le refactorage habituel — GLM-5.3 ne désactive plus la pensée, donc la raison légère reste activée par défaut.

Le plus utilisé

Élevé

31.4%

~50K tokens moyens

La valeur par défaut pour la plupart du codage des agents : à un effort élevé, GLM-5.3 atteint 31.4% avec environ 50K tokens de sortie, surpassant Claude Opus 4.8 (29.5% à 120K).

Max

34.5%

~75K tokens moyens

Les problèmes à long horizon les plus difficiles : 34,5% environ à 75K tokens de sortie, contre 23,4% pour le GLM-5.2 à 96K — plus de résultats avec moins de tokens.

Les données de Z.ai Code Bench v1.0, un benchmark interne qui évalue les agents de codage dans des environnements de développement locaux réels, mesurant la complétion de tâche de bout en bout à des niveaux d'effort contrôlés. Rapportées par les auteurs du modèle. GLM-5.3 améliore à chaque niveau d'effort à la fois les performances et l'efficacité des tokens par rapport à GLM-5.2.

Comment GLMMODEL atteint-il un million de contextes ?

Augmenter la limite de contexte de 200K à un million de tokens est un problème d'ingénierie plutôt qu'un paramètre de configuration. Trois modifications sont clés.

IndexShare attention sparse

Chaque quatre couches Transformer partagent un indexeur léger. Il est situé à la première couche parmi les quatre, et son index top-k est réutilisé par les trois autres couches — éliminant le produit scalaire et le calcul top-k dans trois quarts des couches. Résultat : Les FLOPs de chaque token sont réduits de 2,9 fois sous une longueur de contexte de un million. IndexShare a été introduit à partir d'une longueur de séquence de 128K pendant la phase intermédiaire de l'entraînement.

Partage de couches du modèle et IndexShare Layer N+3 Layer N+2 Layer N+1 Couche N Partagé Indexeur

MTP combiné avec IndexShare et KVShare

La couche de prédiction multi-token exécute l'indexeur une fois au premier étape de brouillon et le réutilise dans les étapes suivantes, éliminant le désalignement entre le cache KV d'entraînement/inference de la génération précédente. Combiné avec le rejet de l'échantillonnage et la perte TV de bout en bout, la longueur acceptée augmente de 4.56 à 5.47 — environ 20% — sur 7 étapes MTP.

Expérience d'ablation de la longueur d'acceptation MTP
Base4.56
+ IndexShare + KVShare5.10
+ Échantillonnage Rejeté5.29
+ Perte TV Finale5.47 (+20%)

Service efficace pour un million de contextes

Après plus de quelques dizaines de milliers de tokens, le goulet d'étranglement n'est plus la computation, mais la capacité du cache KV, le noyau de contexte long et les surcoûts CPU. Trois correctifs : gestion fine de la mémoire et parallélisation basée sur LayerSplit, optimisation du noyau pour l'échelle de la longueur du contexte coordonnée avec le pipeline de transfert de cache, et gestion du cache côté CPU, planification des demandes et optimisation du chemin d'exécution. L'avantage de débit s'élargit avec la croissance du contexte.

Avantage de débit normalisé

Formation d'agent par renforcement

Le stack d'entraînement (slime) combine des rollouts white-box et black-box, des trajectoires compactes et des workflows sous-agents. L'entraînement par OPD parallèle fusionne plus d'une douzaine de modèles experts en environ deux jours, et le caching FP8 KV conserve la mémoire de rollout dans les limites budgétaires. Grâce à GLM-5.3, les optimisations au niveau du système ont amélioré le débit d'entraînement RL de bout en bout par plus de 2,3×.

Hacker Antirécompense

Le RL à long terme peut induire des raccourcis, donc les actions suspectes sont d'abord passées par un filtre de rappel basé sur des règles, puis vérifiées pour l'exactitude par le juge LLM. Les actions malveillantes confirmées sont interceptées en ligne et répondues avec des résultats d'outils virtuels, permettant aux rollouts de continuer plutôt que d'être jetés. Basé sur le PPO de Critic, des sous-traces compressibles sont maintenues pour l'entraînement sur un seul rollout.

Introduction à chaque modèle, version par version

De niveau Flash 30B à un modèle de drapeau d'un million de contextes — choisissez un modèle pour consulter le tableau de spécification complet et les données de benchmark.

Voir tous les modèles →

Scénarios où les modèles à cycle long excèlent

Implementation à grande échelle

Fonctionnalité multi-fichier au-delà d'une seule fenêtre de contexte : le modèle conserve l'état complet du dépôt à vue, plutôt que de le relire à chaque quelques tours.

Recherche Automatisée

Plusieurs heures de cycles expérimentaux, les agents doivent planifier, exécuter, lire les résultats et corriger — c'est exactement le volume de travail conçu pour être évalué par FrontierSWE et PostTrainBench.

Optimisation des performances

Des graphiques de appels complets, les sorties de l'analyseur, et maintenir le noyau et le système sur la même piste que les tentatives précédentes sont nécessaires.

Débogage Complexe

Suivi de la répétabilité à long terme, tests instables et échecs interservices ; la troncation du contexte est la raison de la perte de bugs.

Tous les scénarios ci-dessus peuvent être exécutés sur votre propre matériel — poids MIT, transformers · vLLM · SGLang · xLLM · ktransformers.Comment exécuter le modèle localement →

Questions courantes sur GLMMODEL

GLMMODEL couvre une famille de modèles de langage grand large open-weight, avec le modèle phare actuel étant GLM-5.3. La gamme de produits va de GLM-4.5-Air et GLM-4.7 à GLM-5, GLM-5-Turbo, GLM-5.1, GLM-5.2, et maintenant GLM-5.3 et le GLM-5.3-Flash multimodal natif, y compris les variantes vocales et visuelles. Chaque modèle de base est publié sous licence MIT, avec des poids entièrement ouverts.

GLM-5.3 conserve la limite à un million de tokens, avec une limite de tokens de sortie de 128K. 'Stable' est le mot-clé : le modèle a été formé sur des trajectoires d'agent de codage longues, donc la qualité reste constante tout au long de la fenêtre. GLM-5.3-Flash atteint également 1M de contexte avec une architecture d'attention linéaire hybride sparse qui réduit nettement les coûts de service de contexte long.

Les résultats publiés incluent 88,2 sur Terminal-Bench 2.1, 28,3 sur Terminal-Bench 3.0 (open-source SOTA), 78,1 sur FrontierSWE, 66,9 sur DeepSWE v1.1, 84,5 sur CyberGym (état de l'art) et 28,5 sur le Dernier Examen des Agents — le modèle open-source le mieux classé dans les évaluations de codage, cyber et agence à long horizon. Le tableau complet est montré ci-dessus.

Comme l'échelle de formation post-formation s'est accrue, la capacité de découverte de vulnérabilités a augmenté plus rapidement que prévu : GLM-5.3 est à l'état de l'art sur CyberGym (84.5) et double plus que GLM-5.2 sur ExploitBench (54.4 vs 24.4). Dans des tests réels avec des équipes de sécurité, il a identifié 2 436 vulnérabilités dans 269 projets open-source, certains datant de 1981.

Cela dépend de la tâche. GLM-5.3 mène Opus 4.8 et GPT-5.6 Sol sur FrontierSWE, DeepSWE, AutomationBench et CyberGym, et égale GPT-5.6 Sol sur SWE-Marathon (42.5). Les modèles de frontière fermés restent en tête sur Terminal-Bench 3.0, ExploitGym et NL2Repo. Sur Z.ai Code Bench à Haute effort, GLM-5.3 (31.4% à ~50K tokens) dépasse Opus 4.8 (29.5% à 120K).

GLM-5.3 pense toujours et offre trois niveaux d'effort. Sur Z.ai Code Bench v1.0, il atteint 31,4% en niveau Haut (environ 50K tokens de sortie) et 34,5% en Niveau Max (environ 75K), battant GLM-5.2 à chaque niveau tout en utilisant moins de tokens. Haut est le niveau pratique par défaut ; Max est réservé pour les problèmes les plus difficiles à long terme.

Oui. Les poids du modèle de base sont sous licence MIT, sans restriction régionale, et ont été publiés sur HuggingFace et ModelScope. Les poids du GLM-5.3-Flash sont également publics, prenant en charge SGLang, vLLM et TokenSpeed pour l'inference locale — donc vous pouvez exécuter des modèles sur votre propre matériel.

IndexShare permet à chaque quatre couches d'attention sparses de partager un indexeur léger, dont l'index top-k est calculé une seule fois et réutilisé. Cela élimine le travail de l'indexeur dans trois quarts des couches, réduisant les FLOPs de chaque token de 2.9 fois dans un contexte de million de tokens — un changement clé qui rend la fenêtre de million de tokens feasible au niveau du service.

Modèles de grande langue open-source gratuits fournis via OpenRouter — ni GLM-5.3, ni utilisant des poids GLM. Son existence est pour vous permettre de tester des modèles en temps réel immédiatement lorsque vous lisez les données de modèle publiées. Tous les données de benchmark sur ce site sont les résultats rapportés par les auteurs du modèle, non mesurés ici.

Expérience gratuite de modèle d'IA en temps réel — pas de compte requis

Lisez les tests de benchmark du modèle, puis laissez le modèle réel commencer à travailler. Le sandbox ci-dessus est gratuit et ne nécessite aucune information ; si vous souhaitez un kit d'outils IA plus complet, le paquet gratuit des partenaires commence ici.