Modèles GLM — AI open source de 1 million de tokens conçus pour les tâches à long terme

GLM-5.2 est un modèle d'IA GLM open source de niveau Flagship : 1 million de tokens de contexte stables, trois niveaux de force de réflexion (Non-Thinking / Haut / Highest), avec des scores rapportés de 81.0 sur Terminal-Bench 2.1 et 74.4 sur FrontierSWE. Vous pouvez comparer chaque modèle GLM ci-dessous - ou essayer gratuitement l'expérience AI Ground.

1M
Contexte token
Passé de 200K, maintient la stabilité sous la charge de l'agent intelligent
81.0
Terminal-Bench 2.1
Score de GLM-5.2, légèrement supérieur à celui de GLM-5.1 de 63,5.
MIT
Licence open source
Poids ouverts, sans restriction géographique

Salle d'expérience AI gratuite — Expérimentez le modèle de grand langage open source en temps réel

Pas besoin de s'inscrire, de créer un compte ou de demander des crédits. Entrez simplement un mot d'entrée pour obtenir des réponses en flux.

La réponse sera affichée en flux ici...

Cette expérience utilise le grand modèle de langage GLM, entrez simplement un mot d'entrée pour obtenir des réponses en flux en temps réel.

Capacités centrales de la famille de modèles GLM

Quatre capacités définissent la génération actuelle des modèles GLM — toutes rapportées par les auteurs des modèles et ré replicables à partir de droits d'accès ouverts.

Contexte de million de manière stable

1 million de tokens de contexte non seulement est disponible, mais conserve également la qualité : GLM-5.2 a été formé sur des trajectoires d'agents de codage de contexte long, notamment dans l'Implémentation à grande échelle, la Recherche automatisée et le Débogage complexe.

Force de pensée flexible

Les niveaux Non-Thinking, Haut et Highest vous permettent de compromis entre délai et capacité pour les tâches - environ 63% (environ 35K tokens de sortie) à 74% (environ 83K) sur l'évaluation AgentProgramming.

Architecture IndexShare

Chaque quatrième couche d'attention rare partage un indexeur léger, ce qui réduit les FLOPs par token de 2,9 fois sous un contexte de 1 million de tokens, tout en préservant la qualité à long terme.

Poids ouverts de l'MIT

Modèle GLM open-source sous licence MIT : les poids sont publiés sur HuggingFace et ModelScope, sans restriction géographique, et supporte le déploiement local via transformers, vLLM, SGLang, xLLM et ktransformers.

Résultats à long terme du test de base GLM 5.2

Toutes les données ci-dessous sont les résultats de GLM-5.2 et des modèles comparatifs publiés par les auteurs des modèles. glmmodel.net ne réalise que des rapports et ne met pas en œuvre ces évaluations.

Premier modèle open source
74.4%

FrontierSWE

Durée de la tâche pouvant atteindre 20 heures

GLM-5.274.4
Opus 4.875.1
GPT-5.572.6
Gemini 3.1 Pro39.6
Deuxième rang total
34.3%

PostTrainBench

Jusqu'à 10 heures sur une seule carte H100

GLM-5.234.3
Opus 4.837.2
Opus 4.728.6
GPT-5.525.0
Seulement après la série Opus
13.0%

SWE-Marathon

Ingénierie logicielle à long cycle, jusqu'à 10 heures

GLM-5.213.0
Opus 4.826.0
GPT-5.512.0
Gemini 3.1 Pro4.0

Dans les trois tests de base à long terme, GLM-5.2 est le modèle open source le mieux classé - prouvant que son million de tokens de contexte peut être converti en production réelle, et pas seulement en un nombre de tokens acceptable. Il est juste derrière Opus 4.8 de 1 point sur FrontierSWE, devant GPT-5.5 de 1 point et devant le précédent Opus 4.7 de 11 points.

Terminal-Bench 2.1+17.5
GLM-5.281.0
Opus 4.885.0
GLM-5.163.5
SWE-bench Pro+3.7
GLM-5.262.1
Opus 4.869.2
GLM-5.158.4
NL2Repo+6.2
GLM-5.248.9
Opus 4.869.7
GLM-5.142.7
DeepSWE+28.2 (2.6×)
GLM-5.246.2
GPT-5.570.0
GLM-5.118.0
ProgramBench+12.8
GLM-5.263.7
Opus 4.871.9
GLM-5.150.9
MCP-Atlas+5.0
GLM-5.276.8
Opus 4.877.8
GLM-5.171.8
Tool-Decathlon+7.5
GLM-5.248.2
Opus 4.859.9
GLM-5.140.7
HLE+9.5
GLM-5.240.5
Opus 4.849.8
GLM-5.131.0

Scores du modèle GLM dans 17 tests de base

Résultats de référence publiés pour les modèles GLM, couvrant 17 évaluations pour 8 modèles.

Résultats de base du modèle GLM publiés, couvrant chaque évaluation et modèle
Test de baseGLM-5.2GLM-5.1Qwen3.7-MaxMiniMax M3DeepSeek-V4-ProClaude Opus 4.8GPT-5.5Gemini 3.1 Pro
Raisonnement
HLE40.531.041.437.037.749.8*41.4*45.0
HLE (avec outils)54.752.353.548.257.9*52.2*51.4*
CritPt20.94.613.43.712.920.927.117.7
AIME 202699.295.397.094.695.798.398.2
HMMT novembre 202594.494.095.084.494.496.596.594.8
HMMT février 202692.582.697.184.495.296.796.787.3
IMOAnswerBench91.083.890.089.883.581.0
GPQA-Diamond91.286.290.093.090.193.693.694.3
Programming
SWE-bench Pro62.158.460.659.055.469.258.654.2
NL2Repo48.942.747.242.135.569.750.733.4
DeepSWE46.218.018.020.08.058.070.010.0
ProgramBench63.750.947.871.970.839.5
Terminal-Bench 2.1 (Terminus-2)81.063.575.065.064.085.084.074.0
Terminal-Bench 2.1 (meilleur cadre)82.7 (Claude Code)69.0 (Claude Code)78.9 (Claude Code)83.4 (Codex)70.7 (Gemini CLI)
FrontierSWE Dominance74.430.529.075.172.639.6
PostTrainBench34.320.137.228.421.6
SWE-Marathon13.01.026.012.04.0
Agent
MCP-Atlas (ensemble public)76.871.876.474.273.677.875.369.2
Tool-Decathlon48.240.752.859.955.648.8

* Score sur l'ensemble des données complètes.

Force de réflexion : sans réflexion, haute et la plus haute

Les modèles GLM ne sont pas tous de la même vitesse. Le contrôle de la force de pensée vous permet de déployer plus de ressources de calcul uniquement lorsque cela est nécessaire.

Non-Thinking

~63%

~35K token moyen

Éditer rapidement, utiliser des modèles de code, des refactorings conventionnels et d'autres scénarios où la latence est plus importante que la profondeur.

Most Used

Haut

~72%

~43K token moyen

Choix par défaut pour la programmation d'agents intelligents : avec environ la moitié de la consommation de tokens, la qualité approche le niveau le plus élevé.

Highest

~74%

~83K token moyen

Problèmes à long terme difficiles — allouer des ressources de calcul supplémentaires uniquement lorsque cela est nécessaire pour la tâche.

Les données proviennent de la moyenne des Terminal-Bench 2.1, DeepSWE et SWE-Atlas QnA, évaluées sur Claude Code 2.1.167. Rapportées par les auteurs du modèle. Sous un budget de tokens comparable, les performances de GLM-5.2 se situent entre Claude Opus 4.7 et Opus 4.8.

Comment le modèle GLM réalise-t-il un million de contextes ?

Augmenter la limite de contexte de 200K à 1 million de tokens est un problème d'ingénierie, pas un paramètre de configuration. Trois modifications sont cruciales.

Attention sparse IndexShare

Chaque quatre couches Transformer partagent un LightweightIndexer. Il est situé dans la première couche des quatre, et son index top-k est réutilisé par les trois autres couches - éliminant les produits scalaire et les calculs top-k dans trois quarts des couches. Résultat : chaque token voit une réduction de 2.9 fois les FLOPs à une longueur de contexte de 1 million. L'IndexShare a été introduit à partir de la longueur de séquence de 128K pendant la phase de formation.

Partage de couche du modèle GLM et IndexShare Couche N+3 Couche N+2 Couche N+1 Layer N Shared Indexer

MTP avec IndexShare et KVShare

Les couches de prédiction multi-token s'exécutent une seule fois l'Indexer au premier pas de brouillon et réutilisent l'index dans les étapes suivantes, éliminant ainsi le décalage entre le cache KV de formation/Raisonnement de la génération précédente. Combiné à la réduction de la probabilité de refus et à la perte TV de bout en bout, l'acceptation de la longueur passe de 4,56 à 5,47 — environ 20% — sur 7 étapes MTP.

Expérience d'ablation de la longueur acceptée MTP
Baseline4.56
+ IndexShare + KVShare5.10
+ Refuser l'échantillonnage5.29
+ Pertes TV de bout en bout5.47 (+20%)

Service efficace pour un million de contextes

Après plusieurs dizaines de milliers de tokens, le瓶颈n'est plus le calcul, mais la capacité de cache KV, le noyau de contexte long et la charge CPU. Trois corrections : gestion fine de la mémoire basée sur LayerSplit et parallélisation, optimisation du noyau de réduction de la longueur du contexte coordonnée avec le pipeline de transmission de cache, et optimisation de la gestion de cache côté CPU, de la planification des requêtes et de l'ajustement des chemins d'exécution en temps réel. L'avantage de la capacité de traitement augmente avec la croissance du contexte.

Avantage de la capacité de traitement normalisée

Entraînement par renforcement de l'agent intelligent

Le stack de formation (slime) combine des rollouts white-box et black-box, des trajectoires compactes et des flux de travail d'agents. La formation OPD en parallèle a intégré une douzaine de modèles experts en environ deux jours, et le cache FP8 KV assure que la mémoire de rollout ne dépasse pas le budget.

Hackers anti-récompenses

Les longs cycles de RL peuvent entraîner des raccourcis, donc les actions suspectes sont d'abord filtrées par un filtre de rappel basé sur des règles, puis vérifiées par l'exactitude du juge LLM. Les comportements d'hack confirmés sont interceptés en ligne et répondus par des outils virtuels, permettant ainsi de continuer le rollout plutôt que de l'abandonner. Le PPO basé sur le Critic conserve la trainabilité des sous-traces compressées sur un seul rollout.

Présentation détaillée de chaque modèle GLM, version par version

De 30B au niveau Flash à un contexte de 1 million de tokens de pointe — choisissez un modèle GLM et consultez le tableau complet des spécifications et des données de référence.

Voir tous les modèles GLM →

Scénarios où le modèle GLM excelle dans des cycles longs

Implémentation à grande échelle

Fonctionnalité multi-fichiers au-delà d'une seule fenêtre de contexte : le modèle conserve l'état complet du dépôt à vue, plutôt que de lire à nouveau après quelques tours.

Recherche automatisée

Des cycles d'expériences de plusieurs heures, l'agent doit planifier, exécuter, lire les résultats et corriger - c'est exactement le type de charge de travail que FrontierSWE et PostTrainBench sont conçus pour évaluer.

Optimisation des performances

Besoin d'un graphique de appel complet, des sorties d'analyseurs et de tentatives précédentes pour rester sur la même trajectoire, tout en maintenant le noyau et le système en œuvre.

Débogage complexe

Un suivi de réplique long, des tests instables et des pannes transversales de service, la coupure du contexte est la raison pour laquelle les bugs sont perdus.

Tous ces scénarios peuvent être exécutés sur votre propre matériel - poids MIT, transformers · vLLM · SGLang · xLLM · ktransformers.Comment exécuter localement le modèle GLM →

Questions fréquentes sur le modèle GLM

GLM est une famille de modèles de langage grand open source avec des poids ouverts, le modèle Flagship actuel étant GLM-5.2. La gamme de produits va de GLM-4.5-Air et GLM-4.7 à GLM-5, GLM-5-Turbo, GLM-5.1 et maintenant GLM-5.2, ainsi que des variantes vocales et visuelles. Chaque modèle GLM de base est publié sous licence MIT, avec des poids complètement ouverts.

GLM-5.2 a porté le plafond de 200K à un million de tokens stables, avec une sortie maximale de 128K de tokens. "Stable" est le mot-clé : le modèle a été formé sur des trajectoires d'agents de codage de contexte long, donc la qualité reste constante tout au long de la fenêtre, et non dégradée lorsque le processus devient plus complexe.

Les résultats publiés incluent des scores de Terminal-Bench 2.1 de 81.0, de SWE-bench Pro de 62.1, de FrontierSWE de 74.4, de PostTrainBench de 34.3, de DeepSWE de 46.2, de MCP-Atlas de 76.8 et d'AIME 2026 de 99.2 - le modèle open source le mieux classé dans les trois évaluations à long terme. Consultez le tableau complet ci-dessus.

Il dépend de la tâche. GLM-5.2 est en tête de la course sur FrontierSWE, PostTrainBench et Terminal-Bench 2.1 par rapport à GPT-5.5, et sur presque toutes les lignes de programmation par rapport à Gemini 3.1 Pro, tandis que Claude Opus 4.8 reste en tête sur SWE-bench Pro, NL2Repo et SWE-Marathon. Sous le cadre Claude Code, GLM-5.2 obtient 82.7, et Opus 4.8 78.9. Pour une comparaison détaillée de chaque modèle GLM, voir ci-dessous - ou essayez gratuitement l'expérience AI Ground.

Ils contrôlent la quantité de ressources de calcul que le modèle consomme pour chaque tâche. Sur l'évaluation AgentProgramming, les courbes rapportées sont d'environ 63% (~35K tokens de sortie, Non-Thinking), 72% (~43K, Haut) et 74% (~83K, Highest). Haut est le choix pratique par défaut ; Highest est utilisé pour des problèmes à long terme vraiment difficiles.

Oui. Les poids du modèle GLM de base sont sous licence MIT, sans restriction géographique, et sont disponibles sur HuggingFace et ModelScope. Il est possible de réaliser des raisonnements locaux via transformers, vLLM, SGLang, xLLM et ktransformers, et vous pouvez exécuter le modèle GLM sur votre propre matériel.

IndexShare permet à chaque quatre couches d'attention sparse de partager un LightweightIndexer, dont l'index top-k est calculé une seule fois et réutilisé. Cela élimine le travail de l'Indexer dans trois quarts des couches, réduisant les FLOPs par token de 2.9 fois à une longueur de contexte de million de tokens - une modification clé permettant la faisabilité des fenêtres de contexte de million de tokens au niveau du service.

Modèle de grande langue open-source gratuit fourni par OpenRouter — ni GLM-5.2, ni utilisation de poids GLM. Son existence vise à vous permettre de tester immédiatement le modèle en temps réel lors de la lecture des données de modèle GLM publiées. Tous les données de base GLM de ce site sont les résultats rapportés par les auteurs du modèle, et non les résultats mesurés ici.

Expérience gratuite du modèle AI en temps réel — sans compte

Lisez le Modèle GLM de test de base, puis laissez le modèle réel commencer à travailler. Le terrain d'expérience en haut est gratuit et n'exige aucune information ; si vous souhaitez un kit d'outils AI plus complet, le forfait gratuit des partenaires commence ici.