GLM-5.2 ist die Flaggschiff-Open-Source-GLM-AI-Modelle: Stabile eine Million Token-Kontexte, nicht nachdenklich / hoch / höchste drei Stufen der Nachdenklichkeit, meldet auf Terminal-Bench 2.1 81.0 Punkte, auf FrontierSWE 74.4 Punkte. Unten können Sie jede GLM-Modelle vergleichen – oder erstmalig ein kostenfreies AI-Erlebnis nutzen.
Keine Registrierung erforderlich, kein Konto, kein Limit. Geben Sie den Eingabetext ein, um eine Stream-Antwort zu erhalten.
Die Antwort wird hier als Stream ausgegeben...
Diese Demo verwendet den großen Sprachmodell GLM und bietet eine Echtzeit-Stream-Antwort, indem Sie den Eingabetext eingeben.
Vier Fähigkeiten definieren die aktuelle Generation von GLM-Modellen - alle von den Modellautoren berichtet und aus der Öffentlichkeit nachvollziehbar.
Eine Million Token-Kontexte sind nicht nur verfügbar, sondern auch von hoher Qualität: GLM-5.2 wurde auf großen Implementierungen, Automatisierungsstudien und komplexen Debugging in langen Kontext- Agenten-Tracken trainiert.
Nicht nachdenklich, hoch und höchst drei Stufen lassen Sie zwischen Verzögerung und Fähigkeit abwägen – in der Agenten-Programmierungsevaluation etwa 63% (~35K Ausgabetoken) bis 74% (~83K).
Jede vier Sparse Attention-Schicht teilt einen leichten Indexer, was die FLOPs pro Token um das 2,9-fache reduziert und die Qualität über lange Distanzen erhalten bleibt, wenn die Kontextlänge auf eine Million Token erhöht wird.
Open-Source-GLM-Modelle unter der MIT-Lizenz: Gewichte veröffentlicht auf HuggingFace und ModelScope, ohne geografische Beschränkungen, unterstützen lokale Deployment durch transformers, vLLM, SGLang, xLLM und ktransformers.
Alle folgenden Daten sind Ergebnisse von GLM-5.2 und Vergleichsmodellen, die von den Modellautoren veröffentlicht wurden. glmmodel.net führt nur Berichte durch und führt diese Bewertungen nicht selbst durch.
Task duration up to 20 hours
Up to 10 hours on a single H100
Ultra-long cycle software engineering, up to 10 hours
In allen drei langfristigen Benchmark-Tests ist GLM-5.2 das führende Open-Source-Modell – was zeigt, dass seine Millionen Kontexte in tatsächliche Ergebnisse umgesetzt werden können, und nicht nur akzeptable Token-Zahlen. Auf FrontierSWE liegt GLM-5.2 nur einen Punkt hinter Opus 4.8 zurück, einen Punkt vor GPT-5.5 und elf Punkte vor der vorherigen Generation Opus 4.7.
Veröffentlichte Benchmark-Ergebnisse von GLM-Modellen, die 17 Bewertungen für 8 Modelle umfassen.
| Basisprüfungen | GLM-5.2 | GLM-5.1 | Qwen3.7-Max | MiniMax M3 | DeepSeek-V4-Pro | Claude Opus 4.8 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|---|---|---|---|
| Deduktion | ||||||||
| HLE | 40.5 | 31.0 | 41.4 | 37.0 | 37.7 | 49.8* | 41.4* | 45.0 |
| HLE (mit Werkzeugen) | 54.7 | 52.3 | 53.5 | – | 48.2 | 57.9* | 52.2* | 51.4* |
| CritPt | 20.9 | 4.6 | 13.4 | 3.7 | 12.9 | 20.9 | 27.1 | 17.7 |
| AIME 2026 | 99.2 | 95.3 | 97.0 | – | 94.6 | 95.7 | 98.3 | 98.2 |
| HMMT November 2025 | 94.4 | 94.0 | 95.0 | 84.4 | 94.4 | 96.5 | 96.5 | 94.8 |
| HMMT Februar 2026 | 92.5 | 82.6 | 97.1 | 84.4 | 95.2 | 96.7 | 96.7 | 87.3 |
| IMOAnswerBench | 91.0 | 83.8 | 90.0 | – | 89.8 | 83.5 | – | 81.0 |
| GPQA-Diamond | 91.2 | 86.2 | 90.0 | 93.0 | 90.1 | 93.6 | 93.6 | 94.3 |
| Programmieren | ||||||||
| SWE-bench Pro | 62.1 | 58.4 | 60.6 | 59.0 | 55.4 | 69.2 | 58.6 | 54.2 |
| NL2Repo | 48.9 | 42.7 | 47.2 | 42.1 | 35.5 | 69.7 | 50.7 | 33.4 |
| DeepSWE | 46.2 | 18.0 | 18.0 | 20.0 | 8.0 | 58.0 | 70.0 | 10.0 |
| ProgramBench | 63.7 | 50.9 | – | – | 47.8 | 71.9 | 70.8 | 39.5 |
| Terminal-Bench 2.1 (Terminus-2) | 81.0 | 63.5 | 75.0 | 65.0 | 64.0 | 85.0 | 84.0 | 74.0 |
| Terminal-Bench 2.1 (Beste Frameworks) | 82.7 (Claude Code) | 69.0 (Claude Code) | – | – | – | 78.9 (Claude Code) | 83.4 (Codex) | 70.7 (Gemini CLI) |
| FrontierSWE Dominance | 74.4 | 30.5 | – | – | 29.0 | 75.1 | 72.6 | 39.6 |
| PostTrainBench | 34.3 | 20.1 | – | – | – | 37.2 | 28.4 | 21.6 |
| SWE-Marathon | 13.0 | 1.0 | – | – | – | 26.0 | 12.0 | 4.0 |
| Intelligenzagent | ||||||||
| MCP-Atlas (Public Dataset) | 76.8 | 71.8 | 76.4 | 74.2 | 73.6 | 77.8 | 75.3 | 69.2 |
| Tool-Decathlon | 48.2 | 40.7 | – | – | 52.8 | 59.9 | 55.6 | 48.8 |
* Scores on the complete dataset.
GLM-Modelle haben nicht nur eine Geschwindigkeit. Die Kraftkontrolle ermöglicht es Ihnen, nur dann mehr Rechenressourcen zu分配, wenn es notwendig ist.
~35K average token
Schnelle Bearbeitung, Mustercode, allgemeine Refaktorierung und andere Szenarien, in denen Verzögerung wichtiger ist als Tiefe.
~43K average token
Standardwahl für die meisten Agenten-Programmierung: Mit etwa der Hälfte der Tokenverbrauch nahe der höchsten Qualität.
~83K average token
Schwere langfristige Probleme - zusätzliche Rechenressourcen nur dann zuweisen, wenn der Task tatsächlich erforderlich ist.
Die Daten stammen aus dem Durchschnitt von Terminal-Bench 2.1, DeepSWE und SWE-Atlas QnA, bewertet auf Claude Code 2.1.167. Berichtet von den Modellautoren. Unter ähnlichen Token-Budgets liegt die Leistung von GLM-5.2 zwischen Claude Opus 4.7 und Opus 4.8.
Die Erhöhung des Kontextlimits von 200K auf eine Million Tokens ist ein ingenieurtechnisches Problem und keine Konfigurationsparameter. Drei Änderungen sind entscheidend.
Jede vier Transformer-Schicht teilt sich einen leichten Indexer. Er befindet sich in der ersten Schicht der vier und seine top-k-Indizes werden von den übrigen drei Schichten wiederverwendet – was den Indexer-Punktprodukt und die top-k-Berechnung in einem Viertel der Schichten eliminiert. Ergebnis: Jeder Token hat unter einer Million Kontextlänge um 2,9-mal weniger FLOPs. IndexShare wurde ab der Mitte des Trainings mit einer Sequenzlänge von 128K eingeführt.
Die Multi-Token-Vorhersage-Schichten führen den Indexer in der ersten Schreibphase aus und wiederholen ihn in den folgenden Schritten, was die Anpassung des KV-Caches zwischen Training und Inferenz des Vorjahres eliminiert. In Kombination mit der Ablehnung von Sampling und End-to-End TV-Loss steigt die akzeptierte Länge von 4.56 auf 5.47 – etwa 20% – über 7 MTP-Schritte hinweg.
| Referenzlinie | 4.56 |
| + IndexShare + KVShare | 5.10 |
| + Abweisung der Stichprobe | 5.29 |
| + End-to-End TV-Verlust | 5.47 (+20%) |
Nach mehr als einigen hunderttausend Token wird das Bottleneck nicht mehr die Berechnung, sondern die KV-Cache-Kapazität, das lange Kontextkern und die CPU-Ausgaben. Drei Reparaturen: Feingranularer Speichermanagement und Parallelisierung basierend auf LayerSplit, Optimierung des Kontextlänge-Skalierungskerns, der mit dem Cache-Übertragungspipeline abgestimmt ist, sowie CPU-seitige Cache-Management, Anforderungsscheduling und Laufzeitpfad-Optimierung. Der Durchsatzvorteil wächst mit dem Kontext.
Normalisierte Durchsatzvorteile
Der Trainingsstapel (slime) kombiniert White-Box- und Black-Box-Rollouts, komprimierte Spuren und Sub-Agenten-Workflows. Parallel OPD-Training kombiniert in etwa zwei Tagen mehr als ein Dutzend Expertenmodelle, FP8 KV-Cache stellt sicher, dass der Rollout-Speicher innerhalb des Budgets bleibt.
Langfristige RL kann kürzliche Wege erzeugen, daher werden verdächtige Aktionen zunächst durch einen regelbasierten Recall-Filter geleitet und dann durch eine präzise Überprüfung der Genauigkeit durch LLM beurteilt. Bestätigte Hacker-Aktionen werden online abgefangen und mit virtuellen Tool-Ergebnissen beantwortet, so dass der Rollout fortgesetzt werden kann, anstatt abgebrochen zu werden. Critic-basierte PPO hält die Trainierbarkeit der komprimierten Subtrajectoren auf einem Rollout aufrecht.
Von 30B Flash-Level bis hin zu Millionen Kontexttoken - wählen Sie ein GLM-Modell und betrachten Sie die vollständige Spezifikationsliste und die Benchmark-Daten.
Eine Million Token Kontext, Open-Source SOTA für Programmierung und lange Zeiträume, stärkere Ingenieurkommunikationsfähigkeiten.
Vorgängergeneration Flaggschiff: signifikante Verbesserung der langen Zeiträume und engineering-level Output für mehrere Stunden.
Stärkere Programmierungsfähigkeiten, zuverlässigere mehrstufige Ausführung und bessere komplexe Agentenverhalten.
Basismodell, optimiert für lange Ketten und dynamische intelligente Agenten-Szenarien.
Erweiterte Programmierfähigkeiten, stabile mehrstufige Inferenz und verbesserte Frontend-Generierung.
300 Milliarden Parameter; hocheffizient und leistungsstark, führend unter den Modellen gleicher Größe im Open-Source-Bereich.
Kompakter GLM-Modell, hervorragende Leistung pro Einheit Rechenleistung.
Realzeitige Sprach-zu-Text-erkennung, CER bis zu 0.0717.
Überwinden Sie die Funktion mehrerer Dateien, die über einen einzigen Kontextfenster hinausgehen: Das Modell hält den gesamten Repository-Status im Auge, anstatt nach einigen Runden neu zu lesen.
Stundenlange Experimentierzyklen, Agenten müssen planen, ausführen, Ergebnisse lesen und korrigieren – das ist genau das, was FrontierSWE und PostTrainBench entworfen wurden, um zu bewerten.
Benötigt eine vollständige Aufrufgraphik, Analyserausgaben und das Halten der Kerne und Systeme auf derselben Spur in vorherigen Versuchen.
Lange Nachverfolgung von Wiederherstellungen, instabile Tests und Querschnittsfehler - das Kürzen des Kontexts ist der Grund für den Verlust von Bugs.
Alle diese Szenarien können auf Ihrer eigenen Hardware ausgeführt werden – MIT-Gewichte, transformers · vLLM · SGLang · xLLM · ktransformers.How to run the GLM model locally →
Lesen Sie die GLM-Modell-Benchmark-Tests und lassen Sie dann die echten Modelle arbeiten. Der Erfahrungsort oben ist kostenlos und erfordert keine Informationen; Wenn Sie ein vollständigeres AI-Toolset wünschen, beginnt der kostenlose Paket der Partner hier.