GLM-5.3 ist das Flaggschiff-Open-Source-GLM-AI-Modell — das leistungsfähigste Open-Weights-Modell für Coding mit einem stabilen Kontext von einer Million Tokens. Es erreichte 88,2 auf Terminal-Bench 2.1, 78,1 auf FrontierSWE und einen Spitzenwert von 84,5 auf CyberGym für die Schwachstellenentdeckung. Unten können Sie jede GLM-Version vergleichen — oder erleben Sie zunächst den kostenlosen AI-Sandbox.
Keine Registrierung erforderlich, kein Konto erforderlich, keine Quote erforderlich. Echtzeit-Streaming-Antworten können erhalten werden, indem Prompt-Wörter eingegeben werden.
Die Antwort wird hier gestreamt...
Dieses Erlebnis verwendet das GLM-große Sprachmodell, und Echtzeit-Streaming-Antworten können durch Eingabe von Prompt-Wörtern erhalten werden.
Vier Fähigkeiten definieren die aktuelle Generation der Modelle — alle gemeldet von den Modellautoren und reproduzierbar aus offenen Rechten.
Ein Kontext von einer Million Tokens ist nicht nur verfügbar, sondern auch qualitativ hochwertig: Der GLM-5.3 überträgt das Training auf lange Kontext-Coding-Agenten-Trace wie groß angelegte Implementierung, automatisierte Forschung und komplexe Debugging.
State of the art auf CyberGym (84,5) für die Schwachstellenentdeckung. In real-world testing identifizierte es 2.436 Schwachstellen in 269 Open-Source-Projekten — das älteste datiert zurück bis 1981.
Jede vier sparsame Aufmerksamkeitslayer teilen sich einen leichten Indexer, was die FLOPs pro Token um 2,9-mal reduziert, unter einer Kontextlänge von einer Million, ohne dabei die Qualität über große Distanzen zu verlieren.
Open-Source-Modelle unter der MIT-Lizenz: Gewichte werden auf HuggingFace und ModelScope veröffentlicht, ohne regionale Beschränkungen und unterstützen lokale Deployment über transformers, vLLM, SGLang, xLLM und ktransformers.
Alle folgenden Daten sind die Ergebnisse von GLM-5.3 und vergleichbaren Modellen, die von den Modellautoren veröffentlicht wurden. glmmodel.net stellt nur Berichte zur Verfügung und führt diese Evaluierungen nicht durch.
Die Dauer der Aufgabe kann 20 Stunden erreichen
Bis zu 10 Stunden auf einer einzigen H100 Karte
Ultralanger Zyklus Software Engineering, bis zu 10 Stunden
Across these long-horizon benchmarks, GLM-5.3 ist das bestplatzierte Open-Source-Modell — Beweis dafür, dass sein Millionen-Token-Kontext in echten Output umgesetzt wird. Es verbessert sich von 4.6 auf 28.3 auf Terminal-Bench 3.0, von 46.2 auf 66.9 auf DeepSWE v1.1 und verdoppelt GLM-5.2 auf Ausbeutungsbenchmarks — jeder Gewinn kommt aus der Post-Training auf dem gleichen Basismodell.
Veröffentlichte Modell-Benchmark-Ergebnisse, umfassend 16 Bewertungen von 8 Modellen.
| Benchmark-Test | GLM-5.3 | GLM-5.2 | Kimi K3 | DeepSeek-V4 Pro | Qwen3.8-Max | Claude Opus 4.8 | Fable 5* | GPT-5.6 Sol |
|---|---|---|---|---|---|---|---|---|
| Codierung | ||||||||
| Terminal-Bench 2.1 | 88.2 | 81.0 | 88.3 | 87.9 | 86.6 | 85.0 | 88.0 | 88.8 |
| Terminal-Bench 3.0 | 28.3 | 4.6 | 17.4 | – | – | 21.1 | 33.7 | 34.6 |
| DeepSWE v1.1 | 66.9 | 46.2 | 67.5 | 62.7 | 56.6 | 58.0 | 69.7 | 72.7 |
| NL2Repo | 58.0 | 48.9 | 58.0 | 61.1 | 55.9 | 69.7 | – | – |
| ProgramBench (Almost Solved) | 19.0 | 9.5 | 17.5 | – | 10.5 | 15.5 | 33.0 | 23.0 |
| FrontierSWE | 78.1 | 67.5 | – | – | – | 66.5 | 88.2 | – |
| SWE-Marathon v1.1 | 42.5 | 19.4 | 48.1 | – | – | 48.8 | 33.1 | 42.5 |
| PostTrainBench | 39.8 | 31.7 | 32.0 | – | – | 32.9 | 41.8 | 36.2 |
| Cyber | ||||||||
| CyberGym | 84.5 | 77.2 | 80.0 | 83.3 | 78.5 | 78.1 | 83.8 | 83.6 |
| ExploitGym (2h / 6h) | 105 / 130 | 29 / 39 | 36 / 70 | – | 14 / 26 | 80 / 120 | 181 / 247 | 216 / 293 |
| ExploitBench | 54.4 | 24.4 | 32.2 | – | 28.8 | 40.0 | 78.0 | 76.5 |
| Agent | ||||||||
| Toolathlon Verified | 73.0 | 59.9 | 76.5 | 74.1 | 72.5 | 76.2 | 74.7 | 74.9 |
| AutomationBench v1.0.6 | 48.2 | 26.2 | 46.7 | 43.2 | 39.8 | 41.0 | 46.2 | 45.8 |
| Agents' Last Exam (ALE-CLI) | 28.5 | 23.8 | 27.6 | 25.7 | 27.0 | 25.7 | 23.8 | 28.6 |
| HLE (With Tools) | 62.5 | 54.7 | 59.8 | 60.0 | 56.2 | 57.9 | 63.9 | 64.5 |
| GDPval-AA v2 | 1769 | 1508 | 1682 | 1590 | 1739 | 1588 | 1743 | 1730 |
* Fable 5-Ergebnisse werden mit Fallback gemeldet. Alle Daten sind Ergebnisse, die von den Modellautoren veröffentlicht wurden.
GLM-5.3 denkt immer, auf drei Intensitätsstufen. Die Anstrengungssteuerung lässt Sie nur dann Rechenleistung verbrauchen, wenn die Aufgabe es erfordert — GLM-5.3 schlägt GLM-5.2 auf jedem Anstrengungslevel, verbraucht dabei jedoch weniger Ausgabetokens.
leichtgewichtiges Reasoning
Szenarien, in denen Latenz wichtiger ist als Tiefe, wie z.B. schnelle Bearbeitung, Vorlagencode und Routine-Refactoring – GLM-5.3 deaktiviert das Denken nicht mehr, daher bleibt leichte Abstraktion standardmäßig aktiviert.
~50K durchschnittliche Tokens
Standard für die meisten Agentencodierung: Bei hohem Aufwand erreicht GLM-5.3 31,4% mit etwa 50K Ausgabetokens, übertrifft Claude Opus 4.8 (29,5% bei 120K).
~75K durchschnittliche Tokens
Schwierigste langfristige Probleme: 34,5% bei etwa 75K Ausgangstokens, im Vergleich zu 23,4% bei 96K für GLM-5.2 — mehr Ergebnisse mit weniger Tokens.
Daten von Z.ai Code Bench v1.0, einem internen Benchmark, der Coding-Agenten in realistischen lokalen Entwicklungs-Umgebungen bewertet, indem er die End-to-End-Aufgabenabwicklung bei kontrollierten Arbeitsstufen misst. Berichtet von den Modellautoren. GLM-5.3 verbessert sowohl die Leistung als auch die Token-Effizienz über GLM-5.2 auf jeder Arbeitsstufe hinweg.
Erhöhung des Kontextlimits von 200K auf eine Million Tokens ist ein ingenieurtechnisches Problem und nicht ein Konfigurationsparameter. Drei Modifikationen sind entscheidend.
Jede vier Transformer-Schicht teilt sich einen leichten Indexer. Er befindet sich bei der ersten Schicht unter den vier und sein top-k Index wird von den anderen drei Schichten wiederverwendet – was das Dot-Produkt und die top-k-Berechnung in drei Vierteln der Schichten eliminiert. Ergebnis: Die FLOPs jedes Tokens wird unter einer Kontextlänge von einer Million um 2,9 Mal reduziert. IndexShare wurde ab der Sequenzlänge von 128K während der Trainingsmitte eingeführt.
Das Multitoken-Vorhersage-Layer führt den Indexer im ersten Entwurfsschritt einmal aus und verwendet ihn in den folgenden Schritten wieder, was das Missverhältnis zwischen dem Training/Inferenz KV-Cache der vorherigen Generation beseitigt. Kombiniert mit Ablehnungssampling und End-to-End TV-Verlust steigt die akzeptierte Länge von 4.56 auf 5.47 – etwa 20% – über 7 MTP-Schritte hinweg.
| Basis | 4.56 |
| + IndexShare + KVShare | 5.10 |
| + Ablehnungs-Sampling | 5.29 |
| + End-to-End TV Loss | 5.47 (+20%) |
Nach mehr als einigen Zehntausend Tokens liegt das Bottleneck nicht mehr in der Berechnung, sondern in der KV-Cache-Kapazität, dem langen Kontextkern und dem CPU-Overhead. Drei Lösungen: feingranulare Speicherverwaltung und Parallelisierung basierend auf LayerSplit, Kerneoptimierung für Kontextlänge mit Koordination der Cache-Transfer-Pipeline und CPU-seitige Cache-Verwaltung, Anfragenplanung und Laufzeitpfadoptimierung. Der Durchsatzvorteil wächst mit dem Anwachsen des Kontexts.
Normalisierte Durchsatzvorteil
Der Trainingsstack (slime) kombiniert Weißbox- und Schwarzbox-Rollouts, komprimierte Trajekturen und Sub-Agent-Workflows. Paralleler OPD-Training vereint mehr als ein Dutzend Expertenmodelle in etwa zwei Tagen, und FP8 KV-Caching hält die Rollout-Memory im Budget. Durch GLM-5.3 verbesserten systemweite Optimierungen den End-to-End-RL-Trainingsdurchsatz um mehr als 2,3×.
Langfristiges RL kann Abkürzungen veranlassen, daher werden verdächtige Aktionen zunächst durch einen regelbasierten Rücksprache-Filter geleitet und dann durch den LLM-Richter auf Genauigkeit überprüft. Bestätigte bösartige Aktionen werden online abgefangen und mit virtuellen Werkzeugergebnissen beantwortet, sodass Rollouts fortgesetzt werden können, anstatt verworfen zu werden. Basierend auf Critic's PPO werden komprimierbare Sub-Traces für das Training auf einer einzigen Rollout beibehalten.
Von der 30B Flash-Ebene bis zum Flaggschiff mit einer Million Kontexten — wählen Sie ein Modell aus, um die vollständige Spezifikationstabelle und die Benchmark-Daten anzuzeigen.
Das leistungsfähigste offene-Weights-Modell für Coding: +50% auf Z.ai Code Bench, Open-Source SOTA auf Terminal-Bench 3.0 und Agents' Last Exam, State of the Art auf CyberGym.
Erster nativer multimodaler GLM-5-Modell: 320B Gesamt / 18B aktive Parameter, hybride Aufmerksamkeit, 1M Kontext — Leistung übertrifft GLM-5.2 zum Zehntel des Preises.
Vorzugmodell der Vorabgeneration: eine Million Token-Kontext und die langfristige Grundlage, auf der das GLM-5.3 nach der Schulung aufbaut.
Langfristiger Spezialist: signifikant verbesserte langfristige Fähigkeiten und ingenieurliche Ausgaben, die autonom mehrere Stunden arbeiten können.
Stärkere Programmierfähigkeiten, zuverlässigere mehrstufige Ausführung und besseres Verhalten komplexer Agenten.
Basismodell, optimiert für lange Ketten und Szenarien dynamischer intelligenter Agenten.
Erweiterte Programmierfähigkeiten, stabile mehrstufige Inferenz und verbesserte Frontend-Generierung.
300 Milliarden Parameter; hohe Effizienz und Leistung, führend unter Modellen gleicher Größe.
Mehrdateifunktion über ein einzelnes Kontextfenster hinaus: Das Modell behält den gesamten Repository-Zustand im Blick, anstatt ihn in einigen Runden neu zu lesen.
Mehrere Stunden experimenteller Zyklen, Agenten müssen planen, ausführen, Ergebnisse lesen und korrigieren – dies ist genau die Arbeitsbelastung, die von FrontierSWE und PostTrainBench bewertet werden soll.
Komplette Anrufdiagramme, Analysetools und das Aufrechterhalten der Kernebene und des Systems auf derselben Spur wie frühere Versuche sind erforderlich.
Langfristige Reproduzierbarkeitserfassung, instabile Tests und Querserviceausfälle; das Kürzen des Kontexts ist der Grund für den Verlust von Fehlern.
Alle oben genannten Szenarien können auf Ihrer eigenen Hardware ausgeführt werden — MIT-Gewichte, Transformers · vLLM · SGLang · xLLM · ktransformers.Wie wird das Modell lokal ausgeführt →
Lesen Sie die Benchmark-Tests des Modells und lassen Sie dann das reale Modell arbeiten. Der obige Sandbox ist kostenlos und erfordert keine Informationen; möchten Sie ein umfassenderes AI-Toolkit, beginnt das kostenlose Paket der Partner hier.