GLMMODEL — Open-Source-AI für langfristige Aufgaben mit einer Million Kontexten

GLM-5.3 ist das Flaggschiff-Open-Source-GLM-AI-Modell — das leistungsfähigste Open-Weights-Modell für Coding mit einem stabilen Kontext von einer Million Tokens. Es erreichte 88,2 auf Terminal-Bench 2.1, 78,1 auf FrontierSWE und einen Spitzenwert von 84,5 auf CyberGym für die Schwachstellenentdeckung. Unten können Sie jede GLM-Version vergleichen — oder erleben Sie zunächst den kostenlosen AI-Sandbox.

1M
Token-Kontext
Verbessert von 200K, Stabilität unter Agentenlast beibehalten
88.2
Terminal-Bench 2.1
GLM-5.3 Bewertungen, eine Verbesserung gegenüber den 81,0 von GLM-5.2.
MIT
Open Source Lizenz
Offene Gewichte, keine geografischen Einschränkungen

Kostenlose AI-Erfahrungszentrum — Erleben Sie Echtzeit-Open-Source-große Sprachmodelle

Keine Registrierung erforderlich, kein Konto erforderlich, keine Quote erforderlich. Echtzeit-Streaming-Antworten können erhalten werden, indem Prompt-Wörter eingegeben werden.

Die Antwort wird hier gestreamt...

Dieses Erlebnis verwendet das GLM-große Sprachmodell, und Echtzeit-Streaming-Antworten können durch Eingabe von Prompt-Wörtern erhalten werden.

Kernfunktionen der GLMMODEL-Familie

Vier Fähigkeiten definieren die aktuelle Generation der Modelle — alle gemeldet von den Modellautoren und reproduzierbar aus offenen Rechten.

Stabile Millionen Kontexte

Ein Kontext von einer Million Tokens ist nicht nur verfügbar, sondern auch qualitativ hochwertig: Der GLM-5.3 überträgt das Training auf lange Kontext-Coding-Agenten-Trace wie groß angelegte Implementierung, automatisierte Forschung und komplexe Debugging.

Emergente Cyberspezialfähigkeit

State of the art auf CyberGym (84,5) für die Schwachstellenentdeckung. In real-world testing identifizierte es 2.436 Schwachstellen in 269 Open-Source-Projekten — das älteste datiert zurück bis 1981.

IndexShare-Architektur

Jede vier sparsame Aufmerksamkeitslayer teilen sich einen leichten Indexer, was die FLOPs pro Token um 2,9-mal reduziert, unter einer Kontextlänge von einer Million, ohne dabei die Qualität über große Distanzen zu verlieren.

MIT Open Source Gewichte

Open-Source-Modelle unter der MIT-Lizenz: Gewichte werden auf HuggingFace und ModelScope veröffentlicht, ohne regionale Beschränkungen und unterstützen lokale Deployment über transformers, vLLM, SGLang, xLLM und ktransformers.

GLM-5.3 Benchmark Test: Coding, Agents & Cyber

Alle folgenden Daten sind die Ergebnisse von GLM-5.3 und vergleichbaren Modellen, die von den Modellautoren veröffentlicht wurden. glmmodel.net stellt nur Berichte zur Verfügung und führt diese Evaluierungen nicht durch.

Open-Source SOTA
78.1%

FrontierSWE

Die Dauer der Aufgabe kann 20 Stunden erreichen

GLM-5.378.1
Fable 588.2
Opus 4.866.5
GLM-5.267.5
Beats Opus 4.8 & GPT-5.6
39.8%

PostTrainBench

Bis zu 10 Stunden auf einer einzigen H100 Karte

GLM-5.339.8
Fable 541.8
GPT-5.6 Sol36.2
Opus 4.832.9
2.2× over GLM-5.2
42.5%

SWE-Marathon

Ultralanger Zyklus Software Engineering, bis zu 10 Stunden

GLM-5.342.5
Opus 4.848.8
Kimi K348.1
GLM-5.219.4

Across these long-horizon benchmarks, GLM-5.3 ist das bestplatzierte Open-Source-Modell — Beweis dafür, dass sein Millionen-Token-Kontext in echten Output umgesetzt wird. Es verbessert sich von 4.6 auf 28.3 auf Terminal-Bench 3.0, von 46.2 auf 66.9 auf DeepSWE v1.1 und verdoppelt GLM-5.2 auf Ausbeutungsbenchmarks — jeder Gewinn kommt aus der Post-Training auf dem gleichen Basismodell.

Terminal-Bench 2.1+7.2
GLM-5.388.2
GPT-5.6 Sol88.8
Kimi K388.3
GLM-5.281.0
Terminal-Bench 3.0+23.7 (6.2×)
GLM-5.328.3
GPT-5.6 Sol34.6
Fable 533.7
GLM-5.24.6
NL2Repo+9.1
GLM-5.358.0
Opus 4.869.7
DeepSeek-V4 Pro61.1
GLM-5.248.9
DeepSWE v1.1+20.7 (1.4×)
GLM-5.366.9
GPT-5.6 Sol72.7
Kimi K367.5
GLM-5.246.2
ProgramBench (Solved)+9.5 (2.0×)
GLM-5.319.0
Fable 533.0
GPT-5.6 Sol23.0
GLM-5.29.5
Toolathlon Verified+13.1
GLM-5.373.0
Kimi K376.5
Opus 4.876.2
GLM-5.259.9
AutomationBench+22.0 (1.8×)
GLM-5.348.2
Kimi K346.7
GPT-5.6 Sol45.8
GLM-5.226.2
HLE (With Tools)+7.8
GLM-5.362.5
GPT-5.6 Sol64.5
Fable 563.9
GLM-5.254.7

Modell-Scores in 16 Benchmark-Tests

Veröffentlichte Modell-Benchmark-Ergebnisse, umfassend 16 Bewertungen von 8 Modellen.

Veröffentlichte Modell-Benchmark-Ergebnisse, umfassend jede Bewertung und jedes Modell
Benchmark-TestGLM-5.3GLM-5.2Kimi K3DeepSeek-V4 ProQwen3.8-MaxClaude Opus 4.8Fable 5*GPT-5.6 Sol
Codierung
Terminal-Bench 2.188.281.088.387.986.685.088.088.8
Terminal-Bench 3.028.34.617.421.133.734.6
DeepSWE v1.166.946.267.562.756.658.069.772.7
NL2Repo58.048.958.061.155.969.7
ProgramBench (Almost Solved)19.09.517.510.515.533.023.0
FrontierSWE78.167.566.588.2
SWE-Marathon v1.142.519.448.148.833.142.5
PostTrainBench39.831.732.032.941.836.2
Cyber
CyberGym84.577.280.083.378.578.183.883.6
ExploitGym (2h / 6h)105 / 13029 / 3936 / 7014 / 2680 / 120181 / 247216 / 293
ExploitBench54.424.432.228.840.078.076.5
Agent
Toolathlon Verified73.059.976.574.172.576.274.774.9
AutomationBench v1.0.648.226.246.743.239.841.046.245.8
Agents' Last Exam (ALE-CLI)28.523.827.625.727.025.723.828.6
HLE (With Tools)62.554.759.860.056.257.963.964.5
GDPval-AA v217691508168215901739158817431730

* Fable 5-Ergebnisse werden mit Fallback gemeldet. Alle Daten sind Ergebnisse, die von den Modellautoren veröffentlicht wurden.

Anstrengung des Reasonings: niedrig, hoch und max

GLM-5.3 denkt immer, auf drei Intensitätsstufen. Die Anstrengungssteuerung lässt Sie nur dann Rechenleistung verbrauchen, wenn die Aufgabe es erfordert — GLM-5.3 schlägt GLM-5.2 auf jedem Anstrengungslevel, verbraucht dabei jedoch weniger Ausgabetokens.

Niedrig

Schnell

leichtgewichtiges Reasoning

Szenarien, in denen Latenz wichtiger ist als Tiefe, wie z.B. schnelle Bearbeitung, Vorlagencode und Routine-Refactoring – GLM-5.3 deaktiviert das Denken nicht mehr, daher bleibt leichte Abstraktion standardmäßig aktiviert.

Am häufigsten

Hoch

31.4%

~50K durchschnittliche Tokens

Standard für die meisten Agentencodierung: Bei hohem Aufwand erreicht GLM-5.3 31,4% mit etwa 50K Ausgabetokens, übertrifft Claude Opus 4.8 (29,5% bei 120K).

Max

34.5%

~75K durchschnittliche Tokens

Schwierigste langfristige Probleme: 34,5% bei etwa 75K Ausgangstokens, im Vergleich zu 23,4% bei 96K für GLM-5.2 — mehr Ergebnisse mit weniger Tokens.

Daten von Z.ai Code Bench v1.0, einem internen Benchmark, der Coding-Agenten in realistischen lokalen Entwicklungs-Umgebungen bewertet, indem er die End-to-End-Aufgabenabwicklung bei kontrollierten Arbeitsstufen misst. Berichtet von den Modellautoren. GLM-5.3 verbessert sowohl die Leistung als auch die Token-Effizienz über GLM-5.2 auf jeder Arbeitsstufe hinweg.

Wie erreicht das Modell eine Million Kontexte?

Erhöhung des Kontextlimits von 200K auf eine Million Tokens ist ein ingenieurtechnisches Problem und nicht ein Konfigurationsparameter. Drei Modifikationen sind entscheidend.

IndexShare sparse attention

Jede vier Transformer-Schicht teilt sich einen leichten Indexer. Er befindet sich bei der ersten Schicht unter den vier und sein top-k Index wird von den anderen drei Schichten wiederverwendet – was das Dot-Produkt und die top-k-Berechnung in drei Vierteln der Schichten eliminiert. Ergebnis: Die FLOPs jedes Tokens wird unter einer Kontextlänge von einer Million um 2,9 Mal reduziert. IndexShare wurde ab der Sequenzlänge von 128K während der Trainingsmitte eingeführt.

GLMMODEL Layer-Sharing und IndexShare Layer N+3 Layer N+2 Layer N+1 Schicht N Gemeinsam Indexer

MTP kombiniert mit IndexShare und KVShare

Das Multitoken-Vorhersage-Layer führt den Indexer im ersten Entwurfsschritt einmal aus und verwendet ihn in den folgenden Schritten wieder, was das Missverhältnis zwischen dem Training/Inferenz KV-Cache der vorherigen Generation beseitigt. Kombiniert mit Ablehnungssampling und End-to-End TV-Verlust steigt die akzeptierte Länge von 4.56 auf 5.47 – etwa 20% – über 7 MTP-Schritte hinweg.

MTP-Akzeptanzlänge-Ablationsversuch
Basis4.56
+ IndexShare + KVShare5.10
+ Ablehnungs-Sampling5.29
+ End-to-End TV Loss5.47 (+20%)

Effizienter Service für Millionen Kontexte

Nach mehr als einigen Zehntausend Tokens liegt das Bottleneck nicht mehr in der Berechnung, sondern in der KV-Cache-Kapazität, dem langen Kontextkern und dem CPU-Overhead. Drei Lösungen: feingranulare Speicherverwaltung und Parallelisierung basierend auf LayerSplit, Kerneoptimierung für Kontextlänge mit Koordination der Cache-Transfer-Pipeline und CPU-seitige Cache-Verwaltung, Anfragenplanung und Laufzeitpfadoptimierung. Der Durchsatzvorteil wächst mit dem Anwachsen des Kontexts.

Normalisierte Durchsatzvorteil

Agenten-Training mit Verstärkungslernen

Der Trainingsstack (slime) kombiniert Weißbox- und Schwarzbox-Rollouts, komprimierte Trajekturen und Sub-Agent-Workflows. Paralleler OPD-Training vereint mehr als ein Dutzend Expertenmodelle in etwa zwei Tagen, und FP8 KV-Caching hält die Rollout-Memory im Budget. Durch GLM-5.3 verbesserten systemweite Optimierungen den End-to-End-RL-Trainingsdurchsatz um mehr als 2,3×.

Anti-Belohnungs-Hacker

Langfristiges RL kann Abkürzungen veranlassen, daher werden verdächtige Aktionen zunächst durch einen regelbasierten Rücksprache-Filter geleitet und dann durch den LLM-Richter auf Genauigkeit überprüft. Bestätigte bösartige Aktionen werden online abgefangen und mit virtuellen Werkzeugergebnissen beantwortet, sodass Rollouts fortgesetzt werden können, anstatt verworfen zu werden. Basierend auf Critic's PPO werden komprimierbare Sub-Traces für das Training auf einer einzigen Rollout beibehalten.

Eine Einführung in jedes Modell, Version für Version

Von der 30B Flash-Ebene bis zum Flaggschiff mit einer Million Kontexten — wählen Sie ein Modell aus, um die vollständige Spezifikationstabelle und die Benchmark-Daten anzuzeigen.

Alle Modelle ansehen →

Szenarien, in denen langzyklische Modelle hervorragend abschneiden

Grossflächige Implementierung

Mehrdateifunktion über ein einzelnes Kontextfenster hinaus: Das Modell behält den gesamten Repository-Zustand im Blick, anstatt ihn in einigen Runden neu zu lesen.

Automatisierte Forschung

Mehrere Stunden experimenteller Zyklen, Agenten müssen planen, ausführen, Ergebnisse lesen und korrigieren – dies ist genau die Arbeitsbelastung, die von FrontierSWE und PostTrainBench bewertet werden soll.

Leistungsoptimierung

Komplette Anrufdiagramme, Analysetools und das Aufrechterhalten der Kernebene und des Systems auf derselben Spur wie frühere Versuche sind erforderlich.

Komplexes Debugging

Langfristige Reproduzierbarkeitserfassung, instabile Tests und Querserviceausfälle; das Kürzen des Kontexts ist der Grund für den Verlust von Fehlern.

Alle oben genannten Szenarien können auf Ihrer eigenen Hardware ausgeführt werden — MIT-Gewichte, Transformers · vLLM · SGLang · xLLM · ktransformers.Wie wird das Modell lokal ausgeführt →

Häufig gestellte Fragen zum Modell

GLMMODEL ist eine Familie von Open-Weight-Large-Language-Modellen, mit dem aktuellen Flaggschiff GLM-5.3. Die Produktlinie reicht von GLM-4.5-Air und GLM-4.7 bis zu GLM-5, GLM-5-Turbo, GLM-5.1, GLM-5.2 und jetzt GLM-5.3 sowie dem nativ multimodalen GLM-5.3-Flash, einschließlich Sprach- und visueller Varianten. Jedes Kern-Modell wird unter der MIT-Lizenz veröffentlicht, mit vollständig offenen Gewichten.

GLM-5.3 hält die Grenze bei einer stabilen Million Tokens bei, mit einer Ausgabetoken-Grenze von bis zu 128K. 'Stabil' ist das Schlüsselwort: Das Modell wurde auf lange Coding-Agenten-Verläufe trainiert, sodass die Qualität innerhalb des Fensters konsistent bleibt. GLM-5.3-Flash erreicht ebenfalls 1M Kontext mit einer hybriden dünnen-gliedrigen Linear-Attention-Architektur, die die Kosten für den langen Kontext stark reduziert.

Die veröffentlichten Ergebnisse umfassen 88,2 auf Terminal-Bench 2.1, 28,3 auf Terminal-Bench 3.0 (open-source SOTA), 78,1 auf FrontierSWE, 66,9 auf DeepSWE v1.1, 84,5 auf CyberGym (state of the art) und 28,5 auf Agents' Last Exam — das höchstgeordnete Open-Source-Modell in der Bewertung von Coding, Cyber und langfristigen agensbezogenen Bewertungen. Die vollständige Tabelle ist oben dargestellt.

Als das Post-Trainingsskalieren zunahm, wuchs die Fähigkeit zur Schwachstellenentdeckung schneller als erwartet: GLM-5.3 ist auf CyberGym (84.5) auf dem neuesten Stand der Technik und verdoppelt GLM-5.2 auf ExploitBench (54.4 vs 24.4). In realistischen Tests mit Sicherheitsteams wurden 2.436 Schwachstellen in 269 Open-Source-Projekten identifiziert, einige davon gehen bis ins Jahr 1981 zurück.

Es hängt vom Aufgabenbereich ab. GLM-5.3 führt Opus 4.8 und GPT-5.6 Sol auf FrontierSWE, DeepSWE, AutomationBench und CyberGym an und ist auf SWE-Marathon (42.5) mit GPT-5.6 Sol gleichauf. Geschlossene Frontier-Modelle führen immer noch auf Terminal-Bench 3.0, ExploitGym und NL2Repo. Auf Z.ai Code Bench bei hohem Aufwand übertrifft GLM-5.3 (31.4% bei ~50K Tokens) Opus 4.8 (29.5% bei 120K).

GLM-5.3 denkt stets und bietet drei Arbeitsstufen. Auf Z.ai Code Bench v1.0 erreicht er bei hohem Aufwand (~50K Ausgabetokens) 31,4% und bei Max (~75K) 34,5%, übertrifft GLM-5.2 auf jeder Stufe und verwendet dabei weniger Tokens. Hoch ist die praktische Standardstufe; Max ist für die schwierigsten langfristigen Probleme vorgesehen.

Ja. Die Kernmodelgewichte des Modells stehen unter der MIT-Lizenz, ohne regionale Beschränkungen und sind auf HuggingFace und ModelScope veröffentlicht worden. Die Gewichte des GLM-5.3-Flash sind ebenfalls öffentlich und unterstützen SGLang, vLLM und TokenSpeed für lokale Inferenz – so können Sie Modelle auf Ihrer eigenen Hardware ausführen.

IndexShare ermöglicht es jedem vier sparsamen Attention-Layern, einen leichten Indexer zu teilen, dessen top-k Index nur einmal berechnet und dann wiederverwendet wird. Dies eliminiert die Arbeit des Indexers in drei Vierteln der Schichten, reduziert die FLOPs jedes Tokens unter einem Millionen-Token-Kontext um 2.9 Mal — eine entscheidende Änderung, die ein Millionen-Token-Fenster auf Service-Ebene machbar macht.

Kostenlose Open-Source-große Sprachmodelle, die über OpenRouter bereitgestellt werden — nicht GLM-5.3 und nicht mit GLM- Gewichten. Sein Bestehen dient dazu, Ihnen zu ermöglichen, Echtzeitmodelle sofort zu testen, wenn Sie veröffentlichte Modelldaten lesen. Alle GLM-Benchmarkdaten auf dieser Seite sind die von den Modellautoren berichteten Ergebnisse, nicht hier gemessen.

Free Real-time AI Model Experience — Kein Konto erforderlich

Lesen Sie die Benchmark-Tests des Modells und lassen Sie dann das reale Modell arbeiten. Der obige Sandbox ist kostenlos und erfordert keine Informationen; möchten Sie ein umfassenderes AI-Toolkit, beginnt das kostenlose Paket der Partner hier.