Vollständiges Katalog der 64 Modelle: Text-Chat, Reasoning, Vision, Bild/Video-Generierung, Stimme, KI-Suche, Code, Embedding.
Daten aktualisiert August 2026
Neuestes Flaggschiffmodell und das leistungsfähigste Open-Weights-Modell für Codierung: +50% über GLM-5.2 auf Z.ai Code Bench, Open-Source SOTA auf Terminal-Bench 3.0 und Agents' Last Exam, State of the Art auf CyberGym (84.5) für die Schwachstellenentdeckung
Erster nativ multimodaler GLM-5-Modell: 320B Gesamt / 18B aktive Parameter, erster offener Frontier-Modell mit hybrider sparsamer linearer Aufmerksamkeit, visuelle Eigenschaften im Koding-Zyklus, schlägt GLM-5.2 bei einem Zehntel des Preises
Vorzugliches Modell der Vor generation: 1M Verlustfreier Kontext, Koding-Fähigkeit Open-Source SOTA seiner Generation, unterstützt die stabile Ausführung komplexer langfristiger Aufgaben — die Grundlage, auf der GLM-5.3 nach der Schulung aufbaut
Koding-Fähigkeit auf Claude Opus 4.6 ausgerichtet, erhebliche Verbesserung bei langfristigen Aufgaben, kann bis zu 8 Stunden unabhängig arbeiten.
Programmierfähigkeit auf Augenhöhe mit Claude Opus 4.5, versiert in agiler langfristiger Planung und Ausführung
Besondere Optimierung für lange Aufgaben, gute Kontinuität bei der Ausführung komplexer langfristiger Aufgaben
Komplette Überarbeitung der allgemeinen Dialog-, Reasoning- und Agentenfähigkeiten, stärker und stabiler programmiert, verbesserte Ästhetik
Leicht und schnell, kleiner Umfang mit starker Kapazität, geeignet für allgemeine Szenarien wie chinesische Schreibweise, Übersetzung, Rollenspiel usw.
Kostenlose Version, umfassende Erfahrung bietet, erweitert die allgemeinen Fähigkeiten des GLM-4.7-Basismodells
Kontext auf 200K erweitert, versiert in fortgeschrittenem Coding, komplexem Reasoning und Tool-Aufruf
Ein ausgewogener Leistung und Kosten-Allgemeinmodell, geeignet für Dialoge, Analyse und Dokumentenverarbeitung
Hochleistungsfähiges und kosteneffektives Leichtmodell mit stabiler Leistung in Inferenz, Codierung und Agentenaufgaben
Hochleistungs- und kosteneffektive Ultrageschwindigkeitsversion, geeignet für Geschäftsbedingungen mit niedriger Latenz und hoher Reaktionsfähigkeit.
Kostenlose Modellversion, unterstützt tiefes Denkmuster, unterstützt 128K Kontextverarbeitung
Unterstützt eine Kontextlänge von 1M, konzipiert für die Verarbeitung langer Texte und speicherintensiver Aufgaben
Vierter Generation Flaggschiffmodell, starke umfassende Fähigkeiten (alte Version)
Leichtes Modell, schnelle Geschwindigkeit und geringer Preis (alte Version)
Leichte Schnellversion, schnellere Antwortgeschwindigkeit (Alte Version)
Agent-spezifisches Modell, optimiert für Agentenszenarien (Alte Version)
Flash-verbesserte Hochgeschwindigkeitsversion, schnelle Inferenzgeschwindigkeit, geeignet für Szenarien mit hohem Konnektivitätsbedarf
Kostenlose Modelle, unterstützen die Verarbeitung langer Kontexte, geeignet für mehrsprachige Verständigung und Werkzeugaufruf-Szenarien
Alte Version Flagship Text-Modell, ab dem 30. Dezember 2025 eingestellt
Deepes Inferenzmodell, Hochleistungs-Version, eingestellt am 15. November 2025
Deepes Inferenzmodell, Ultra-Schnell-Version, eingestellt am 15. November 2025
Deep Inference Model, schnelle und kostengünstige Version, ab dem 15. November 2025 eingestellt
Erster Multimodaler Agentenbasismodell, das visuelle Verständigung, Reasoning und Code-Generierung ausbalanciert, und multimodale Eingaben von Bildern, Videos und Text unterstützt
Verbesserte visuelle Reasoning-Fähigkeit, nativ unterstützt Tool-Aufrufe und lange Kontexte, mit stabileren Frontend-Code-Klonungseffekten
Hochleistungsmodell für visuelle Reasoning, unterstützt Werkzeugaufrufe und lange Kontexte
Kostenlose visuelle Reasoning-Modelle, unterstützen Werkzeugaufrufe und lange Kontexte, mit flexibler Umschaltung des Denkmusters
Modell für visuelles Verständnis, unterstützt die Eingabe von Bild- und Videodateien
Leichtes visuelles Verständnismodell, erfahren in der Analyse komplexer Szenarien und mehrstufiger Analyse
Kostenlose visuelle Reasoning-Modelle, versiert im Verständnis komplexer Szenarien und mehrstufiger Analyse
Alte Version des Bild-Text-Video-Erkennungsmodells (alte Version)
KOSTENLOSER Bildverständnismodell mit grundlegenden multimodalen Frage-und-Antwort-Fähigkeiten
Erste Generation multimodales visuelles Modell (alte Version)
Leichtgewichtiges Bild-Text-Parsing-Modell, Ausgewogenheit zwischen hoher Präzision und Effizienz bei der Dokumentenverständigung, unterstützt komplexe Layout-Parsing
Mobile intelligente Assistentenrahmenwerk, das natürliche Sprache unterstützt, um App-Betriebsaufgaben zu erledigen und das vollständige Set von mobilen Betriebsbefehlen abdeckt
Flagship-Image-Generationsmodell, stärker im Folgen komplexer Anweisungen und in kenntnisintensiver Generierung, hervorragend in Textdarstellung, insbesondere für chinesische Zeichen
Allgemeines Bildgenerationsmodell, hochwertige Generierung, reichhaltige und vielfältige Stilausdrucksweise, mehr umfassende Bilddetails
Verbessertes Bildgenerationsmodell, verbesserte Bildqualität, unterstützt mehr künstlerische Stile
Allgemeines Bildgenerationsmodell, unterstützt mehrere Auflösungen und Stile (alte Version)
Kostenlose Bildgenerierungsmodellversion, flexible kreative Generierung, schnelle Generierungsgeschwindigkeit
Hochintelligentes Flaggschiff-Videomodell mit klarer Bildqualität, stärkerer Kommandoerfüllung und physischer Simulation, unterstützt die Generierung der ersten und letzten Frames
Hochwertiges Videogenerierungsmodell mit klarem Bildqualität, glatten Übergängen, reicher Stilexpression und kann Bildverzerrungen reduzieren
Hochgeschwindigkeits- und kostengünstiges Videomodell mit schneller Generierungsgeschwindigkeit, natürlicher Verbindung der ersten und letzten Frames und stärkerer Konsistenz mit mehreren Referenzbildern
Standardmodell zur Videogenerierung, unterstützt Ausgabe in mehreren Auflösungen
Kostenloses Video-Generierungsmodell, das AI-Soundeffekte unterstützt, 4K-Bildqualität, 60fps und eine maximale Videolänge von 10 Sekunden.
Sprachsynthese-Modell, unterstützt die Generierung von übermenschlicher Stimme und emotionale Ausdrucksweise, bietet Streaming- und Nicht-Streaming-Schnittstellen
Stimmenklonmodell, in der Lage, ähnliche Stimmen in 3 Sekunden zu generieren, unterstützt feine emotionale Ausdrucksweise
Hochpräzises Spracherkennungsmodell mit niedriger Zeichenerfassungsfehlerquote, unterstützt benutzerdefinierte Wörterbücher und verschiedene Dialekte
Echtzeit-Sprachdialogmodell, das chinesische und englische Sprachverständnis und -generierung unterstützt, an Emotion, Ton und Geschwindigkeit anpassbar
Echtzeit-Audio-Video-Modell, das Videokonferenzen und langfristiges Dialoggedächtnis unterstützt, sowie Cross-Text, Audio- und Video-Echtzeit-Inferenz.
Verbessertes AI-Suchtool, tiefes Retrieval von Webinformationen, unterstützt komplexe Abfragen und mehrfache Suchrunden
Standard-AI-Suchtool, schnell Webinformationen abruft, geeignet für allgemeine Suchszenarien
Sogou Engine-Sucheinrichtung, kombiniert mit Sogou-Suchergebnissen, um genauere Informationsabfrage zu bieten
Quark Engine-Sucheinrichtung, kombiniert mit Quark-Suchergebnissen, um umfassendere Inhaltsabfrage zu bieten
Code-Vervollständigungsmuster, geeignet für automatische Code-Vervollständigung und Entwicklungsunterstützung, verbessert die Codierproduktivität
Drittes Generationen Vektormodell, das zur Verbesserung der semantischen Retrieval, Clustering, Themenmodellierung und Klassifizierung verwendet wird, was die Effektivität erheblich verbessert
Zweigenerationen-Vektormodell, verwendet für die Verbesserung der semantischen Recherche, Clustering und Klassifizierung (alte Version)
Textumordnungsmuster, berechnet Textrelevanzscore, optimiert die Sortierung und das Matching der Rückgabefolge
Animations-Dialogmodell, geeignet für emotionale Begleitung und Interaktion mit virtuellen Charakteren, das natürlichere Charakterausdrücke unterstützt
Psychologisches und emotionales Unterstützungsmodell mit professioneller Beratung und emotionaler Begleitungsfähigkeit, um Benutzern zu helfen, Emotionen zu verstehen und mit Problemen umzugehen
Open-Source-Modell mit 9B Parametern, unterstützt 128K Kontext, kann lokal bereitgestellt werden, MIT-Lizenz
Drittgeneration offenes Quellcode-6B Dialogmodell, erste Generation ChatGLM-Serie, MIT-Lizenz