Catalogue complet des 64 modèles : chat texte, raisonnement, vision, génération d'image/video, voix, recherche IA, code, embeddeurs.
Données mises à jour août 2026
Modèle phare le plus récent et le modèle open-weights le plus capable pour le codage : +50% par rapport au GLM-5.2 sur Z.ai Code Bench, SOTA open-source sur Terminal-Bench 3.0 et Agents' Last Exam, état de l'art sur CyberGym (84.5) pour la découverte de vulnérabilités
Premier modèle-5 multimodal natif : 320B en totalité / 18B de paramètres actifs, premier modèle frontal ouvert avec attention linéaire hybride, vision native au cycle de codage, bat le GLM-5.2 à un dixième du prix
Modèle phare de génération précédente : 1M de contexte sans perte, capacité de codage open-source SOTA de sa génération, prend en charge l'exécution stable de tâches à long terme complexes — la base sur laquelle le GLM-5.3 post-formation s'appuie
Capacité de codage alignée avec Claude Opus 4.6, amélioration significative des tâches à long terme, peut fonctionner indépendamment jusqu'à 8 heures
Capacité de programmation alignée avec Claude Opus 4.5, compétente en planification et exécution agente à long terme
Optimisation spéciale pour les tâches longues, bonne continuité dans l'exécution de tâches complexes à long terme
Mise à jour complète du dialogue général, de la raisonnement et des capacités de l'agent, programmation plus forte et plus stable, meilleure esthétique
Léger et rapide, de petite taille avec une grande capacité, adapté à des scénarios généraux tels que l'écriture en chinois, la traduction, le rôle-playing, etc.
Modèle gratuit, offrant une expérience inclusive, étendant les capacités générales de la base GLM-4.7
Contexte amélioré à 200K, compétent en codage avancé, raisonnement complexe et invocation d'outils
Un modèle de performance et de coût équilibré, adapté aux dialogues, à l'analyse et au traitement des documents
Modèle léger à haute performance et économique, avec une performance stable en inférence, codage et tâches d'agent
Version ultra-rapide et économique à haute performance, adaptée aux scénarios d'entreprise avec faible latence et haute réactivité
Modèle gratuit, compatible avec le mode de pensée profond, compatible avec le traitement de 128K de contexte
Supporte une longueur de contexte de 1M, conçu pour traiter des textes longs et des tâches intensives en mémoire
Modèle phare de quatrième génération, capacités globales fortes (version ancienne)
Modèle léger, vitesse rapide et coût bas (version ancienne)
Version rapide légère, vitesse de réponse plus rapide (Ancienne version)
Modèle spécifique à l'agent, optimisé pour les scénarios d'agent (Ancienne version)
Version à haute vitesse améliorée par Flash, vitesse d'inférence rapide, adaptée aux scénarios de appel à haute concurrence
Modèle gratuit, Prend en charge le traitement de contexte long, Idéal pour les scénarios de compréhension multilingue et d'appel d'outils
Modèle phare de version ancienne, discontinué le 30 décembre 2025
Modèle d'inférence profond, version haute performance, retiré le 15 novembre 2025
Modèle d'inférence profond, version ultra-rapide, retiré le 15 novembre 2025
Modèle d'inférence profond, version rapide et économique, retiré le 15 novembre 2025
Premier modèle de base d'agent multimodal, équilibrant la compréhension visuelle, la raison et la génération de code, prenant en charge les entrées multimodales d'images, de vidéos et de texte
Amélioration de la capacité de raisonnement visuel, prenant en charge nativement les appels d'outils et les longs contextes, avec des effets de clonage de code frontend plus stables
Modèle de raisonnement visuel haute performance, prenant en charge l'appel d'outils et un contexte long
Modèle de raison visuelle gratuit, prenant en charge l'appel d'outils et un contexte long, avec un basculement flexible du mode de pensée
Modèle de compréhension visuelle, supportant l'entrée de fichiers image et vidéo
Modèle de raisonnement visuel léger, compétent dans la compréhension de scènes complexes et d'analyse en plusieurs étapes
Modèle de raisonnement visuel gratuit, compétent pour comprendre des scènes complexes et des analyses à plusieurs étapes
Version ancienne du modèle de reconnaissance vidéo image-texte (version ancienne)
Modèle d'interprétation d'image gratuit avec des capacités de question-réponse multimodales de base
Modèle multimodal visuel de première génération (version ancienne)
Modèle léger de parsing image-texte, équilibrant haute précision et efficacité dans la compréhension des documents, prenant en charge le parsing de mise en page complexe
Cadre d'assistant intelligent mobile, prenant en charge le langage naturel pour accomplir des tâches d'opération d'application, couvrant l'ensemble complet des commandes d'opération mobile
Modèle de génération d'images phare, plus fort dans le suivi des instructions complexes et la génération intensive de connaissances, exceptionnel dans la restitution du texte, en particulier pour les caractères chinois
Modèle de génération d'images générales, génération de haute qualité, expression de style riche et diversifiée, détails d'image plus complets
Modèle de génération d'image amélioré, qualité d'image améliorée, prend en charge plus de styles artistiques
Modèle de génération d'image général, prend en charge plusieurs résolutions et styles (version ancienne)
Modèle de génération d'images gratuit, génération créative flexible, vitesse de génération rapide
Modèle vidéo de pointe à haute intelligence, avec une qualité d'image claire, une meilleure obéissance aux commandes et une simulation physique, prenant en charge la génération des premiers et derniers cadres
Modèle de génération de vidéo de haute qualité, avec une qualité d'image claire, des transitions fluides, une expression de style plus riche et capable de réduire la distorsion des images
Modèle vidéo à haute vitesse et bas coût, avec une vitesse de génération rapide, une connexion naturelle des premiers et derniers cadres, et une meilleure cohérence avec plusieurs images de référence
Modèle standard de génération de vidéo, supportant une sortie à multiples résolutions
Modèle de génération de vidéo gratuit, prenant en charge les effets sonores IA, qualité d'image 4K, 60ips, et une longueur maximale de vidéo de 10 secondes
Modèle de synthèse vocale, prenant en charge la génération de voix ultra-humaine et l'expression émotionnelle, fournissant des interfaces de streaming et non-streaming
Modèle de clonage vocal, capable de générer rapidement une voix similaire en 3 secondes, supportant des expressions émotionnelles délicates
Modèle de reconnaissance vocale de haute précision, avec un taux d'erreur de caractères faible, supportant des vocabulaires personnalisés et diverses dialectes
Modèle de dialogue vocal en temps réel, prenant en charge la compréhension et la génération de la parole en chinois et en anglais, ajustable pour l'expression des émotions, du ton et de la vitesse
Modèle audio-video en temps réel, prenant en charge les appels vidéo et la mémoire de dialogue à long terme, l'inference réelle temps en temps des textes, audio et vidéo
Outil de recherche IA amélioré, récupère profondément les informations web, prend en charge des requêtes complexes et des recherches en plusieurs rounds
Outil de recherche AI standard, récupère rapidement des informations web, adapté aux scénarios de recherche générale
Amélioration de la recherche Sogou Engine, combinée aux résultats de recherche Sogou pour fournir une récupération d'informations plus précise
Amélioration de la recherche Quark Engine, combinée aux résultats de recherche Quark pour fournir une récupération de contenu plus complète
Modèle de complétion de code, adapté à l'auto-complétion de code et à l'assistance au développement, améliorant l'efficacité de la programmation
Modèle vectoriel de troisième génération, utilisé pour l'amélioration de la recherche sémantique, le regroupement, le modélage thématique et la classification, améliorant considérablement l'effet
Modèle vectoriel de deuxième génération, utilisé pour l'amélioration de la recherche sémantique, le regroupement et la classification (version ancienne)
Modèle de réordonnancement de texte, calcule le score de pertinence du texte, optimise le tri et l'effet de correspondance des résultats de rappel
Modèle de conversation animée, adapté aux compagnons émotionnels et aux interactions avec des personnages virtuels, prenant en charge une expression de personnage plus naturelle
Modèle de soutien psychologique et émotionnel, avec des capacités de conseil professionnel et de guidance émotionnelle, aidant les utilisateurs à comprendre leurs émotions et à faire face aux problèmes
Modèle open-source de 9B paramètres, supporte un contexte de 128K, peut être déployé localement, licence MIT
Modèle de dialogue open-source de troisième génération de 6B, première génération de la série ChatGLM, licence MIT