← Retour à l'Accueil

Tous les modèles

Catalogue complet des 64 modèles : chat texte, raisonnement, vision, génération d'image/video, voix, recherche IA, code, embeddeurs.

64
Modèles
12
Catégories
8
Gratuit
⚠ Certains modèles hérités sont obsolètes. Migrer vers les versions plus récentes.
Aller au Playground

Données mises à jour août 2026

Texte & Chat

22

GLM-5.3

PhareNouveau

Modèle phare le plus récent et le modèle open-weights le plus capable pour le codage : +50% par rapport au GLM-5.2 sur Z.ai Code Bench, SOTA open-source sur Terminal-Bench 3.0 et Agents' Last Exam, état de l'art sur CyberGym (84.5) pour la découverte de vulnérabilités

Context: 1M Max Output: 128K
8 ¥ / 28 par million de tokens

GLM-5.3-Flash

NouveauMultimodal

Premier modèle-5 multimodal natif : 320B en totalité / 18B de paramètres actifs, premier modèle frontal ouvert avec attention linéaire hybride, vision native au cycle de codage, bat le GLM-5.2 à un dixième du prix

Context: 1M Max Output: 128K
0,8 ¥ / 2,8 par million de tokens

GLM-5.2

Raisonnement

Modèle phare de génération précédente : 1M de contexte sans perte, capacité de codage open-source SOTA de sa génération, prend en charge l'exécution stable de tâches à long terme complexes — la base sur laquelle le GLM-5.3 post-formation s'appuie

Context: 1M Max Output: 128K
8 ¥ / 28 par million de tokens

GLM-5.1

Raisonnement

Capacité de codage alignée avec Claude Opus 4.6, amélioration significative des tâches à long terme, peut fonctionner indépendamment jusqu'à 8 heures

Context: 200K Max Output: 128K
6 ¥ / 24 par million de tokens

GLM-5

Raisonnement

Capacité de programmation alignée avec Claude Opus 4.5, compétente en planification et exécution agente à long terme

Context: 200K Max Output: 128K
4 ¥ / 18 par million de tokens

GLM-5-Turbo

Raisonnement

Optimisation spéciale pour les tâches longues, bonne continuité dans l'exécution de tâches complexes à long terme

Context: 200K Max Output: 128K
5 ¥ / 22 par million de tokens

GLM-4.7

Raisonnement

Mise à jour complète du dialogue général, de la raisonnement et des capacités de l'agent, programmation plus forte et plus stable, meilleure esthétique

Context: 200K Max Output: 128K
2 ¥ / 8 par million de tokens

GLM-4.7-FlashX

Léger

Léger et rapide, de petite taille avec une grande capacité, adapté à des scénarios généraux tels que l'écriture en chinois, la traduction, le rôle-playing, etc.

Context: 200K Max Output: 128K
0,5 ¥ / 3 par million de tokens

GLM-4.7-Flash

LégerGratuit

Modèle gratuit, offrant une expérience inclusive, étendant les capacités générales de la base GLM-4.7

Context: 200K Max Output: 128K
Gratuit

GLM-4.6

Contexte amélioré à 200K, compétent en codage avancé, raisonnement complexe et invocation d'outils

Context: 200K Max Output: 128K
1 ¥ / 5 par million de tokens

GLM-4.5

Un modèle de performance et de coût équilibré, adapté aux dialogues, à l'analyse et au traitement des documents

Context: 128K Max Output: 96K
2 ¥ / 8 par million de tokens

GLM-4.5-Air

Léger

Modèle léger à haute performance et économique, avec une performance stable en inférence, codage et tâches d'agent

Context: 128K Max Output: 96K
0,8 ¥ / 2 par million de tokens

GLM-4.5-AirX

Léger

Version ultra-rapide et économique à haute performance, adaptée aux scénarios d'entreprise avec faible latence et haute réactivité

Context: 128K Max Output: 96K
1 ¥ / 4 par million de tokens

GLM-4.5-Flash

LégerGratuit

Modèle gratuit, compatible avec le mode de pensée profond, compatible avec le traitement de 128K de contexte

Context: 128K Max Output: 96K
Gratuit

GLM-4-Long

Long Ctx:

Supporte une longueur de contexte de 1M, conçu pour traiter des textes longs et des tâches intensives en mémoire

Context: 1M Max Output: 4K
1 ¥ par million de tokens

GLM-4-Plus

Legacy

Modèle phare de quatrième génération, capacités globales fortes (version ancienne)

Context: 128K Max Output: 4K
5 ¥ par million de tokens

GLM-4-Air

LégerLegacy

Modèle léger, vitesse rapide et coût bas (version ancienne)

Context: 128K Max Output: 4K
0,5 ¥ par million de tokens

GLM-4-AirX

LégerLegacy

Version rapide légère, vitesse de réponse plus rapide (Ancienne version)

Context: 128K Max Output: 4K
1 ¥ par million de tokens

GLM-4-Assistant

AgentLegacy

Modèle spécifique à l'agent, optimisé pour les scénarios d'agent (Ancienne version)

Context: 128K Max Output: 4K
5 ¥ par million de tokens

GLM-4-FlashX-250414

Léger

Version à haute vitesse améliorée par Flash, vitesse d'inférence rapide, adaptée aux scénarios de appel à haute concurrence

Context: 128K Max Output: 16K
0,1 ¥ par million de tokens

GLM-4-Flash-250414

LégerGratuit

Modèle gratuit, Prend en charge le traitement de contexte long, Idéal pour les scénarios de compréhension multilingue et d'appel d'outils

Context: 128K Max Output: 16K
Gratuit

GLM-4-0520

LegacyDésuet

Modèle phare de version ancienne, discontinué le 30 décembre 2025

Context: 128K Max Output: 4K
100 ¥ par million de tokens

Raisonnement Profond

3

GLM-Z1-Air

Désuet

Modèle d'inférence profond, version haute performance, retiré le 15 novembre 2025

Context: 128K Max Output: 16K
0,5 ¥ par million de tokens

GLM-Z1-AirX

Désuet

Modèle d'inférence profond, version ultra-rapide, retiré le 15 novembre 2025

Context: 32K Max Output: 16K
5 ¥ par million de tokens

GLM-Z1-FlashX

Désuet

Modèle d'inférence profond, version rapide et économique, retiré le 15 novembre 2025

Context: 128K Max Output: 16K
0,1 ¥ par million de tokens

Vision & Multimodal

12

GLM-5V-Turbo

PhareNouveau

Premier modèle de base d'agent multimodal, équilibrant la compréhension visuelle, la raison et la génération de code, prenant en charge les entrées multimodales d'images, de vidéos et de texte

Context: 200K Max Output: 128K
5 ¥ / 22 par million de tokens

GLM-4.6V

Amélioration de la capacité de raisonnement visuel, prenant en charge nativement les appels d'outils et les longs contextes, avec des effets de clonage de code frontend plus stables

Context: 128K Max Output: 32K
1 ¥ / 3 par million de tokens

GLM-4.6V-FlashX

Léger

Modèle de raisonnement visuel haute performance, prenant en charge l'appel d'outils et un contexte long

Context: 128K Max Output: 32K
0,15 ¥ / 1,5 par million de tokens

GLM-4.6V-Flash

LégerGratuit

Modèle de raison visuelle gratuit, prenant en charge l'appel d'outils et un contexte long, avec un basculement flexible du mode de pensée

Context: 128K Max Output: 32K
Gratuit

GLM-4.5V

Legacy

Modèle de compréhension visuelle, supportant l'entrée de fichiers image et vidéo

Context: 64K Max Output:
2 ¥ / 6 par million de tokens

GLM-4.1V-Thinking-FlashX

Léger

Modèle de raisonnement visuel léger, compétent dans la compréhension de scènes complexes et d'analyse en plusieurs étapes

Context: 64K Max Output: 16K
2 ¥ par million de tokens

GLM-4.1V-Thinking-Flash

LégerGratuit

Modèle de raisonnement visuel gratuit, compétent pour comprendre des scènes complexes et des analyses à plusieurs étapes

Context: 64K Max Output: 16K
Gratuit

GLM-4V-Plus-0111

Legacy

Version ancienne du modèle de reconnaissance vidéo image-texte (version ancienne)

Context: 8K Max Output:
4 ¥ par million de tokens

GLM-4V-Flash

LégerGratuitLegacy

Modèle d'interprétation d'image gratuit avec des capacités de question-réponse multimodales de base

Context: 16K Max Output: 1K
Gratuit

GLM-4V

Legacy

Modèle multimodal visuel de première génération (version ancienne)

Context: 2K Max Output:
5 ¥ par million de tokens

GLM-OCR

OCR

Modèle léger de parsing image-texte, équilibrant haute précision et efficacité dans la compréhension des documents, prenant en charge le parsing de mise en page complexe

Context: Max Output:
¥0,01 par millier de tokens

AutoGLM-Phone

AgentNouveau

Cadre d'assistant intelligent mobile, prenant en charge le langage naturel pour accomplir des tâches d'opération d'application, couvrant l'ensemble complet des commandes d'opération mobile

Context: 20K Max Output: 2K
¥0.04 每次

Génération d'images

5

GLM-Image

PhareNouveau

Modèle de génération d'images phare, plus fort dans le suivi des instructions complexes et la génération intensive de connaissances, exceptionnel dans la restitution du texte, en particulier pour les caractères chinois

Context: 多分辨率 Max Output:
¥0.2 每次

CogView-4

Modèle de génération d'images générales, génération de haute qualité, expression de style riche et diversifiée, détails d'image plus complets

Context: 多分辨率 Max Output:
¥0.06 每次

CogView-3-Plus

Modèle de génération d'image amélioré, qualité d'image améliorée, prend en charge plus de styles artistiques

Context: 多分辨率 Max Output:
¥0.1 每次

CogView-3

Legacy

Modèle de génération d'image général, prend en charge plusieurs résolutions et styles (version ancienne)

Context: 多分辨率 Max Output:
¥0.06 每次

CogView-3-Flash

LégerGratuit

Modèle de génération d'images gratuit, génération créative flexible, vitesse de génération rapide

Context: 多分辨率 Max Output:
Gratuit

Génération de Vidéo

5

CogVideoX-3

PhareNouveau

Modèle vidéo de pointe à haute intelligence, avec une qualité d'image claire, une meilleure obéissance aux commandes et une simulation physique, prenant en charge la génération des premiers et derniers cadres

Context: 多分辨率 Max Output:
¥1 每次

Vidu Q1

Nouveau

Modèle de génération de vidéo de haute qualité, avec une qualité d'image claire, des transitions fluides, une expression de style plus riche et capable de réduire la distorsion des images

Context: 多分辨率 Max Output:
¥1 每次

Vidu 2

Modèle vidéo à haute vitesse et bas coût, avec une vitesse de génération rapide, une connexion naturelle des premiers et derniers cadres, et une meilleure cohérence avec plusieurs images de référence

Context: 多分辨率 Max Output:
¥0.5 每次

CogVideoX-2

Modèle standard de génération de vidéo, supportant une sortie à multiples résolutions

Context: 多分辨率 Max Output:
¥0.5 每次

CogVideoX-Flash

LégerGratuit

Modèle de génération de vidéo gratuit, prenant en charge les effets sonores IA, qualité d'image 4K, 60ips, et une longueur maximale de vidéo de 10 secondes

Context: 多分辨率 Max Output:
Gratuit

Voix & Audio

5

GLM-TTS

TTS

Modèle de synthèse vocale, prenant en charge la génération de voix ultra-humaine et l'expression émotionnelle, fournissant des interfaces de streaming et non-streaming

Context: Max Output:
¥0.5 每千字符

GLM-TTS-Clone

TTS

Modèle de clonage vocal, capable de générer rapidement une voix similaire en 3 secondes, supportant des expressions émotionnelles délicates

Context: Max Output:
¥0.2 每秒

GLM-ASR-2512

ASR

Modèle de reconnaissance vocale de haute précision, avec un taux d'erreur de caractères faible, supportant des vocabulaires personnalisés et diverses dialectes

Context: Max Output:
¥0.06 每分钟

GLM-4-Voice

Réel temps:

Modèle de dialogue vocal en temps réel, prenant en charge la compréhension et la génération de la parole en chinois et en anglais, ajustable pour l'expression des émotions, du ton et de la vitesse

Context: Max Output:
80 ¥ par million de tokens

GLM-Realtime

Réel temps:Nouveau

Modèle audio-video en temps réel, prenant en charge les appels vidéo et la mémoire de dialogue à long terme, l'inference réelle temps en temps des textes, audio et vidéo

Context: Max Output:
¥0.04 每分钟

Code

1

CodeGeeX-4

Modèle de complétion de code, adapté à l'auto-complétion de code et à l'assistance au développement, améliorant l'efficacité de la programmation

Context: 128K Max Output: 32K
0,1 ¥ par million de tokens

Embedding:

2

Embedding-3

Modèle vectoriel de troisième génération, utilisé pour l'amélioration de la recherche sémantique, le regroupement, le modélage thématique et la classification, améliorant considérablement l'effet

Context: 8K Max Output:
0,5 ¥ par million de tokens

Embedding-2

Legacy

Modèle vectoriel de deuxième génération, utilisé pour l'amélioration de la recherche sémantique, le regroupement et la classification (version ancienne)

Context: 8K Max Output:
0,5 ¥ par million de tokens

Rerank

1

Rerank

Modèle de réordonnancement de texte, calcule le score de pertinence du texte, optimise le tri et l'effet de correspondance des résultats de rappel

Context: 4K Max Output:
0,8 ¥ par million de tokens

Caractère

2

CharGLM-4

Modèle de conversation animée, adapté aux compagnons émotionnels et aux interactions avec des personnages virtuels, prenant en charge une expression de personnage plus naturelle

Context: 8K Max Output: 4K
1 ¥ par million de tokens

Emohaa

Modèle de soutien psychologique et émotionnel, avec des capacités de conseil professionnel et de guidance émotionnelle, aidant les utilisateurs à comprendre leurs émotions et à faire face aux problèmes

Context: 8K Max Output: 4K
15 ¥ par million de tokens

Open Source

2

GLM-4-9B

Open Source

Modèle open-source de 9B paramètres, supporte un contexte de 128K, peut être déployé localement, licence MIT

Context: 128K Max Output:
Gratuit et open source

ChatGLM3-6B

Open SourceLegacy

Modèle de dialogue open-source de troisième génération de 6B, première génération de la série ChatGLM, licence MIT

Context: 32K Max Output:
Gratuit et open source