Catálogo completo de 64 modelos: chat de texto, raciocínio, visão, geração de imagem/video, voz, busca em IA, código, embeddings.
Dados atualizados em agosto de 2026
Último modelo flagship e o mais capacitado para codificação: +50% a mais que o GLM-5.2 no Z.ai Code Bench, SOTA open-source no Terminal-Bench 3.0 e Agents' Last Exam, estado da arte no CyberGym (84.5) para descoberta de vulnerabilidades
Primeiro modelo-5 multimodal nativo: 320B parâmetros totais / 18B ativos, primeiro modelo de fronteira aberto com atenção linear híbrida esparsa, visão nativa no ciclo de codificação, vence o GLM-5.2 a um décimo do preço
Modelo de topo de geração anterior: 1M contexto sem perda, capacidade de codificação open-source SOTA de sua geração, suporta execução estável de tarefas longas e complexas — a base sobre a qual o GLM-5.3 pós-treinamento se constrói
Capacidade de codificação alinhada com Claude Opus 4.6, significativa melhoria em tarefas de longo prazo, pode funcionar independentemente por até 8 horas.
Capacidade de programação alinhada com Claude Opus 4.5, proficiente em planejamento e execução de longo prazo agente
Especial otimização para tarefas longas, boa continuidade na execução de tarefas complexas de longo prazo
Upgrade completo de diálogo geral, raciocínio e capacidades do agente, programação mais forte e estável, melhor estética
Leve e rápido, tamanho pequeno com alta capacidade, adequado para cenários gerais como escrita em chinês, tradução, role-playing, etc.
Modelo gratuito, proporcionando experiência inclusiva, estendendo as capacidades gerais do GLM-4.7 base
Contexto aumentado para 200K, proficiente em programação avançada, raciocínio complexo e invocação de ferramentas
Um modelo geral equilibrado de desempenho e custo, adequado para diálogo, análise e processamento de documentos
Modelo leve de alta performance e econômico, com desempenho estável em inferência, codificação e tarefas de agente
Versão ultra-rápida e econômica de alto desempenho, adequada para cenários de negócios com baixa latência e alta resposta.
Modelo gratuito, suporta modo de pensamento profundo, suporta processamento de contexto de 128K
Suporta comprimento de contexto de 1M, projetado para processar textos longos e tarefas intensivas em memória
Modelo flagship da quarta geração, capacidades completas fortes (versão antiga)
Modelo leve, alta velocidade e baixo custo (versão antiga)
Versão leve e rápida, velocidade de resposta mais rápida (Versão Antiga)
Modelo Específico do Agente, Otimizado para Cenários de Agente (Versão Antiga)
Versão de alta velocidade com aceleração Flash, velocidade de inferência rápida, adequada para cenários de chamadas de alta concorrência
Modelo gratuito, suporta processamento de contexto longo, adequado para cenários de compreensão multilíngue e invocação de ferramentas
Modelo de Texto Flagship da Versão Antiga, Descontinuado em 30 de dezembro de 2025
Modelo de Infariação Profunda, Versão de Alto Desempenho, descontinuado em 15 de novembro de 2025
Modelo de Infariação Profunda, Versão Ultra-Rápida, descontinuado em 15 de novembro de 2025
Modelo de Infereência Profunda, Versão Rápida e Econômica, descontinuado em 15 de novembro de 2025
Primeiro modelo base de agente multimodal, equilibrando compreensão visual, raciocínio e geração de código, suportando entradas multimodais de imagens, vídeos e texto
Capacidade de raciocínio visual aprimorada, suportando nativamente chamadas de ferramentas e contextos longos, com efeitos de clonagem de código frontend mais estáveis
Modelo de raciocínio visual de alta performance, suporta invocação de ferramentas e contexto longo
Modelo de raciocínio visual gratuito, suportando invocação de ferramentas e contexto longo, com alternância flexível de modo de pensamento
Modelo de Entendimento Visual, Suportando Entrada de Arquivos de Imagem e Vídeo
Modelo de raciocínio visual leve, proficiente em entender cenas complexas e análise de múltiplos passos
Modelo de raciocínio visual gratuito, proficiente em entender cenas complexas e análise de múltiplos passos
Versão antiga do modelo de reconhecimento de imagem-texto-vídeo (versão antiga)
Modelo de compreensão de imagem gratuito com capacidade básica de perguntas e respostas multimodais
Modelo multimodal visual de primeira geração (versão antiga)
Modelo leve de parsing de imagem-texto, equilibrando alta precisão e eficiência na compreensão de documentos, suportando parsing de layout complexo
Framework de assistente inteligente móvel, suportando linguagem natural para completar tarefas de operação de aplicativo, cobrindo o conjunto completo de comandos de operação móvel
Modelo de geração de imagens de topo de linha, mais forte na seguinte instrução complexa e geração intensiva em conhecimento, destacado na renderização de texto, especialmente para caracteres chineses
Modelo de geração de imagens geral, geração de alta qualidade, expressão de estilo rica e diversificada, detalhes de imagem mais completos
Modelo de geração de imagem aprimorado, melhoria na qualidade da imagem, suporta mais estilos artísticos
Modelo de geração de imagem geral, suporta múltiplas resoluções e estilos (versão antiga)
Modelo de geração de imagens gratuito, geração criativa flexível, velocidade de geração rápida
Modelo de vídeo de bandeira de alta inteligência, com qualidade de imagem clara, maior conformidade de comando e simulação física, suportando a geração de primeiros e últimos frames
Modelo de geração de vídeo de alta qualidade, com qualidade de imagem clara, transições suaves, expressão de estilo mais rica e pode reduzir a distorção da imagem
Modelo de vídeo de alta velocidade e baixo custo, com velocidade de geração rápida, conexão natural de primeiros e últimos frames e maior consistência com múltiplas imagens de referência
Modelo de Geração de Vídeo Padrão, Suportando Saída em Multi-Résolução
Modelo de geração de vídeo gratuito, suportando efeitos sonoros de IA, qualidade de imagem 4K, 60fps e comprimento máximo de vídeo de 10 segundos.
Modelo de síntese de voz, suportando geração de voz ultra-humana e expressão emocional, fornecendo interfaces de streaming e não-streaming
Modelo de clonagem de voz, capaz de gerar voz semelhante rapidamente em 3 segundos, suportando expressão emocional delicada
Modelo de reconhecimento de fala de alta precisão, com baixa taxa de erro de caractere, suportando vocabulário personalizado e diversas dialetos
Modelo de diálogo de fala em tempo real, suportando compreensão e geração de fala em chinês e inglês, ajustável para emoção, tom e velocidade
Modelo de áudio-vídeo em tempo real, suportando chamadas de vídeo e memória de diálogo a longo prazo, inferência em tempo real de texto, áudio e vídeo.
Ferramenta de busca de IA aprimorada, recupera profundamente informações da web, suporta consultas complexas e buscas em múltiplas rodadas
Ferramenta de busca de IA padrão, recupera rapidamente informações da web, adequada para cenários de busca geral
Sogou Engine aprimoramento de busca, combinado com resultados de busca do Sogou para fornecer recuperação de informações mais precisa
Quark Engine aprimoramento de busca, combinado com resultados de busca do Quark para fornecer recuperação de conteúdo mais abrangente
Modelo de completamento de código, adequado para completamento automático de código e assistência no desenvolvimento, melhorando a eficiência da programação
Terceira geração de modelo vetorial, usado para aprimoramento da recuperação semântica, agrupamento, modelagem de tópicos e classificação, significativamente melhorando o efeito
Modelo vetorial de segunda geração, usado para aprimoramento de recuperação semântica, agrupamento e classificação (versão antiga)
Modelo de reordenação de texto, calcula a pontuação de relevância do texto, otimiza a classificação e o efeito de correspondência do resultado de recuperação
Modelo de conversa animada, adequado para companheirismo emocional e interação com personagens virtuais, suportando expressões de personagens mais naturais
Modelo de suporte psicológico e emocional, com capacidades de aconselhamento profissional e orientação emocional, ajudando os usuários a entenderem as emoções e a lidarem com problemas
Modelo de 9B parâmetros de código aberto, suporta 128K contexto, pode ser implantado localmente, licença MIT
Terceira geração de modelo de diálogo de código aberto 6B, primeira geração da série ChatGLM, licença MIT