GLM-5.3 é o modelo AI de código aberto flagship — o modelo de pesos abertos mais capacitado para codificação, com um contexto estável de um milhão de tokens. Ele reporta 88,2 em Terminal-Bench 2.1, 78,1 em FrontierSWE e um estado da arte de 84,5 em CyberGym para descoberta de vulnerabilidades. Abaixo, você pode comparar cada modelo — ou experimentar primeiro o sandbox gratuito de AI.
Não é necessário registro, não é necessário conta, não é necessário quota. Respostas de streaming em tempo real podem ser obtidas ao inserir palavras de prompt.
A resposta será transmitida aqui...
Esta experiência utiliza o modelo de linguagem grande GLM, e respostas em tempo real podem ser obtidas ao inserir palavras de prompt.
Quatro capacidades definem a geração atual dos modelos — todas reportadas pelos autores do modelo e reproduzíveis por direitos abertos.
Um contexto de um milhão de tokens não só está disponível como mantém qualidade: o GLM-5.3 transfere treinamento em trajetórias de agente de codificação de longo contexto, como implementação em larga escala, pesquisa automatizada e depuração complexa.
Estado da arte no CyberGym (84,5) para descoberta de vulnerabilidades. Em testes reais, identificou 2.436 vulnerabilidades em 269 projetos de código aberto — o mais antigo remonta a 1981.
Cada quatro camadas de atenção esparsa compartilham um índice leve, reduzindo os FLOPs por token em 2,9 vezes sob uma comprimento de contexto de um milhão, mantendo a qualidade de longo alcance sem perda.
Modelos de código aberto sob a licença MIT: pesos são publicados no HuggingFace e ModelScope, sem restrições regionais, e suportam implantação local através de transformers, vLLM, SGLang, xLLM e ktransformers.
Todos os seguintes dados são os resultados do GLM-5.3 e dos modelos comparativos publicados pelos autores do modelo. glmmodel.net apenas fornece relatórios e não executa essas avaliações.
A duração da tarefa pode alcançar 20 horas
Até 10 horas em um único cartão H100
Engenharia de software de ciclo ultra-longo, até 10 horas
Ao longo desses benchmarks de longo prazo, o GLM-5.3 é o modelo open-source de maior ranking — prova de que seu contexto de um milhão de tokens se converte em saída real. Melhora de 4.6 para 28.3 no Terminal-Bench 3.0, de 46.2 para 66.9 no DeepSWE v1.1, e mais do dobro do GLM-5.2 nos benchmarks de exploração — todas as melhorias vêm do pós-treinamento no mesmo modelo base.
Publicados resultados de benchmark do GLMMODEL, cobrindo 16 avaliações de 8 modelos.
| Teste de Benchmark | GLM-5.3 | GLM-5.2 | Kimi K3 | DeepSeek-V4 Pro | Qwen3.8-Max | Claude Opus 4.8 | Fable 5* | GPT-5.6 Sol |
|---|---|---|---|---|---|---|---|---|
| Codificação | ||||||||
| Terminal-Bench 2.1 | 88.2 | 81.0 | 88.3 | 87.9 | 86.6 | 85.0 | 88.0 | 88.8 |
| Terminal-Bench 3.0 | 28.3 | 4.6 | 17.4 | – | – | 21.1 | 33.7 | 34.6 |
| DeepSWE v1.1 | 66.9 | 46.2 | 67.5 | 62.7 | 56.6 | 58.0 | 69.7 | 72.7 |
| NL2Repo | 58.0 | 48.9 | 58.0 | 61.1 | 55.9 | 69.7 | – | – |
| ProgramBench (Almost Solved) | 19.0 | 9.5 | 17.5 | – | 10.5 | 15.5 | 33.0 | 23.0 |
| FrontierSWE | 78.1 | 67.5 | – | – | – | 66.5 | 88.2 | – |
| SWE-Marathon v1.1 | 42.5 | 19.4 | 48.1 | – | – | 48.8 | 33.1 | 42.5 |
| PostTrainBench | 39.8 | 31.7 | 32.0 | – | – | 32.9 | 41.8 | 36.2 |
| Ciber | ||||||||
| CyberGym | 84.5 | 77.2 | 80.0 | 83.3 | 78.5 | 78.1 | 83.8 | 83.6 |
| ExploitGym (2h / 6h) | 105 / 130 | 29 / 39 | 36 / 70 | – | 14 / 26 | 80 / 120 | 181 / 247 | 216 / 293 |
| ExploitBench | 54.4 | 24.4 | 32.2 | – | 28.8 | 40.0 | 78.0 | 76.5 |
| Agente | ||||||||
| Toolathlon Verified | 73.0 | 59.9 | 76.5 | 74.1 | 72.5 | 76.2 | 74.7 | 74.9 |
| AutomationBench v1.0.6 | 48.2 | 26.2 | 46.7 | 43.2 | 39.8 | 41.0 | 46.2 | 45.8 |
| Agents' Last Exam (ALE-CLI) | 28.5 | 23.8 | 27.6 | 25.7 | 27.0 | 25.7 | 23.8 | 28.6 |
| HLE (With Tools) | 62.5 | 54.7 | 59.8 | 60.0 | 56.2 | 57.9 | 63.9 | 64.5 |
| GDPval-AA v2 | 1769 | 1508 | 1682 | 1590 | 1739 | 1588 | 1743 | 1730 |
Resultados do Fable 5 são reportados com fallback. Todos os dados são resultados publicados pelos autores do modelo.
GLM-5.3 sempre pensa, em três níveis de intensidade. O controle de esforço permite que você gaste computação apenas quando a tarefa exigir — GLM-5.3 vence o GLM-5.2 em cada nível de esforço enquanto consome menos tokens de saída.
raciocínio leve
Cenários onde a latência importa mais do que a profundidade, como edição rápida, código de modelo e refatoração rotineira — o GLM-5.3 já não desativa o pensamento, então a raciocínio leve permanece ativado por padrão.
~50K tokens médios
O padrão para a maioria da codificação de agente: com esforço alto, o GLM-5.3 alcança 31.4% com cerca de 50K tokens de saída, superando o Claude Opus 4.8 (29.5% com 120K).
~75K tokens médios
Os problemas mais difíceis de longo prazo: 34,5% aproximadamente em 75K tokens de saída, versus 23,4% do GLM-5.2 em 96K — mais resultados com menos tokens.
Dados do Z.ai Code Bench v1.0, um benchmark interno que avalia agentes de codificação em ambientes de desenvolvimento locais realistas, medindo a conclusão de tarefas de ponta a ponta em níveis de esforço controlados. Relatados pelos autores do modelo. O GLM-5.3 melhora tanto o desempenho quanto a eficiência de tokens em relação ao GLM-5.2 em todos os níveis de esforço.
Aumentar o limite de contexto de 200K para um milhão de tokens é um problema de engenharia, não um parâmetro de configuração. Três modificações são essenciais.
Cada quatro camadas Transformer compartilham um indexador leve. Ele está localizado na primeira camada entre as quatro, e seu índice top-k é reutilizado pelas outras três camadas — eliminando o produto escalar e o cálculo top-k em três-quartos das camadas. Resultado: O FLOPs de cada token é reduzido em 2,9 vezes sob uma comprimento de contexto de um milhão. IndexShare foi introduzido a partir de uma sequência de comprimento de 128K durante a fase intermediária do treinamento.
A camada de predição de múltiplos tokens executa o indexador uma vez na primeira etapa do rascunho e o reutiliza nas etapas subsequentes, eliminando o desalinhamento entre o cache KV de treinamento/inferência da geração anterior. Combinado com amostragem de rejeição e perda TV de ponta a ponta, o comprimento aceito aumenta de 4.56 para 5.47 — cerca de 20% — ao longo de 7 etapas MTP.
| Linha de base | 4.56 |
| + IndexShare + KVShare | 5.10 |
| + Amostragem de Rejeição | 5.29 |
| + Perda Total de TV | 5.47 (+20%) |
Após mais de algumas dezenas de milhares de tokens, o gargalo não é mais a computação, mas a capacidade do cache KV, o kernel de contexto longo e o overhead da CPU. Três correções: gerenciamento de memória fino e paralelização baseada em LayerSplit, otimização do kernel para escalonamento do comprimento do contexto coordenado com o pipeline de transferência de cache e gerenciamento de cache, agendamento de solicitações e otimização da rota de tempo de execução do lado da CPU. A vantagem de throughput se expande com o crescimento do contexto.
Vantagem de Throughput Normalizada
A pilha de treinamento (slime) combina rollouts de caixa branca e caixa preta, trajetórias compactas e workflows de sub-agente. O treinamento paralelo OPD une mais de uma dúzia de modelos especializados em cerca de dois dias, e o caching de KV FP8 mantém a memória de rollout dentro do orçamento. Através do GLM-5.3, otimizações de nível de sistema melhoraram o throughput de treinamento RL de ponta a ponta em mais de 2,3×.
O RL a longo prazo pode induzir atalhos, então ações suspeitas são primeiramente passadas por um filtro de recall baseado em regras e, em seguida, verificadas pela precisão do juiz LLM. Ações maliciosas confirmadas são interceptadas online e respondidas com resultados de ferramentas virtuais, permitindo que as rollouts continuem em vez de serem descartadas. Baseado no PPO do Critic, sub-traces comprimíveis são mantidas para treinamento em uma única rollout.
De nível Flash 30B a um topo de um milhão de contextos — escolha um modelo para visualizar a tabela de especificações completa e os dados de benchmark.
O modelo de pesos abertos mais capacitado para codificação: +50% no Z.ai Code Bench, SOTA open-source no Terminal-Bench 3.0 e Agents' Last Exam, estado da arte no CyberGym.
Primeiro modelo-5 multimodal nativo: 320B parâmetros totais / 18B ativos, atenção híbrida, 1M contexto — desempenho superior ao GLM-5.2 com um décimo do preço.
Geração anterior de topo: um milhão de tokens de contexto e a fundação de longo prazo que o GLM-5.3 constrói após o treinamento.
Especialista de longo prazo: significativamente melhorou as capacidades a longo prazo e os resultados de nível de engenharia que podem funcionar de forma autônoma por várias horas.
Capacidades de programação mais fortes, execução multistep mais confiável e comportamento de agente complexo melhorado.
Modelo básico, otimizado para cenários de longa cadeia e agente inteligente dinâmico.
Capacidades de programação aprimoradas, inferência multistep estável e geração de frontend melhorada.
300 bilhões de parâmetros; alta eficiência e desempenho, liderando entre modelos da mesma escala.
Funcionalidade multiarquivo além de uma única janela de contexto: o modelo mantém o estado completo do repositório visível, em vez de lê-lo novamente a cada algumas rodadas.
Vários ciclos experimentais de várias horas, os agentes precisam planejar, executar, ler resultados e corrigir — este é exatamente o volume de trabalho projetado para ser avaliado por FrontierSWE e PostTrainBench.
Gráficos de chamadas completos, saídas do analisador e manter o núcleo e o sistema no mesmo ritmo que tentativas anteriores são necessários.
Seguimento de reprodutibilidade a longo prazo, testes instáveis e falhas cross-service; truncar o contexto é a razão para perder bugs.
Todos os cenários acima podem ser executados em sua própria hardware — pesos do MIT, transformers · vLLM · SGLang · xLLM · ktransformers.Como executar o modelo localmente →
Leia os testes de benchmark do modelo e, em seguida, deixe o modelo real começar a trabalhar. O sandbox acima é gratuito e não requer informações; se você quiser um kit de ferramentas de IA mais completo, o pacote gratuito dos parceiros começa aqui.