GLMMODEL — IA de código aberto construída para tarefas de longo prazo com um milhão de contexto

GLM-5.3 é o modelo AI de código aberto flagship — o modelo de pesos abertos mais capacitado para codificação, com um contexto estável de um milhão de tokens. Ele reporta 88,2 em Terminal-Bench 2.1, 78,1 em FrontierSWE e um estado da arte de 84,5 em CyberGym para descoberta de vulnerabilidades. Abaixo, você pode comparar cada modelo — ou experimentar primeiro o sandbox gratuito de AI.

1M
Contexto de Token
Aprimorado de 200K, mantendo estabilidade sob carga do agente
88.2
Terminal-Bench 2.1
GLM-5.3 scores, uma melhoria sobre os 81.0 do GLM-5.2.
MIT
Licença de Código Aberto
Peso Aberto, Sem Restrições Geográficas

Centro de Experiência de IA Gratuita — Experimente modelos de linguagem grandes de código aberto em tempo real

Não é necessário registro, não é necessário conta, não é necessário quota. Respostas de streaming em tempo real podem ser obtidas ao inserir palavras de prompt.

A resposta será transmitida aqui...

Esta experiência utiliza o modelo de linguagem grande GLM, e respostas em tempo real podem ser obtidas ao inserir palavras de prompt.

Capacidades principais da família GLMMODEL

Quatro capacidades definem a geração atual dos modelos — todas reportadas pelos autores do modelo e reproduzíveis por direitos abertos.

Contextos Estáveis de Milhões

Um contexto de um milhão de tokens não só está disponível como mantém qualidade: o GLM-5.3 transfere treinamento em trajetórias de agente de codificação de longo contexto, como implementação em larga escala, pesquisa automatizada e depuração complexa.

Capacidade Cibernética Emergente

Estado da arte no CyberGym (84,5) para descoberta de vulnerabilidades. Em testes reais, identificou 2.436 vulnerabilidades em 269 projetos de código aberto — o mais antigo remonta a 1981.

Arquitetura IndexShare

Cada quatro camadas de atenção esparsa compartilham um índice leve, reduzindo os FLOPs por token em 2,9 vezes sob uma comprimento de contexto de um milhão, mantendo a qualidade de longo alcance sem perda.

Peso Aberto do MIT

Modelos de código aberto sob a licença MIT: pesos são publicados no HuggingFace e ModelScope, sem restrições regionais, e suportam implantação local através de transformers, vLLM, SGLang, xLLM e ktransformers.

Teste de Benchmark do GLM-5.3: Coding, Agents & Cyber

Todos os seguintes dados são os resultados do GLM-5.3 e dos modelos comparativos publicados pelos autores do modelo. glmmodel.net apenas fornece relatórios e não executa essas avaliações.

Open-Source SOTA
78.1%

FrontierSWE

A duração da tarefa pode alcançar 20 horas

GLM-5.378.1
Fable 588.2
Opus 4.866.5
GLM-5.267.5
Beats Opus 4.8 & GPT-5.6
39.8%

PostTrainBench

Até 10 horas em um único cartão H100

GLM-5.339.8
Fable 541.8
GPT-5.6 Sol36.2
Opus 4.832.9
2.2× over GLM-5.2
42.5%

SWE-Marathon

Engenharia de software de ciclo ultra-longo, até 10 horas

GLM-5.342.5
Opus 4.848.8
Kimi K348.1
GLM-5.219.4

Ao longo desses benchmarks de longo prazo, o GLM-5.3 é o modelo open-source de maior ranking — prova de que seu contexto de um milhão de tokens se converte em saída real. Melhora de 4.6 para 28.3 no Terminal-Bench 3.0, de 46.2 para 66.9 no DeepSWE v1.1, e mais do dobro do GLM-5.2 nos benchmarks de exploração — todas as melhorias vêm do pós-treinamento no mesmo modelo base.

Terminal-Bench 2.1+7.2
GLM-5.388.2
GPT-5.6 Sol88.8
Kimi K388.3
GLM-5.281.0
Terminal-Bench 3.0+23.7 (6.2×)
GLM-5.328.3
GPT-5.6 Sol34.6
Fable 533.7
GLM-5.24.6
NL2Repo+9.1
GLM-5.358.0
Opus 4.869.7
DeepSeek-V4 Pro61.1
GLM-5.248.9
DeepSWE v1.1+20.7 (1.4×)
GLM-5.366.9
GPT-5.6 Sol72.7
Kimi K367.5
GLM-5.246.2
ProgramBench (Solved)+9.5 (2.0×)
GLM-5.319.0
Fable 533.0
GPT-5.6 Sol23.0
GLM-5.29.5
Toolathlon Verified+13.1
GLM-5.373.0
Kimi K376.5
Opus 4.876.2
GLM-5.259.9
AutomationBench+22.0 (1.8×)
GLM-5.348.2
Kimi K346.7
GPT-5.6 Sol45.8
GLM-5.226.2
HLE (With Tools)+7.8
GLM-5.362.5
GPT-5.6 Sol64.5
Fable 563.9
GLM-5.254.7

Pontuações do GLMMODEL em 16 testes de benchmark

Publicados resultados de benchmark do GLMMODEL, cobrindo 16 avaliações de 8 modelos.

Publicados resultados de benchmark do GLMMODEL, cobrindo cada avaliação e modelo
Teste de BenchmarkGLM-5.3GLM-5.2Kimi K3DeepSeek-V4 ProQwen3.8-MaxClaude Opus 4.8Fable 5*GPT-5.6 Sol
Codificação
Terminal-Bench 2.188.281.088.387.986.685.088.088.8
Terminal-Bench 3.028.34.617.421.133.734.6
DeepSWE v1.166.946.267.562.756.658.069.772.7
NL2Repo58.048.958.061.155.969.7
ProgramBench (Almost Solved)19.09.517.510.515.533.023.0
FrontierSWE78.167.566.588.2
SWE-Marathon v1.142.519.448.148.833.142.5
PostTrainBench39.831.732.032.941.836.2
Ciber
CyberGym84.577.280.083.378.578.183.883.6
ExploitGym (2h / 6h)105 / 13029 / 3936 / 7014 / 2680 / 120181 / 247216 / 293
ExploitBench54.424.432.228.840.078.076.5
Agente
Toolathlon Verified73.059.976.574.172.576.274.774.9
AutomationBench v1.0.648.226.246.743.239.841.046.245.8
Agents' Last Exam (ALE-CLI)28.523.827.625.727.025.723.828.6
HLE (With Tools)62.554.759.860.056.257.963.964.5
GDPval-AA v217691508168215901739158817431730

Resultados do Fable 5 são reportados com fallback. Todos os dados são resultados publicados pelos autores do modelo.

Esforço de raciocínio: baixo, alto e máximo

GLM-5.3 sempre pensa, em três níveis de intensidade. O controle de esforço permite que você gaste computação apenas quando a tarefa exigir — GLM-5.3 vence o GLM-5.2 em cada nível de esforço enquanto consome menos tokens de saída.

Baixo

Rápido

raciocínio leve

Cenários onde a latência importa mais do que a profundidade, como edição rápida, código de modelo e refatoração rotineira — o GLM-5.3 já não desativa o pensamento, então a raciocínio leve permanece ativado por padrão.

Mais usado

Alto

31.4%

~50K tokens médios

O padrão para a maioria da codificação de agente: com esforço alto, o GLM-5.3 alcança 31.4% com cerca de 50K tokens de saída, superando o Claude Opus 4.8 (29.5% com 120K).

Máx

34.5%

~75K tokens médios

Os problemas mais difíceis de longo prazo: 34,5% aproximadamente em 75K tokens de saída, versus 23,4% do GLM-5.2 em 96K — mais resultados com menos tokens.

Dados do Z.ai Code Bench v1.0, um benchmark interno que avalia agentes de codificação em ambientes de desenvolvimento locais realistas, medindo a conclusão de tarefas de ponta a ponta em níveis de esforço controlados. Relatados pelos autores do modelo. O GLM-5.3 melhora tanto o desempenho quanto a eficiência de tokens em relação ao GLM-5.2 em todos os níveis de esforço.

Como GLMMODEL alcança um milhão de contextos?

Aumentar o limite de contexto de 200K para um milhão de tokens é um problema de engenharia, não um parâmetro de configuração. Três modificações são essenciais.

Atenção Esparsa do IndexShare

Cada quatro camadas Transformer compartilham um indexador leve. Ele está localizado na primeira camada entre as quatro, e seu índice top-k é reutilizado pelas outras três camadas — eliminando o produto escalar e o cálculo top-k em três-quartos das camadas. Resultado: O FLOPs de cada token é reduzido em 2,9 vezes sob uma comprimento de contexto de um milhão. IndexShare foi introduzido a partir de uma sequência de comprimento de 128K durante a fase intermediária do treinamento.

Modelo de compartilhamento de camadas e IndexShare Layer N+3 Layer N+2 Layer N+1 Camada N Compartilhado Indexador

MTP combinado com IndexShare e KVShare

A camada de predição de múltiplos tokens executa o indexador uma vez na primeira etapa do rascunho e o reutiliza nas etapas subsequentes, eliminando o desalinhamento entre o cache KV de treinamento/inferência da geração anterior. Combinado com amostragem de rejeição e perda TV de ponta a ponta, o comprimento aceito aumenta de 4.56 para 5.47 — cerca de 20% — ao longo de 7 etapas MTP.

Experimento de Ablação de Comprimento de Aceitação do MTP
Linha de base4.56
+ IndexShare + KVShare5.10
+ Amostragem de Rejeição5.29
+ Perda Total de TV5.47 (+20%)

Serviço eficiente para milhões de contextos

Após mais de algumas dezenas de milhares de tokens, o gargalo não é mais a computação, mas a capacidade do cache KV, o kernel de contexto longo e o overhead da CPU. Três correções: gerenciamento de memória fino e paralelização baseada em LayerSplit, otimização do kernel para escalonamento do comprimento do contexto coordenado com o pipeline de transferência de cache e gerenciamento de cache, agendamento de solicitações e otimização da rota de tempo de execução do lado da CPU. A vantagem de throughput se expande com o crescimento do contexto.

Vantagem de Throughput Normalizada

Treinamento de Aprendizado por Reforço de Agente

A pilha de treinamento (slime) combina rollouts de caixa branca e caixa preta, trajetórias compactas e workflows de sub-agente. O treinamento paralelo OPD une mais de uma dúzia de modelos especializados em cerca de dois dias, e o caching de KV FP8 mantém a memória de rollout dentro do orçamento. Através do GLM-5.3, otimizações de nível de sistema melhoraram o throughput de treinamento RL de ponta a ponta em mais de 2,3×.

Hacker Antirecompensa

O RL a longo prazo pode induzir atalhos, então ações suspeitas são primeiramente passadas por um filtro de recall baseado em regras e, em seguida, verificadas pela precisão do juiz LLM. Ações maliciosas confirmadas são interceptadas online e respondidas com resultados de ferramentas virtuais, permitindo que as rollouts continuem em vez de serem descartadas. Baseado no PPO do Critic, sub-traces comprimíveis são mantidas para treinamento em uma única rollout.

Introdução a cada modelo, versão a versão

De nível Flash 30B a um topo de um milhão de contextos — escolha um modelo para visualizar a tabela de especificações completa e os dados de benchmark.

Ver todos os modelos →

Cenários onde modelos de ciclo longo se destacam

Implementação em Escala Grande

Funcionalidade multiarquivo além de uma única janela de contexto: o modelo mantém o estado completo do repositório visível, em vez de lê-lo novamente a cada algumas rodadas.

Pesquisa Automatizada

Vários ciclos experimentais de várias horas, os agentes precisam planejar, executar, ler resultados e corrigir — este é exatamente o volume de trabalho projetado para ser avaliado por FrontierSWE e PostTrainBench.

Otimização de Desempenho

Gráficos de chamadas completos, saídas do analisador e manter o núcleo e o sistema no mesmo ritmo que tentativas anteriores são necessários.

Debugging Complexo

Seguimento de reprodutibilidade a longo prazo, testes instáveis e falhas cross-service; truncar o contexto é a razão para perder bugs.

Todos os cenários acima podem ser executados em sua própria hardware — pesos do MIT, transformers · vLLM · SGLang · xLLM · ktransformers.Como executar o modelo localmente →

Perguntas Comuns sobre GLMMODEL

O GLMMODEL cobre uma família de grandes modelos de linguagem abertos de peso variável, com o atual modelo flagship sendo o GLM-5.3. A linha de produtos varia de GLM-4.5-Air e GLM-4.7 a GLM-5, GLM-5-Turbo, GLM-5.1, GLM-5.2 e agora GLM-5.3 e o GLM-5.3-Flash multimodal nativo, incluindo variantes de voz e visuais. Cada modelo core é lançado sob a licença MIT, com pesos completamente abertos.

GLM-5.3 mantém o limite em um milhão de tokens estáveis, com um limite de tokens de saída de até 128K. 'Estável' é a palavra-chave: o modelo foi treinado com trajetórias de agente de código longo, então a qualidade permanece consistente ao longo da janela. GLM-5.3-Flash também alcança 1M de contexto com uma arquitetura de atenção linear esparsa híbrida que corta drasticamente os custos de serviço de contexto longo.

Resultados publicados incluem 88,2 em Terminal-Bench 2.1, 28,3 em Terminal-Bench 3.0 (SOTA de código aberto), 78,1 em FrontierSWE, 66,9 em DeepSWE v1.1, 84,5 em CyberGym (estado da arte) e 28,5 no Último Exame dos Agentes — o modelo de código aberto de maior ranking em avaliações de codificação, ciber e agente de longo prazo. A tabela completa é mostrada acima.

A capacidade de descoberta de vulnerabilidades, após o treinamento escalado, cresceu mais rápido do que o esperado: o GLM-5.3 é o estado da arte no CyberGym (84.5) e mais do dobro do GLM-5.2 no ExploitBench (54.4 vs 24.4). Em testes reais com equipes de segurança, identificou 2.436 vulnerabilidades em 269 projetos de código aberto, alguns datando de 1981.

Dependendo da tarefa. O GLM-5.3 lidera o Opus 4.8 e o GPT-5.6 Sol em FrontierSWE, DeepSWE, AutomationBench e CyberGym, e empatou com o GPT-5.6 Sol no SWE-Marathon (42.5). Os modelos de fronteira fechados ainda lideram no Terminal-Bench 3.0, ExploitGym e NL2Repo. No Z.ai Code Bench com esforço alto, o GLM-5.3 (31.4% em ~50K tokens) supera o Opus 4.8 (29.5% em 120K).

GLM-5.3 sempre pensa e oferece três níveis de esforço. No Z.ai Code Bench v1.0, alcança 31,4% no nível Alto (~50K tokens de saída) e 34,5% no Máximo (~75K), superando o GLM-5.2 em todos os níveis enquanto usa menos tokens. Alto é o padrão prático; Máximo é reservado para os problemas mais difíceis de longo prazo.

Sim. Os pesos do modelo central estão sob a licença MIT, sem restrições regionais, e foram lançados no HuggingFace e ModelScope. Os pesos do GLM-5.3-Flash também são públicos, suportando SGLang, vLLM e TokenSpeed para inferência local — então você pode executar modelos em sua própria hardware.

O IndexShare permite que cada quatro camadas de atenção esparsa compartilhem um indexador leve, cujo índice top-k é calculado apenas uma vez e então reutilizado. Isso elimina o trabalho do indexador em três-quartos das camadas, reduzindo os FLOPs de cada token em 2.9 vezes sob um contexto de um milhão de tokens — uma mudança chave que torna uma janela de um milhão de tokens viável no nível do serviço.

Grandes modelos de linguagem de código aberto e gratuitos fornecidos através do OpenRouter — não o GLM-5.3 e não usando pesos do GLM. Sua existência é permitir que você teste modelos em tempo real imediatamente ao ler dados de modelos publicados. Todos os dados de benchmark neste site são os resultados relatados pelos autores do modelo, não medidos aqui.

Experiência Grátis de Modelo de IA em Tempo Real — Não é necessário conta

Leia os testes de benchmark do modelo e, em seguida, deixe o modelo real começar a trabalhar. O sandbox acima é gratuito e não requer informações; se você quiser um kit de ferramentas de IA mais completo, o pacote gratuito dos parceiros começa aqui.