GLMMODEL — IA de código abierto construido para tareas a largo plazo con un millón de contexto

GLM-5.3 es el modelo AI de código abierto insignia — el modelo de pesos abiertos más capaz para la codificación, con un contexto estable de un millón de tokens. Reporta 88.2 en Terminal-Bench 2.1, 78.1 en FrontierSWE y un estado del arte de 84.5 en CyberGym para la detección de vulnerabilidades. Abajo, puedes comparar cada modelo — o experimentar primero el sandbox de AI gratuito.

1M
Contexto de token
Mejorado desde 200K, manteniendo estabilidad bajo carga de agente
88.2
Terminal-Bench 2.1
GLM-5.3 puntuaciones, una mejora sobre las de GLM-5.2's 81.0.
MIT
Licencia de Código Abierto
Peso abierto, sin restricciones geográficas

Centro de Experiencia de IA Gratuita — Experimenta modelos de lenguaje grandes de código abierto en tiempo real

No se requiere registro, no se requiere cuenta, no se requiere cuota. Se pueden obtener respuestas en tiempo real al ingresar palabras de indicación.

La respuesta se transmitirá aquí...

Esta experiencia utiliza el modelo de lenguaje grande GLM, y se pueden obtener respuestas en tiempo real al ingresar palabras de prompt.

Capacidades nucleares de la familia GLMMODEL

Cuatro capacidades definen la generación actual de modelos — todas reportadas por los autores del modelo y reproducibles desde derechos abiertos.

Contextos Estables de Millón

Un contexto de un millón de tokens no solo está disponible sino que también mantiene calidad: GLM-5.3 lleva a cabo el entrenamiento en trayectorias de agente de codificación de largo contexto, como implementación a gran escala, investigación automatizada y depuración compleja.

Capacidad Cibernética Emergente

Estado de la técnica en CyberGym (84.5) para la detección de vulnerabilidades. En pruebas de mundo real identificó 2,436 vulnerabilidades en 269 proyectos de código abierto — la más antigua data de 1981.

Arquitectura de IndexShare

Cada cuatro capas de atención dispersas comparten un indexador ligero, reduciendo las FLOPs por token en un 2.9 veces bajo una longitud de contexto de un millón, manteniendo la calidad a larga distancia sin pérdida.

Peso de Código Abierto de MIT

Modelos de código abierto bajo la licencia MIT: los pesos se publican en HuggingFace y ModelScope, sin restricciones regionales, y soportan la implementación local a través de transformers, vLLM, SGLang, xLLM y ktransformers.

GLM-5.3 Benchmark Test: Coding, Agents & Cyber

Todos los siguientes datos son los resultados del GLM-5.3 y los modelos comparativos publicados por los autores del modelo. glmmodel.net solo proporciona informes y no ejecuta estas evaluaciones.

Código Fuente Abierto SOTA
78.1%

FrontierSWE

La duración de la tarea puede alcanzar 20 horas

GLM-5.378.1
Fable 588.2
Opus 4.866.5
GLM-5.267.5
Beats Opus 4.8 & GPT-5.6
39.8%

PostTrainBench

Hasta 10 horas en una sola tarjeta H100

GLM-5.339.8
Fable 541.8
GPT-5.6 Sol36.2
Opus 4.832.9
2.2× over GLM-5.2
42.5%

SWE-Marathon

Ingeniería de software de ciclo ultra-largo, hasta 10 horas

GLM-5.342.5
Opus 4.848.8
Kimi K348.1
GLM-5.219.4

En estos benchmarks a largo plazo, GLM-5.3 es el modelo de código abierto mejor clasificado; prueba de que su contexto de un millón de tokens se convierte en salida real. Mejora de 4.6 a 28.3 en Terminal-Bench 3.0, de 46.2 a 66.9 en DeepSWE v1.1, y más del doble de GLM-5.2 en benchmarks de explotación; cada ganancia procede del entrenamiento posterior en el mismo modelo base.

Terminal-Bench 2.1+7.2
GLM-5.388.2
GPT-5.6 Sol88.8
Kimi K388.3
GLM-5.281.0
Terminal-Bench 3.0+23.7 (6.2×)
GLM-5.328.3
GPT-5.6 Sol34.6
Fable 533.7
GLM-5.24.6
NL2Repo+9.1
GLM-5.358.0
Opus 4.869.7
DeepSeek-V4 Pro61.1
GLM-5.248.9
DeepSWE v1.1+20.7 (1.4×)
GLM-5.366.9
GPT-5.6 Sol72.7
Kimi K367.5
GLM-5.246.2
ProgramBench (Solved)+9.5 (2.0×)
GLM-5.319.0
Fable 533.0
GPT-5.6 Sol23.0
GLM-5.29.5
Toolathlon Verified+13.1
GLM-5.373.0
Kimi K376.5
Opus 4.876.2
GLM-5.259.9
AutomationBench+22.0 (1.8×)
GLM-5.348.2
Kimi K346.7
GPT-5.6 Sol45.8
GLM-5.226.2
HLE (With Tools)+7.8
GLM-5.362.5
GPT-5.6 Sol64.5
Fable 563.9
GLM-5.254.7

Puntuaciones de GLMMODEL en 16 pruebas de benchmark

Publicados resultados de benchmark de GLMMODEL, cubriendo 16 evaluaciones de 8 modelos.

Publicados resultados de benchmark de GLMMODEL, cubriendo cada evaluación y modelo
Prueba de benchmarkGLM-5.3GLM-5.2Kimi K3DeepSeek-V4 ProQwen3.8-MaxClaude Opus 4.8Fable 5*GPT-5.6 Sol
Codificación
Terminal-Bench 2.188.281.088.387.986.685.088.088.8
Terminal-Bench 3.028.34.617.421.133.734.6
DeepSWE v1.166.946.267.562.756.658.069.772.7
NL2Repo58.048.958.061.155.969.7
ProgramBench (Almost Solved)19.09.517.510.515.533.023.0
FrontierSWE78.167.566.588.2
SWE-Marathon v1.142.519.448.148.833.142.5
PostTrainBench39.831.732.032.941.836.2
Ciber
CyberGym84.577.280.083.378.578.183.883.6
ExploitGym (2h / 6h)105 / 13029 / 3936 / 7014 / 2680 / 120181 / 247216 / 293
ExploitBench54.424.432.228.840.078.076.5
Agente
Toolathlon Verified73.059.976.574.172.576.274.774.9
AutomationBench v1.0.648.226.246.743.239.841.046.245.8
Agents' Last Exam (ALE-CLI)28.523.827.625.727.025.723.828.6
HLE (With Tools)62.554.759.860.056.257.963.964.5
GDPval-AA v217691508168215901739158817431730

* Los resultados de Fable 5 se informan con fallback. Todos los datos son resultados publicados por los autores del modelo.

Esfuerzo de razonamiento: bajo, alto y máximo

GLM-5.3 siempre piensa en tres niveles de intensidad. El control de esfuerzo te permite gastar computación solo cuando la tarea lo requiere — GLM-5.3 vence a GLM-5.2 en cada nivel de esfuerzo mientras consume menos tokens de salida.

Bajo

Rápido

razonamiento ligero

Escenarios donde la latencia importa más que la profundidad, como la edición rápida, el código de plantilla y la refactorización rutinaria — GLM-5.3 ya no desactiva el pensamiento, por lo que la razón ligera permanece activa por defecto.

Más usado

Alto

31.4%

~50K tokens promedio

El valor predeterminado para la codificación de la mayoría de los agentes: con un esfuerzo alto, GLM-5.3 alcanza el 31.4% con aproximadamente 50K tokens de salida, superando a Claude Opus 4.8 (29.5% en 120K).

Máx

34.5%

~75K tokens promedio

Los problemas más difíciles a largo plazo: 34.5% aproximadamente en 75K tokens de salida, versus el 23.4% de GLM-5.2 en 96K — más resultados con menos tokens.

Datos de Z.ai Code Bench v1.0, un benchmark interno que evalúa a los agentes de codificación en entornos de desarrollo local en condiciones reales, medido la finalización de tareas de extremo a extremo a niveles de esfuerzo controlados. Informado por los autores del modelo. GLM-5.3 mejora tanto el rendimiento como la eficiencia de tokens sobre GLM-5.2 en cada nivel de esfuerzo.

¿Cómo logra GLMMODEL un millón de contextos?

Aumentar el límite de contexto de 200K a un millón de tokens es un problema de ingeniería y no un parámetro de configuración. Tres modificaciones son clave.

Atención Sparse en IndexShare

Cada cuatro capas de Transformer comparten un índice ligero. Se encuentra en la primera capa entre las cuatro, y su índice top-k se reutiliza por las otras tres capas —eliminando el producto escalar y el cálculo top-k en tres cuartas partes de las capas. Resultado: Los FLOPs de cada token se reducen 2.9 veces bajo una longitud de contexto de un millón. IndexShare se introdujo a partir de una longitud de secuencia de 128K durante la mitad del entrenamiento.

Compartición de capas del modelo y IndexShare Layer N+3 Layer N+2 Layer N+1 Capa N Compartido Indexador

MTP combinado con IndexShare y KVShare

La capa de predicción de múltiples tokens ejecuta el indexador una vez en el primer paso de borrador y lo reutiliza en pasos posteriores, eliminando el desajuste entre el cache de KV de entrenamiento/inferencia de la generación anterior. Combinado con muestreo de rechazo y pérdida TV de extremo a extremo, la longitud aceptada aumenta de 4.56 a 5.47 — aproximadamente un 20% — a lo largo de 7 pasos MTP.

Experimento de Ablación de Longitud de Aceptación MTP
Línea base4.56
+ IndexShare + KVShare5.10
+ Muestreo de Rechazo5.29
+ Pérdida de TV de extremo a extremo5.47 (+20%)

Servicio eficiente para millones de contextos

Después de más de algunas decenas de miles de tokens, el cuello de botella ya no es la computación, sino la capacidad del cache KV, el kernel de contexto largo y el overhead de CPU. Tres soluciones: gestión de memoria de nivel fino y paralelización basada en LayerSplit, optimización del kernel para la escalabilidad del largo contexto coordinada con el pipeline de transferencia de cache, y gestión de cache, programación de solicitudes y optimización de la ruta de tiempo de ejecución en el lado de CPU. La ventaja de throughput se expande con el crecimiento del contexto.

Ventaja de Tasa de Tráfico Normalizada

Entrenamiento de Aprendizaje por Refuerzo de Agente

La pila de entrenamiento (slime) combina despliegues de caja blanca y caja negra, trayectorias compactas y flujos de sub-agente. El entrenamiento paralelo de OPD fusiona más de una docena de modelos expertos en aproximadamente dos días, y el almacenamiento en caché de KV FP8 mantiene la memoria de despliegue dentro del presupuesto. A través de GLM-5.3, las optimizaciones a nivel de sistema mejoraron el rendimiento de entrenamiento RL de extremo a extremo en más de 2.3×.

Hacker Antirecompensa

El RL a largo plazo puede inducir atajos, por lo que las acciones sospechosas se pasan primero a través de un filtro de recuperación basado en reglas y luego se verifican por precisión mediante el juez LLM. Las acciones maliciosas confirmadas se interceptan en línea y se responden con resultados de herramientas virtuales, permitiendo que las ejecuciones continúen en lugar de ser descartadas. Basado en el PPO de Critic, se mantienen sub-trazas comprimibles para el entrenamiento en una sola ejecución.

Introducción a cada modelo, versión por versión

Desde el nivel Flash de 30B a un flagship de un millón de contexto — elija un modelo para ver la tabla de especificaciones completa y los datos de benchmark.

Ver todos los modelos →

Escenarios en los que los modelos de ciclo largo sobresalen

Implementación a Escala Grande

Funcionalidad multi-archivo más allá de una única ventana de contexto: el modelo mantiene el estado completo del repositorio a la vista, en lugar de volver a leerlo en cada pocos rounds.

Investigación Automatizada

Varios ciclos experimentales de varias horas, los agentes necesitan planificar, ejecutar, leer resultados y corregir; esto es exactamente la carga de trabajo diseñada para ser evaluada por FrontierSWE y PostTrainBench.

Optimización de Rendimiento

Gráficos de llamadas completos, salidas del analizador y mantener el núcleo y el sistema en la misma línea que los intentos anteriores son requeridos.

Depuración Compleja

Seguimiento de reproducibilidad a largo plazo, pruebas inestables y fallos en servicios cruzados; truncar el contexto es la razón por la que se pierden errores.

Todos los escenarios anteriores pueden ejecutarse en su propia hardware — pesos de MIT, transformers · vLLM · SGLang · xLLM · ktransformers.Cómo ejecutar el modelo localmente →

Preguntas comunes sobre GLMMODEL

GLMMODEL cubre una familia de modelos de lenguaje grandes de peso abierto, con el modelo insignia actual siendo GLM-5.3. La línea de productos abarca desde GLM-4.5-Air y GLM-4.7 hasta GLM-5, GLM-5-Turbo, GLM-5.1, GLM-5.2 y ahora GLM-5.3 y el GLM-5.3-Flash multimodal nativo, incluyendo variantes de voz y visual. Cada modelo nuclear se lanza bajo la licencia MIT, con pesos completamente abiertos.

GLM-5.3 mantiene el límite en un millón de tokens estables, con un límite de tokens de salida de hasta 128K. 'Estable' es la palabra clave: el modelo ha sido entrenado en trayectorias de agente de codificación a largo plazo, por lo que la calidad se mantiene constante a lo largo del intervalo. GLM-5.3-Flash también alcanza 1M de contexto con una arquitectura de atención lineal híbrida que corta drásticamente los costos de servicio de contexto largo.

Los resultados publicados incluyen 88.2 en Terminal-Bench 2.1, 28.3 en Terminal-Bench 3.0 (SOTA de código abierto), 78.1 en FrontierSWE, 66.9 en DeepSWE v1.1, 84.5 en CyberGym (estado del arte) y 28.5 en el Último Examen de Agentes — el modelo de código abierto de clasificación más alta en evaluaciones de codificación, ciber y agencia a largo plazo. La tabla completa se muestra arriba.

Como se escaló después del entrenamiento, la capacidad de descubrimiento de vulnerabilidades creció más rápido de lo esperado: GLM-5.3 es el estado de la técnica en CyberGym (84.5) y más del doble que GLM-5.2 en ExploitBench (54.4 vs 24.4). En pruebas reales con equipos de seguridad, identificó 2,436 vulnerabilidades en 269 proyectos de código abierto, algunos con fecha de 1981.

Depende de la tarea. GLM-5.3 lidera a Opus 4.8 y GPT-5.6 Sol en FrontierSWE, DeepSWE, AutomationBench y CyberGym, y empata con GPT-5.6 Sol en SWE-Marathon (42.5). Los modelos de frontera cerrados aún lideran en Terminal-Bench 3.0, ExploitGym y NL2Repo. En Z.ai Code Bench con esfuerzo alto, GLM-5.3 (31.4% a ~50K tokens) supera a Opus 4.8 (29.5% a 120K).

GLM-5.3 siempre piensa y ofrece tres niveles de esfuerzo. En Z.ai Code Bench v1.0 alcanza el 31.4% en Alto esfuerzo (~50K tokens de salida) y 34.5% en Máximo (~75K), superando a GLM-5.2 en cada nivel mientras utiliza menos tokens. Alto es el valor predeterminado práctico; Máximo está reservado para los problemas más difíciles a largo plazo.

Sí. Los pesos del modelo nuclear están bajo la licencia MIT, sin restricciones regionales, y han sido liberados en HuggingFace y ModelScope. Los pesos del GLM-5.3-Flash también son públicos, soportando SGLang, vLLM y TokenSpeed para inferencia local — por lo que puedes ejecutar modelos en tu propio hardware.

IndexShare permite que cada cuatro capas de atención dispersas compartan un indexador ligero, cuyo índice top-k se calcula solo una vez y luego se reutiliza. Esto elimina el trabajo del indexador en tres cuartas partes de las capas, reduciendo los FLOPs de cada token en 2.9 veces bajo un contexto de un millón de tokens; un cambio clave que hace posible una ventana de un millón de tokens a nivel de servicio.

Grandes modelos de lenguaje de código abierto gratuitos proporcionados a través de OpenRouter — no GLM-5.3, y sin usar pesos de GLM. Su existencia es permitirle probar modelos en tiempo real inmediatamente al leer datos de modelos publicados. Todos los datos de benchmark en este sitio son los resultados informados por los autores del modelo, no medidos aquí.

Experiencia gratuita de modelo de IA en tiempo real — sin necesidad de cuenta

Lee las pruebas de benchmark del modelo y luego deja que el modelo real comience a trabajar. El sandbox superior es gratuito y no requiere información; si deseas un kit de herramientas de IA más completo, el paquete gratuito de los socios comienza aquí.