GLM-5.3 es el modelo AI de código abierto insignia — el modelo de pesos abiertos más capaz para la codificación, con un contexto estable de un millón de tokens. Reporta 88.2 en Terminal-Bench 2.1, 78.1 en FrontierSWE y un estado del arte de 84.5 en CyberGym para la detección de vulnerabilidades. Abajo, puedes comparar cada modelo — o experimentar primero el sandbox de AI gratuito.
No se requiere registro, no se requiere cuenta, no se requiere cuota. Se pueden obtener respuestas en tiempo real al ingresar palabras de indicación.
La respuesta se transmitirá aquí...
Esta experiencia utiliza el modelo de lenguaje grande GLM, y se pueden obtener respuestas en tiempo real al ingresar palabras de prompt.
Cuatro capacidades definen la generación actual de modelos — todas reportadas por los autores del modelo y reproducibles desde derechos abiertos.
Un contexto de un millón de tokens no solo está disponible sino que también mantiene calidad: GLM-5.3 lleva a cabo el entrenamiento en trayectorias de agente de codificación de largo contexto, como implementación a gran escala, investigación automatizada y depuración compleja.
Estado de la técnica en CyberGym (84.5) para la detección de vulnerabilidades. En pruebas de mundo real identificó 2,436 vulnerabilidades en 269 proyectos de código abierto — la más antigua data de 1981.
Cada cuatro capas de atención dispersas comparten un indexador ligero, reduciendo las FLOPs por token en un 2.9 veces bajo una longitud de contexto de un millón, manteniendo la calidad a larga distancia sin pérdida.
Modelos de código abierto bajo la licencia MIT: los pesos se publican en HuggingFace y ModelScope, sin restricciones regionales, y soportan la implementación local a través de transformers, vLLM, SGLang, xLLM y ktransformers.
Todos los siguientes datos son los resultados del GLM-5.3 y los modelos comparativos publicados por los autores del modelo. glmmodel.net solo proporciona informes y no ejecuta estas evaluaciones.
La duración de la tarea puede alcanzar 20 horas
Hasta 10 horas en una sola tarjeta H100
Ingeniería de software de ciclo ultra-largo, hasta 10 horas
En estos benchmarks a largo plazo, GLM-5.3 es el modelo de código abierto mejor clasificado; prueba de que su contexto de un millón de tokens se convierte en salida real. Mejora de 4.6 a 28.3 en Terminal-Bench 3.0, de 46.2 a 66.9 en DeepSWE v1.1, y más del doble de GLM-5.2 en benchmarks de explotación; cada ganancia procede del entrenamiento posterior en el mismo modelo base.
Publicados resultados de benchmark de GLMMODEL, cubriendo 16 evaluaciones de 8 modelos.
| Prueba de benchmark | GLM-5.3 | GLM-5.2 | Kimi K3 | DeepSeek-V4 Pro | Qwen3.8-Max | Claude Opus 4.8 | Fable 5* | GPT-5.6 Sol |
|---|---|---|---|---|---|---|---|---|
| Codificación | ||||||||
| Terminal-Bench 2.1 | 88.2 | 81.0 | 88.3 | 87.9 | 86.6 | 85.0 | 88.0 | 88.8 |
| Terminal-Bench 3.0 | 28.3 | 4.6 | 17.4 | – | – | 21.1 | 33.7 | 34.6 |
| DeepSWE v1.1 | 66.9 | 46.2 | 67.5 | 62.7 | 56.6 | 58.0 | 69.7 | 72.7 |
| NL2Repo | 58.0 | 48.9 | 58.0 | 61.1 | 55.9 | 69.7 | – | – |
| ProgramBench (Almost Solved) | 19.0 | 9.5 | 17.5 | – | 10.5 | 15.5 | 33.0 | 23.0 |
| FrontierSWE | 78.1 | 67.5 | – | – | – | 66.5 | 88.2 | – |
| SWE-Marathon v1.1 | 42.5 | 19.4 | 48.1 | – | – | 48.8 | 33.1 | 42.5 |
| PostTrainBench | 39.8 | 31.7 | 32.0 | – | – | 32.9 | 41.8 | 36.2 |
| Ciber | ||||||||
| CyberGym | 84.5 | 77.2 | 80.0 | 83.3 | 78.5 | 78.1 | 83.8 | 83.6 |
| ExploitGym (2h / 6h) | 105 / 130 | 29 / 39 | 36 / 70 | – | 14 / 26 | 80 / 120 | 181 / 247 | 216 / 293 |
| ExploitBench | 54.4 | 24.4 | 32.2 | – | 28.8 | 40.0 | 78.0 | 76.5 |
| Agente | ||||||||
| Toolathlon Verified | 73.0 | 59.9 | 76.5 | 74.1 | 72.5 | 76.2 | 74.7 | 74.9 |
| AutomationBench v1.0.6 | 48.2 | 26.2 | 46.7 | 43.2 | 39.8 | 41.0 | 46.2 | 45.8 |
| Agents' Last Exam (ALE-CLI) | 28.5 | 23.8 | 27.6 | 25.7 | 27.0 | 25.7 | 23.8 | 28.6 |
| HLE (With Tools) | 62.5 | 54.7 | 59.8 | 60.0 | 56.2 | 57.9 | 63.9 | 64.5 |
| GDPval-AA v2 | 1769 | 1508 | 1682 | 1590 | 1739 | 1588 | 1743 | 1730 |
* Los resultados de Fable 5 se informan con fallback. Todos los datos son resultados publicados por los autores del modelo.
GLM-5.3 siempre piensa en tres niveles de intensidad. El control de esfuerzo te permite gastar computación solo cuando la tarea lo requiere — GLM-5.3 vence a GLM-5.2 en cada nivel de esfuerzo mientras consume menos tokens de salida.
razonamiento ligero
Escenarios donde la latencia importa más que la profundidad, como la edición rápida, el código de plantilla y la refactorización rutinaria — GLM-5.3 ya no desactiva el pensamiento, por lo que la razón ligera permanece activa por defecto.
~50K tokens promedio
El valor predeterminado para la codificación de la mayoría de los agentes: con un esfuerzo alto, GLM-5.3 alcanza el 31.4% con aproximadamente 50K tokens de salida, superando a Claude Opus 4.8 (29.5% en 120K).
~75K tokens promedio
Los problemas más difíciles a largo plazo: 34.5% aproximadamente en 75K tokens de salida, versus el 23.4% de GLM-5.2 en 96K — más resultados con menos tokens.
Datos de Z.ai Code Bench v1.0, un benchmark interno que evalúa a los agentes de codificación en entornos de desarrollo local en condiciones reales, medido la finalización de tareas de extremo a extremo a niveles de esfuerzo controlados. Informado por los autores del modelo. GLM-5.3 mejora tanto el rendimiento como la eficiencia de tokens sobre GLM-5.2 en cada nivel de esfuerzo.
Aumentar el límite de contexto de 200K a un millón de tokens es un problema de ingeniería y no un parámetro de configuración. Tres modificaciones son clave.
Cada cuatro capas de Transformer comparten un índice ligero. Se encuentra en la primera capa entre las cuatro, y su índice top-k se reutiliza por las otras tres capas —eliminando el producto escalar y el cálculo top-k en tres cuartas partes de las capas. Resultado: Los FLOPs de cada token se reducen 2.9 veces bajo una longitud de contexto de un millón. IndexShare se introdujo a partir de una longitud de secuencia de 128K durante la mitad del entrenamiento.
La capa de predicción de múltiples tokens ejecuta el indexador una vez en el primer paso de borrador y lo reutiliza en pasos posteriores, eliminando el desajuste entre el cache de KV de entrenamiento/inferencia de la generación anterior. Combinado con muestreo de rechazo y pérdida TV de extremo a extremo, la longitud aceptada aumenta de 4.56 a 5.47 — aproximadamente un 20% — a lo largo de 7 pasos MTP.
| Línea base | 4.56 |
| + IndexShare + KVShare | 5.10 |
| + Muestreo de Rechazo | 5.29 |
| + Pérdida de TV de extremo a extremo | 5.47 (+20%) |
Después de más de algunas decenas de miles de tokens, el cuello de botella ya no es la computación, sino la capacidad del cache KV, el kernel de contexto largo y el overhead de CPU. Tres soluciones: gestión de memoria de nivel fino y paralelización basada en LayerSplit, optimización del kernel para la escalabilidad del largo contexto coordinada con el pipeline de transferencia de cache, y gestión de cache, programación de solicitudes y optimización de la ruta de tiempo de ejecución en el lado de CPU. La ventaja de throughput se expande con el crecimiento del contexto.
Ventaja de Tasa de Tráfico Normalizada
La pila de entrenamiento (slime) combina despliegues de caja blanca y caja negra, trayectorias compactas y flujos de sub-agente. El entrenamiento paralelo de OPD fusiona más de una docena de modelos expertos en aproximadamente dos días, y el almacenamiento en caché de KV FP8 mantiene la memoria de despliegue dentro del presupuesto. A través de GLM-5.3, las optimizaciones a nivel de sistema mejoraron el rendimiento de entrenamiento RL de extremo a extremo en más de 2.3×.
El RL a largo plazo puede inducir atajos, por lo que las acciones sospechosas se pasan primero a través de un filtro de recuperación basado en reglas y luego se verifican por precisión mediante el juez LLM. Las acciones maliciosas confirmadas se interceptan en línea y se responden con resultados de herramientas virtuales, permitiendo que las ejecuciones continúen en lugar de ser descartadas. Basado en el PPO de Critic, se mantienen sub-trazas comprimibles para el entrenamiento en una sola ejecución.
Desde el nivel Flash de 30B a un flagship de un millón de contexto — elija un modelo para ver la tabla de especificaciones completa y los datos de benchmark.
El modelo de pesos abiertos más capaz para codificación: +50% en Z.ai Code Bench, SOTA de código abierto en Terminal-Bench 3.0 y Agents' Last Exam, estado de la técnica en CyberGym.
Primer modelo-5.3 multimodal nativo: 320B parámetros totales / 18B parámetros activos, atención híbrida, 1M contexto — rendimiento superior al GLM-5.2 a una décima parte del precio.
Generación anterior de flagship: un contexto de un millón de tokens y la base a largo plazo en la que se basa el post-entrenamiento de GLM-5.3.
Especialista de largo plazo: mejora significativa en capacidades a largo plazo y outputs a nivel de ingeniería que pueden trabajar de manera autónoma durante varias horas.
Capabilities de programación más fuertes, ejecución multi-pasos más confiable y comportamiento de agente complejo mejorado.
Modelo básico, optimizado para escenarios de cadenas largas y agentes inteligentes dinámicos.
Capabilities de programación mejoradas, inferencia multi-pasos estable y generación de frontend mejorada.
300 mil millones de parámetros; alta eficiencia y rendimiento, líder entre los modelos de la misma escala.
Funcionalidad multi-archivo más allá de una única ventana de contexto: el modelo mantiene el estado completo del repositorio a la vista, en lugar de volver a leerlo en cada pocos rounds.
Varios ciclos experimentales de varias horas, los agentes necesitan planificar, ejecutar, leer resultados y corregir; esto es exactamente la carga de trabajo diseñada para ser evaluada por FrontierSWE y PostTrainBench.
Gráficos de llamadas completos, salidas del analizador y mantener el núcleo y el sistema en la misma línea que los intentos anteriores son requeridos.
Seguimiento de reproducibilidad a largo plazo, pruebas inestables y fallos en servicios cruzados; truncar el contexto es la razón por la que se pierden errores.
Todos los escenarios anteriores pueden ejecutarse en su propia hardware — pesos de MIT, transformers · vLLM · SGLang · xLLM · ktransformers.Cómo ejecutar el modelo localmente →
Lee las pruebas de benchmark del modelo y luego deja que el modelo real comience a trabajar. El sandbox superior es gratuito y no requiere información; si deseas un kit de herramientas de IA más completo, el paquete gratuito de los socios comienza aquí.