GLM-5.2 es el modelo de IA GLM de código abierto de nivel insignia: con un contexto de 100,000 tokens estable, sin pensamiento / alto / el más alto en términos de fuerza de pensamiento, reporta una puntuación de 81.0 en Terminal-Bench 2.1 y 74.4 en FrontierSWE. A continuación, puede comparar cada modelo de GLM o primero experimente con el campo de experiencia gratuito de IA.
Sin registro necesario, sin cuenta, sin límites. Ingrese las palabras clave de entrada para obtener respuestas en modo de flujo.
La respuesta se mostrará aquí en forma de flujo...
Esta experiencia utiliza el modelo de gran lenguaje GLM, ingrese las palabras clave de entrada para obtener respuestas en tiempo real en modo de flujo.
Cuatro capacidades definen la generación actual de modelos GLM, todas reportadas por los autores del modelo y reproducibles desde el acceso abierto.
El contexto de 100,000 tokens no solo está disponible, sino que también mantiene la calidad: GLM-5.2 se entrenó en trayectorias de inteligencia artificial de largo contexto en implementaciones a gran escala, investigación automatizada y depuración compleja.
Los niveles de no pensamiento, alto y el más alto le permiten equilibrar entre retraso y capacidad según la tarea — en la evaluación de programación de inteligencia artificial, aproximadamente 63% (~35K tokens de salida) a 74% (~83K).
Cada cuatro capas de atención esparsa comparten un indexador ligero, reduciendo 2.9 veces los FLOPs por token en un contexto de 1 millón de tokens, manteniendo la calidad a largo plazo sin pérdida.
Modelo de código abierto GLM bajo licencia MIT: los pesos se publican en HuggingFace y ModelScope, sin restricciones geográficas, y se admite la implementación local a través de transformers, vLLM, SGLang, xLLM y ktransformers.
Todos los datos siguientes son resultados de GLM-5.2 y modelos comparativos publicados por los autores de los modelos. glmmodel.net solo realiza informes y no ejecuta estas evaluaciones.
Duración de la tarea hasta 20 horas
Hasta 10 horas en una única H100
Ingeniería de software de ciclo largo, hasta 10 horas
En tres evaluaciones de largo plazo, GLM-5.2 es el modelo de código abierto con la mejor posición — lo que demuestra que su capacidad de contexto de un millón de tokens se puede traducir en producción real, no solo en una cantidad de tokens aceptable. En FrontierSWE solo está un punto por detrás de Opus 4.8, un punto por delante de GPT-5.5 y once puntos por delante de la generación anterior Opus 4.7.
Resultados de referencia publicados de modelos GLM, que cubren 17 evaluaciones de 8 modelos.
| Pruebas de referencia | GLM-5.2 | GLM-5.1 | Qwen3.7-Max | MiniMax M3 | DeepSeek-V4-Pro | Claude Opus 4.8 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|---|---|---|---|
| Razón | ||||||||
| HLE | 40.5 | 31.0 | 41.4 | 37.0 | 37.7 | 49.8* | 41.4* | 45.0 |
| HLE (con herramientas) | 54.7 | 52.3 | 53.5 | – | 48.2 | 57.9* | 52.2* | 51.4* |
| CritPt | 20.9 | 4.6 | 13.4 | 3.7 | 12.9 | 20.9 | 27.1 | 17.7 |
| AIME 2026 | 99.2 | 95.3 | 97.0 | – | 94.6 | 95.7 | 98.3 | 98.2 |
| HMMT 2025 de noviembre | 94.4 | 94.0 | 95.0 | 84.4 | 94.4 | 96.5 | 96.5 | 94.8 |
| HMMT Febrero 2026 | 92.5 | 82.6 | 97.1 | 84.4 | 95.2 | 96.7 | 96.7 | 87.3 |
| IMOAnswerBench | 91.0 | 83.8 | 90.0 | – | 89.8 | 83.5 | – | 81.0 |
| GPQA-Diamond | 91.2 | 86.2 | 90.0 | 93.0 | 90.1 | 93.6 | 93.6 | 94.3 |
| Programación | ||||||||
| SWE-bench Pro | 62.1 | 58.4 | 60.6 | 59.0 | 55.4 | 69.2 | 58.6 | 54.2 |
| NL2Repo | 48.9 | 42.7 | 47.2 | 42.1 | 35.5 | 69.7 | 50.7 | 33.4 |
| DeepSWE | 46.2 | 18.0 | 18.0 | 20.0 | 8.0 | 58.0 | 70.0 | 10.0 |
| ProgramBench | 63.7 | 50.9 | – | – | 47.8 | 71.9 | 70.8 | 39.5 |
| Terminal-Bench 2.1 (Terminus-2) | 81.0 | 63.5 | 75.0 | 65.0 | 64.0 | 85.0 | 84.0 | 74.0 |
| Terminal-Bench 2.1 (mejor marco) | 82.7 (Claude Code) | 69.0 (Claude Code) | – | – | – | 78.9 (Claude Code) | 83.4 (Codex) | 70.7 (Gemini CLI) |
| FrontierSWE Dominance | 74.4 | 30.5 | – | – | 29.0 | 75.1 | 72.6 | 39.6 |
| PostTrainBench | 34.3 | 20.1 | – | – | – | 37.2 | 28.4 | 21.6 |
| SWE-Marathon | 13.0 | 1.0 | – | – | – | 26.0 | 12.0 | 4.0 |
| Agente inteligente | ||||||||
| MCP-Atlas (conjunto público) | 76.8 | 71.8 | 76.4 | 74.2 | 73.6 | 77.8 | 75.3 | 69.2 |
| Tool-Decathlon | 48.2 | 40.7 | – | – | 52.8 | 59.9 | 55.6 | 48.8 |
* Puntuación en conjuntos de datos completos.
Los modelos GLM no tienen solo una velocidad. El control de intensidad de pensamiento le permite asignar más recursos de cálculo solo cuando es necesario.
~35K token promedio
Escenarios donde la edición rápida, el código de plantilla, la refactorización convencional y otros son más importantes que la latencia de profundidad.
~43K token promedio
Elección predeterminada para la mayoría de los programas de inteligencia artificial: calidad cercana a la más alta con aproximadamente la mitad del consumo de tokens.
~83K token promedio
Problemas a largo plazo difíciles: asignar recursos de cálculo adicionales solo cuando sea necesario para la tarea.
Los datos provienen del promedio de Terminal-Bench 2.1, DeepSWE y SWE-Atlas QnA, evaluados en Claude Code 2.1.167. Informado por el autor del modelo. En un presupuesto de tokens similar, el rendimiento de GLM-5.2 está entre Claude Opus 4.7 y Opus 4.8.
Elevar el límite de contexto desde 200K a 1 millón de tokens es un problema de ingeniería, no un parámetro de configuración. Tres cambios son cruciales.
Cada cuatro capas de Transformer comparten un índice ligero. Se encuentra en la primera de las cuatro capas, y su índice top-k se repite en las otras tres — eliminando el punto de intersección del índice y el cálculo top-k en un cuarto de las capas. Resultado: cada token reduce 2.9 veces los FLOPs en un contexto de un millón de tokens. IndexShare se introdujo desde la mitad del entrenamiento con una longitud de secuencia de 128K.
Las capas de predicción de múltiples tokens ejecutan el índice una vez en la primera etapa de borrador y luego reutilizan el índice en las etapas posteriores, eliminando la incompatibilidad de cacheo de KV entre el entrenamiento y la inferencia de la generación anterior. Combinado con muestreo de rechazo y pérdida de TV de extremo a extremo, la longitud aceptada aumenta de 4.56 a 5.47 — aproximadamente un 20% — a través de 7 pasos de MTP.
| Base | 4.56 |
| + IndexShare + KVShare | 5.10 |
| + Rechazar muestreo | 5.29 |
| + Pérdida de TV de extremo a extremo | 5.47 (+20%) |
Después de más de cien mil tokens, el cuello de botella ya no es la computación, sino la capacidad de cacheo de KV, el núcleo de contexto largo y los costos de CPU. Tres reparaciones: gestión de memoria de nivel fino y paralelización basada en LayerSplit, optimización del núcleo de escalado de longitud del contexto coordinado con el tubo de transferencia de cacheo, y optimización de gestión de cacheo, programación de solicitudes y ajustes de rutas en tiempo de ejecución en el lado de CPU. La ventaja de capacidad aumenta con el crecimiento del contexto.
Ventaja de capacidad de salida normalizada
El stack de entrenamiento (slime) combina rollout de caja blanca y caja negra, trayectorias compactas y flujos de trabajo de subagentes. El entrenamiento paralelo de OPD combina docenas de modelos expertos en aproximadamente dos días, y el cacheo de KV en FP8 asegura que el rollout no supere el presupuesto de memoria.
El RL a largo plazo puede generar atajos, por lo que las acciones sospechosas se pasan primero a través de un filtro de recuperación basado en reglas, y luego se someten a una revisión de precisión exacta por parte de un LLM. Las actividades de hacking confirmadas se interceptan en línea y se responden con resultados de herramientas virtuales, permitiendo que el rollout continúe en lugar de ser descartado. El PPO basado en Critic mantiene la entrenabilidad de las subrutas compactas en un solo rollout.
Desde el nivel Flash de 30B hasta el pico de 1 millón de tokens de contexto: elija un modelo GLM y consulte la hoja de especificaciones completa y los datos de referencia.
Contexto de 1 millón de tokens, SOTA en tareas de programación y de largo plazo, con mayor capacidad de ingeniería de inteligencia artificial.
La generación anterior de pico: capacidad a largo plazo significativamente mejorada y salida de ingeniería de nivel de proyecto que puede trabajar de manera autónoma durante varias horas.
Mayor capacidad de programación, ejecución más confiable de pasos múltiples y mejor comportamiento de inteligencia artificial compleja.
Modelo base, optimizado para escenarios de inteligencia artificial dinámica y de larga cadena.
Capacidad de programación mejorada, inferencia multistep estable y generación frontal mejorada.
300 millones de parámetros; alta eficiencia y rendimiento, líder en modelos de código abierto de la misma escala.
Modelo GLM de pequeño volumen, excelente rendimiento por unidad de capacidad de cálculo.
Reconocimiento de voz a texto en tiempo real, CER tan bajo como 0.0717.
Funcionalidad de múltiples archivos que supera la ventana de contexto única: el modelo mantiene el estado del repositorio completo en la vista, en lugar de volver a leerlo en cada pocos rounds.
Ciclos de experimentación de varias horas, los agentes necesitan planificar, ejecutar, leer resultados y corregir — esto es exactamente la carga de trabajo que FrontierSWE y PostTrainBench diseñaron para evaluar.
Se requiere un gráfico de llamadas completo, salida del analizador y un núcleo y sistema de trabajo que mantengan el mismo rastro en intentos previos.
Un seguimiento prolongado de la reproducción, pruebas inestables y fallos transversales de servicios, el truncamiento del contexto es la razón de la pérdida de bugs.
Todos estos escenarios se pueden ejecutar en su propio hardware — pesos de MIT, transformers · vLLM · SGLang · xLLM · ktransformers.¿Cómo ejecutar localmente el modelo GLM? →
Lea las pruebas de referencia del modelo GLM y luego deje que el modelo real comience a trabajar. El campo de experiencia aquí es gratuito y sin necesidad de información alguna; si desea un paquete de herramientas de IA más completo, los paquetes gratuitos de los socios comienzan aquí.