Catálogo completo de 64 modelos: chat de texto, razonamiento, visión, generación de imágenes/video, voz, búsqueda AI, código, embeddings.
Datos actualizados en agosto de 2026
Último modelo insignia y el modelo de pesos abiertos más capaz para la codificación: +50% sobre GLM-5.2 en el Terminal-Bench 3.0 y Agents' Last Exam, estado de la técnica en CyberGym (84.5) para la detección de vulnerabilidades
Primer modelo-5 multimodal nativo: 320B parámetros totales / 18B parámetros activos, primer modelo frontera abierto con atención lineal híbrida sparse, visión nativa al ciclo de codificación, supera a GLM-5.2 a una décima parte del precio
Modelo insignia de la generación anterior: 1M contexto sin pérdida, capacidad de codificación de código abierto SOTA de su generación, admite la ejecución estable de tareas a largo plazo complejas — la base sobre la que GLM-5.3 post-entrenamiento se construye
Capacidad de codificación alineada con Claude Opus 4.6, mejora significativa en tareas a largo plazo, puede funcionar de manera independiente hasta 8 horas
Capacidad de programación alineada con Claude Opus 4.5, competente en planificación y ejecución de largo plazo agente
Optimización especial para tareas largas, buena continuidad en la ejecución de tareas complejas a largo plazo
Mejora completa de la capacidad de diálogo general, razonamiento y agente, programación más fuerte y estable, mejor estética
Ligero y de alta velocidad, pequeño tamaño con gran capacidad, adecuado para escenarios generales como escritura en chino, traducción, rol, etc.
Modelo gratuito, proporcionando una experiencia inclusiva, extendiendo las capacidades generales del modelo base GLM-4.7
Contexto mejorado a 200K, competente en codificación avanzada, razonamiento complejo y invocación de herramientas
Un modelo general equilibrado en rendimiento y costo, adecuado para diálogos, análisis y procesamiento de documentos
Modelo ligero de alto rendimiento y costo efectivo, con rendimiento estable en inferencia, codificación y tareas de agente
Versión ultra-rápida de alto rendimiento y costo efectivo, adecuada para escenarios de negocios con baja latencia y alta respuesta
Modelo gratuito, admite modo de pensamiento profundo, admite procesamiento de contexto de 128K
Soporta una longitud de contexto de 1M, diseñado para procesar textos largos y tareas intensivas en memoria
Modelo insignia de cuarta generación, capacidades comprehensivas fuertes (versión antigua)
Modelo ligero, velocidad rápida y bajo costo (versión antigua)
Versión ligera rápida, velocidad de respuesta más rápida (Versión antigua)
Modelo específico de agente, optimizado para escenarios de agente (Versión antigua)
Versión de alta velocidad mejorada con Flash, velocidad de inferencia rápida, adecuada para escenarios de llamadas de alta concurrencia
Modelo gratuito, compatible con procesamiento de contexto largo, adecuado para escenarios de comprensión multilingüe e invocación de herramientas
Modelo de texto insignia de versión antigua, discontinuado el 30 de diciembre de 2025
Modelo de Inferencia Profunda, Versión de Alto Rendimiento, retirado el 15 de noviembre de 2025
Modelo de Inferencia Profunda, Versión Ultra-Rápida, retirado el 15 de noviembre de 2025
Modelo de Inferencia Profunda, Versión Rápida y Económica, retirado el 15 de noviembre de 2025
Primer modelo base de agente multimodal, que equilibra la comprensión visual, la razón y la generación de código, admitiendo entradas multimodales de imágenes, videos y texto
Mejora de la capacidad de razonamiento visual, soportando llamadas de herramientas y contextos largos de manera nativa, con efectos de clonación de código de frontend más estables
Modelo de Razonamiento Visual de Alto Rendimiento, soporta invocación de herramientas y contexto largo
Modelo de razonamiento visual gratuito, compatible con invocación de herramientas y contexto largo, con cambio flexible de modo de pensamiento
Modelo de comprensión visual, que admite la entrada de archivos de imagen y video
Modelo de razonamiento visual ligero, competente en la comprensión de escenas complejas y análisis de múltiples pasos
Modelo de razonamiento visual gratuito, competente en la comprensión de escenas complejas y análisis de múltiples pasos
Versión antigua del modelo de reconocimiento de imágenes-texto-vídeo (versión antigua)
Modelo de comprensión de imágenes gratuito con capacidades básicas de pregunta-respuesta multimodal
Modelo multimodal visual de primera generación (versión antigua)
Modelo ligero de análisis de imágenes-texto, equilibrando alta precisión y eficiencia en la comprensión de documentos, soportando análisis de diseño complejo
Marco de asistente inteligente móvil, que admite el lenguaje natural para completar tareas de operación de aplicaciones, cubriendo el conjunto completo de comandos de operación móvil
Modelo de generación de imágenes insignia, más fuerte en el seguimiento de instrucciones complejas y la generación intensiva en conocimientos, destacado en la renderización de texto, especialmente para caracteres chinos
Modelo de generación de imágenes general, generación de alta calidad, expresión de estilo rica y diversa, detalles de imagen más completos
Modelo de generación de imágenes mejorado, mejora la calidad de las imágenes, admite más estilos artísticos
Modelo de generación de imágenes general, admite múltiples resoluciones y estilos (versión antigua)
Modelo gratuito de generación de imágenes, generación creativa flexible, velocidad de generación rápida
Modelo de video insignia de alta inteligencia, con calidad de imagen clara, mayor cumplimiento de comandos y simulación física, que admite la generación de los primeros y últimos cuadros
Modelo de generación de video de alta calidad, con calidad de imagen clara, transiciones suaves, expresión de estilo más rica y puede reducir la distorsión de la imagen
Modelo de video de alta velocidad y bajo costo, con velocidad de generación rápida, conexión natural entre el primer y el último cuadro, y mayor consistencia con múltiples imágenes de referencia
Modelo estándar de generación de video, que admite salida de múltiples resoluciones
Modelo de generación de video gratuito, compatible con efectos de sonido AI, calidad de imagen 4K, 60fps, y una longitud máxima de video de 10 segundos
Modelo de síntesis de voz, que admite generación de voz ultrahumana y expresión emocional, proporcionando interfaces de transmisión y no transmisión
Modelo de clonación de voz, capaz de generar una voz similar rápidamente en 3 segundos, soportando expresiones emocionales delicadas
Modelo de reconocimiento de voz de alta precisión, con baja tasa de error de caracteres, soporte para vocabulario personalizado y varios dialectos
Modelo de diálogo de voz en tiempo real, compatible con comprensión y generación de voz en chino e inglés, ajustable en emoción, tono y velocidad
Modelo de audio-video en tiempo real, compatible con llamadas de video y memoria de diálogo a largo plazo, inferencia en tiempo real de texto, audio y video cruzado
Herramienta de búsqueda de IA mejorada, recupera profundamente información web, admite consultas complejas y búsquedas en varias rondas
Herramienta de búsqueda de IA estándar, recupera rápidamente información web, adecuada para escenarios de búsqueda general
Mejora de búsqueda del Motor Sogou, combinado con los resultados de búsqueda de Sogou para proporcionar una recuperación de información más precisa
Mejora de búsqueda del Motor Quark, combinado con los resultados de búsqueda de Quark para proporcionar una recuperación de contenido más completa
Modelo de completación de código, adecuado para la completación automática de código y asistencia en desarrollo, mejorando la eficiencia de codificación
Tercera generación de modelo vectorial, utilizado para mejorar la recuperación semántica, agrupación, modelado de temas y clasificación, mejorando significativamente el efecto
Modelo vectorial de segunda generación, utilizado para mejora de recuperación semántica, agrupación y clasificación (versión antigua)
Modelo de reordenamiento de texto, calcula la puntuación de relevancia del texto, optimiza el ordenamiento y el efecto de coincidencia de los resultados de recuperación
Modelo de conversación animada, adecuado para acompañamiento emocional y interacción con personajes virtuales, que admite expresiones de personaje más naturales
Modelo de apoyo psicológico y emocional, con capacidades de asesoramiento profesional y guía emocional, ayudando a los usuarios a entender las emociones y a lidiar con problemas
Modelo de 9B parámetros de código abierto, admite 128K de contexto, puede ser desplegado localmente, licencia MIT
Tercera generación de modelo de diálogo de código abierto de 6B, la primera generación de la serie ChatGLM, licencia MIT