Модели GLM —开源 AI для долгосрочных задач с миллионами контекстных токенов.

GLM-5.2 是Флагман级开源 GLM AI Модель:稳定的 100 万 Контекст token、Не думать / Высокий / Наивысший三档Сила мышления,在 Terminal-Bench 2.1 上报告得分 81.0,FrontierSWE 上得分 74.4。下方可Сравнение每款 Модель GLM — 或先体验免费 AI Площадка для тестирования。

1M
Контекст token
С увеличением до 200K, стабильность при нагрузке на агента.
81.0
Terminal-Bench 2.1
Оценка GLM-5.2 увеличилась по сравнению с GLM-5.1 на 63.5.
MIT
Лицензия на открытом-source
Открытые веса, без региональных ограничений

Бесплатная зона для опыта AI — опыт реального开源 большого языкового модели

Не требуется регистрация, учетная запись или квота. Введите ключевое слово, чтобы получить потоковый ответ.

Ответ будет streamed здесь...

Этот опыт использует большой языковой модель GLM, и вы можете получить потоковый ответ, введя ключевое слово.

Ключевые способности семьи GLM-моделей

Четыре способности определяют текущее поколение моделей GLM — все они сообщены авторами моделей и могут быть воспроизведены с помощью открытых прав.

Стабильные миллионные контексты

100 万 Контекст token不仅可用,而且保持质量:GLM-5.2 在Масштабное внедрение、Автоматизированные исследования和Комплексная отладка等长上下文编码Искусственный интеллект轨迹上进行了训练。

Гибкость в力度思考а

Не думать、Высокий和Наивысший三档让您按任务在延迟与能力之间权衡 — 在Искусственный интеллектПрограммирование评估上,约 63%(~35K 输出 token)到 74%(~83K)。

Архитектура IndexShare

Каждые четыре спarsity attention слоя делят один легковесный индексатор, что снижает FLOPs каждого token в 2,9 раза при длине контекста в 1 миллион, сохраняя качество на長距離無損。

Открытые веса MIT

MIT 许可证下的开源 Модель GLM:权重发布在 HuggingFace 和 ModelScope,无地区限制,支持通过 transformers、vLLM、SGLang、xLLM 和 ktransformers 本地部署。

Результаты базового тестирования GLM 5.2: результаты для долгосрочных периодов

Все данные, приведенные ниже, представляют собой результаты моделей GLM-5.2 и сравнительных моделей, опубликованные авторами моделей. glmmodel.net выполняет только функции отчета, не запуская эти оценки.

Первый开源 модель
74.4%

FrontierSWE

Длительность задачи до 20 часов

GLM-5.274.4
Opus 4.875.1
GPT-5.572.6
Gemini 3.1 Pro39.6
Общий рейтинг на втором месте
34.3%

PostTrainBench

Максимально 10 часов на одном H100

GLM-5.234.3
Opus 4.837.2
Opus 4.728.6
GPT-5.525.0
Второй после серии Opus
13.0%

SWE-Marathon

Сверхдолгосрочное программирование, до 10 часов

GLM-5.213.0
Opus 4.826.0
GPT-5.512.0
Gemini 3.1 Pro4.0

在三项长周期Базовые тесты中,GLM-5.2 均为排名Наивысший的开源Модель — 证明其百万上下文能转化为实际产出,而不仅仅是能接受的 token 数。在 FrontierSWE 上仅落后 Opus 4.8 一分,领先 GPT-5.5 一分,领先上一代 Opus 4.7 十一分。

Terminal-Bench 2.1+17.5
GLM-5.281.0
Opus 4.885.0
GLM-5.163.5
SWE-bench Pro+3.7
GLM-5.262.1
Opus 4.869.2
GLM-5.158.4
NL2Repo+6.2
GLM-5.248.9
Opus 4.869.7
GLM-5.142.7
DeepSWE+28.2 (2.6×)
GLM-5.246.2
GPT-5.570.0
GLM-5.118.0
ProgramBench+12.8
GLM-5.263.7
Opus 4.871.9
GLM-5.150.9
MCP-Atlas+5.0
GLM-5.276.8
Opus 4.877.8
GLM-5.171.8
Tool-Decathlon+7.5
GLM-5.248.2
Opus 4.859.9
GLM-5.140.7
HLE+9.5
GLM-5.240.5
Opus 4.849.8
GLM-5.131.0

Оценки GLM модели в 17 тестах базового уровня

Опубликованные базовые результаты моделей GLM, охватывающие 17 оценок для 8 моделей.

Результаты базового тестирования GLM, охватывающие каждое оценивание и модель.
Базовые тестыGLM-5.2GLM-5.1Qwen3.7-MaxMiniMax M3DeepSeek-V4-ProClaude Opus 4.8GPT-5.5Gemini 3.1 Pro
Дедукция
HLE40.531.041.437.037.749.8*41.4*45.0
HLE (с инструментами)54.752.353.548.257.9*52.2*51.4*
CritPt20.94.613.43.712.920.927.117.7
AIME 202699.295.397.094.695.798.398.2
HMMT 2025 год, ноябрь94.494.095.084.494.496.596.594.8
HMMT февраля 2026 года92.582.697.184.495.296.796.787.3
IMOAnswerBench91.083.890.089.883.581.0
GPQA-Diamond91.286.290.093.090.193.693.694.3
Программирование
SWE-bench Pro62.158.460.659.055.469.258.654.2
NL2Repo48.942.747.242.135.569.750.733.4
DeepSWE46.218.018.020.08.058.070.010.0
ProgramBench63.750.947.871.970.839.5
Terminal-Bench 2.1 (Terminus-2)81.063.575.065.064.085.084.074.0
Terminal-Bench 2.1 (лучший фреймворк)82.7 (Claude Code)69.0 (Claude Code)78.9 (Claude Code)83.4 (Codex)70.7 (Gemini CLI)
FrontierSWE Dominance74.430.529.075.172.639.6
PostTrainBench34.320.137.228.421.6
SWE-Marathon13.01.026.012.04.0
Искусственный интеллект
MCP-Atlas (открытый набор)76.871.876.474.273.677.875.369.2
Tool-Decathlon48.240.752.859.955.648.8

* Оценка на полных данных.

Уровень мышления: без мышления, высокий и максимальный

Модели GLM не имеют только одного уровня скорости. Функция управления усилием позволяет вам распределять дополнительные вычислительные ресурсы только при необходимости.

Не думать

~63%

~35K средний token

Быстрая редактирование, шаблонный код, регулярное重构 и другие сценарии, где важнее задержка, чем глубина.

Наиболее часто используемые

Высокий

~72%

~43K средний token

Стандартный выбор для большинства агентов программирования: качество, близкое к самому высокому уровню, при消耗 около половины токенов.

Наивысший

~74%

~83K средний token

Трудные долгосрочные проблемы — распределяйте дополнительные вычислительные ресурсы только при необходимости.

数据来自 Terminal-Bench 2.1、DeepSWE 和 SWE-Atlas QnA 的平均值,在 Claude Code 2.1.167 上评估。由Модель作者报告。在相近的 token 预算下,GLM-5.2 的表现介于 Claude Opus 4.7 和 Opus 4.8 之间。

Как GLM-модель реализует миллион контекстных единиц?

Повышение верхнего предела контекста с 200K до 1 миллиона token является инженерной проблемой, а не параметром конфигурации. Три изменения являются ключевыми.

Редукция внимания IndexShare

每四个 Transformer 层Общий一个ЛегкийИндексатор。它位于四个层中的第一个,其 top-k 索引被其余三层复用 — 消除了四分之三层中的Индексатор点积和 top-k 计算。结果:在 100 万上下文长度下每 token FLOPs 降低 2.9 倍。从训练中期 128K 序列长度开始引入 IndexShare。

Общий обмен слоев GLM и IndexShare Слой N+3 Слой N+2 Слой N+1 Слой N Общий Индексатор

MTP в сочетании с IndexShare и KVShare

多 token 预测层在首个草稿步运行一次Индексатор,并在后续步骤中复用索引,消除了限制上一代的训练/Дедукция KV 缓存不匹配。结合拒绝采样和端到端 TV 损失,接受长度从 4.56 提升至 5.47 — 约 20% — 跨越 7 个 MTP 步骤。

Эксперимент по абляции длины MTP
Базовый уровень4.56
+ IndexShare + KVShare5.10
+ Отказ от выбора5.29
+ Потеря TV от конца до конца5.47 (+20%)

Эффективная служба для миллиона контекстов

超过几十万 token 后,瓶颈不再是计算,而是 KV 缓存容量、长上下文内核和 CPU 开销。三项修复:基于 LayerSplit 的细粒度内存管理和并行化、与缓存传输管道协调的上下文长度缩放内核优化,以及 CPU 侧缓存管理、请求调度和运行时路径调优。吞吐量优势随上下文增长而扩大。

Преимущество нормализации производительности

Обучение агента с помощью методов 强化 обучения

训练栈(slime)结合白盒和黑盒 rollout、紧凑轨迹和子Искусственный интеллект工作流。并行 OPD 训练在大约两天内合并了十余个专家Модель,FP8 KV 缓存确保 rollout 内存不超预算。

Противоположные хакеры

长周期 RL 会诱生捷径,因此可疑动作先通过基于规则的召回过滤器,再经 LLM 裁判精确度检查。确认的黑客行为被在线拦截并以虚拟工具结果回应,使 rollout 得以继续而非被丢弃。基于 Critic 的 PPO 在单个 rollout 上保持压缩子轨迹的可训练性。

Каждая GLM-модель, описание по версиям

От 30B Flash уровня до миллиона контекстных токенов флагманского уровня — выберите модель GLM и посмотрите таблицу спецификаций и базовые данные.

GLM-5.2ФлагманНовый

Контекст в 1 миллион токенов,开源 SOTA для программирования и долгосрочных задач, более высокая инженерная способность агентов.

GLM-5.1Дедукция

Предыдущее поколение флагмана: значительное улучшение долгосрочных способностей и инженерные результаты работы в течение нескольких часов.

GLM-5Дедукция

Более высокая способность программирования, более надежное многошаговое выполнение и лучшее поведение сложных агентов.

GLM-5-TurboДедукция

Основная модель, оптимизированная для сценариев с длинными цепочками и динамическими интеллектуальными агентами.

GLM-4.7Дедукция

Улучшенные программные возможности, стабильные многошаговые выводы и улучшенная генерация на переднем плане.

GLM-4.7-FlashЛегкий

300 миллиардов параметров; высокая эффективность и производительность, лидирующие в同类 масштабных открытых моделей.

GLM-4.5-AirЛегкий

Маленький GLM модель, отличные показатели производительности на единицу вычислительной мощности.

GLM-ASRГолос

Реальное преобразование голоса в текст в реальном времени, CER до 0,0717.

Перейти к просмотру всех GLM-моделей →

Сцены, где блестит долгосрочный GLM-модель

Масштабное внедрение

Функциональность работы с несколькими файлами, выходящими за пределы одного контекстного окна: модель поддерживает состояние всего репозитория в поле зрения, а не перечитывает его каждые несколько итераций.

Автоматизированные исследования

数小时的实验循环,Искусственный интеллект需要规划、运行、读取结果和修正 — 这正是 FrontierSWE 和 PostTrainBench 设计来评估的工作负载。

Оптимизация производительности

Необходим полный вызов граф, вывод анализатора и сохранение ядра и системы на одном пути в предыдущих попытках.

Комплексная отладка

Долгосрочное отслеживание воспроизведения, нестабильные тесты и跨сервисные сбои, обрезка контекста — это причина потери багов.

以上所有场景均可在您自己的硬件上运行 — MIT 权重,transformers · vLLM · SGLang · xLLM · ktransformers。Как запустить GLM-модель локально →

Частые вопросы о модели GLM

GLM 是一个开放权重的大语言Модель家族,当前Флагман为 GLM-5.2。产品线从 GLM-4.5-Air 和 GLM-4.7,到 GLM-5、GLM-5-Turbo、GLM-5.1 以及现在的 GLM-5.2,还有Голос和视觉变体。每款核心 Модель GLM均在 MIT 许可证下发布,权重完全开放。

GLM-5.2 将上限从 200K 提升到稳定的 100 万 token,输出 token 最多 128K。"稳定"是关键词:Модель在长编码Искусственный интеллект轨迹上进行了训练,因此质量在整个窗口中保持不变,而非在运行变复杂时退化。

已发布的结果包括 Оценка Terminal-Bench 2.1 81.0、Оценка SWE-bench Pro 62.1、FrontierSWE 得分 74.4、PostTrainBench 得分 34.3、Оценка DeepSWE 46.2、Оценка MCP-Atlas 76.8 和 AIME 2026 得分 99.2 — 在三项长周期评估中均为排名Наивысший的开源Модель。完整表格见上方。

取决于任务。GLM-5.2 在 FrontierSWE、PostTrainBench 和 Terminal-Bench 2.1 上领先 GPT-5.5,在几乎所有Программирование行上领先 Gemini 3.1 Pro,而 Claude Opus 4.8 在 SWE-bench Pro、NL2Repo 和 SWE-Marathon 上仍然领先。在 Claude Code 框架下,GLM-5.2 得分 82.7,Opus 4.8 得分 78.9。

它们控制Модель在每个任务上消耗多少计算资源。在Искусственный интеллектПрограммирование评估上,报告曲线约为 63%(~35K 输出 token,Не думать)、72%(~43K,Высокий)和 74%(~83K,Наивысший)。Высокий是实用的默认选择;Наивысший用于真正困难的长周期问题。

是的。核心 Модель GLM权重采用 MIT 许可证,无地区限制,已发布在 HuggingFace 和 ModelScope。支持通过 transformers、vLLM、SGLang、xLLM 和 ktransformers 进行本地Дедукция,您可以在自己的硬件上运行 Модель GLM。

IndexShare 让每四个稀疏注意力层Общий一个ЛегкийИндексатор,其 top-k 索引只计算一次然后复用。这消除了四分之三层中的Индексатор工作,在百万上下文下将每 token FLOPs 降低 2.9 倍 — 这是让百万 token 窗口在服务层面可行的关键改变。

通过 OpenRouter 提供的免费开源大语言Модель — 不是 GLM-5.2,也不使用 GLM 权重。它的存在是为了让您在阅读已发布的 Модель GLM数据时可以即时测试实时Модель。本站所有 GLM 基准数据均为Модель作者报告的结果,而非在此处测量的结果。

Бесплатный опыт реальной AI модели — без необходимости создания аккаунта

阅读 Модель GLMБазовые тесты,然后让真实Модель开始工作。上方的Площадка для тестирования免费且无需任何信息;如果您想要更完整的 AI 工具包,合作伙伴的免费套餐从这里开始。