GLM 模型 — 为长周期任务打造的百万上下文开源 AI

GLM-5.2 是旗舰级开源 GLM AI 模型:稳定的 100 万 token 上下文、非思考 / 高 / 最高三档思考力度,在 Terminal-Bench 2.1 上报告得分 81.0,FrontierSWE 上得分 74.4。下方可对比每款 GLM 模型 — 或先体验免费 AI 体验场。

1M
token 上下文
从 200K 提升,在智能体负载下保持稳定
81.0
Terminal-Bench 2.1
GLM-5.2 得分,较 GLM-5.1 的 63.5 有所提升
MIT
开源许可证
开放权重,无地区限制

免费 AI 体验场 — 体验实时开源大语言模型

无需注册、无需账号、无需额度。输入提示词即可获得流式回答。

回复将在此处流式输出…

本体验场使用 GLM 大语言模型,输入提示词即可获得实时流式回答。

GLM 模型家族的核心能力

四项能力定义了当前 GLM 模型世代 — 均由模型作者报告,可从开放权重复现。

稳定的百万上下文

100 万 token 上下文不仅可用,而且保持质量:GLM-5.2 在大规模实现、自动化研究和复杂调试等长上下文编码智能体轨迹上进行了训练。

灵活的思考力度

非思考、高和最高三档让您按任务在延迟与能力之间权衡 — 在智能体编程评估上,约 63%(~35K 输出 token)到 74%(~83K)。

IndexShare 架构

每四个稀疏注意力层共享一个轻量索引器,在 100 万上下文长度下将每 token FLOPs 降低 2.9 倍,长距离质量无损。

MIT 开源权重

MIT 许可证下的开源 GLM 模型:权重发布在 HuggingFace 和 ModelScope,无地区限制,支持通过 transformers、vLLM、SGLang、xLLM 和 ktransformers 本地部署。

GLM 5.2 基准测试:长周期结果

以下所有数据均为模型作者发布的 GLM-5.2 及对比模型的结果。glmmodel.net 仅做报告,不运行这些评估。

开源模型第一
74.4%

FrontierSWE

任务时长可达 20 小时

GLM-5.274.4
Opus 4.875.1
GPT-5.572.6
Gemini 3.1 Pro39.6
总排名第二
34.3%

PostTrainBench

单张 H100 上最多 10 小时

GLM-5.234.3
Opus 4.837.2
Opus 4.728.6
GPT-5.525.0
仅次于 Opus 系列
13.0%

SWE-Marathon

超长周期软件工程,最多 10 小时

GLM-5.213.0
Opus 4.826.0
GPT-5.512.0
Gemini 3.1 Pro4.0

在三项长周期基准测试中,GLM-5.2 均为排名最高的开源模型 — 证明其百万上下文能转化为实际产出,而不仅仅是能接受的 token 数。在 FrontierSWE 上仅落后 Opus 4.8 一分,领先 GPT-5.5 一分,领先上一代 Opus 4.7 十一分。

Terminal-Bench 2.1+17.5
GLM-5.281.0
Opus 4.885.0
GLM-5.163.5
SWE-bench Pro+3.7
GLM-5.262.1
Opus 4.869.2
GLM-5.158.4
NL2Repo+6.2
GLM-5.248.9
Opus 4.869.7
GLM-5.142.7
DeepSWE+28.2 (2.6×)
GLM-5.246.2
GPT-5.570.0
GLM-5.118.0
ProgramBench+12.8
GLM-5.263.7
Opus 4.871.9
GLM-5.150.9
MCP-Atlas+5.0
GLM-5.276.8
Opus 4.877.8
GLM-5.171.8
Tool-Decathlon+7.5
GLM-5.248.2
Opus 4.859.9
GLM-5.140.7
HLE+9.5
GLM-5.240.5
Opus 4.849.8
GLM-5.131.0

GLM 模型在 17 项基准测试中的得分

已发布的 GLM 模型基准结果,涵盖 8 个模型的 17 项评估。

已发布的 GLM 模型基准结果,涵盖每项评估和模型
基准测试GLM-5.2GLM-5.1Qwen3.7-MaxMiniMax M3DeepSeek-V4-ProClaude Opus 4.8GPT-5.5Gemini 3.1 Pro
推理
HLE40.531.041.437.037.749.8*41.4*45.0
HLE(带工具)54.752.353.548.257.9*52.2*51.4*
CritPt20.94.613.43.712.920.927.117.7
AIME 202699.295.397.094.695.798.398.2
HMMT 2025年11月94.494.095.084.494.496.596.594.8
HMMT 2026年2月92.582.697.184.495.296.796.787.3
IMOAnswerBench91.083.890.089.883.581.0
GPQA-Diamond91.286.290.093.090.193.693.694.3
编程
SWE-bench Pro62.158.460.659.055.469.258.654.2
NL2Repo48.942.747.242.135.569.750.733.4
DeepSWE46.218.018.020.08.058.070.010.0
ProgramBench63.750.947.871.970.839.5
Terminal-Bench 2.1 (Terminus-2)81.063.575.065.064.085.084.074.0
Terminal-Bench 2.1(最佳框架)82.7 (Claude Code)69.0 (Claude Code)78.9 (Claude Code)83.4 (Codex)70.7 (Gemini CLI)
FrontierSWE Dominance74.430.529.075.172.639.6
PostTrainBench34.320.137.228.421.6
SWE-Marathon13.01.026.012.04.0
智能体
MCP-Atlas(公开集)76.871.876.474.273.677.875.369.2
Tool-Decathlon48.240.752.859.955.648.8

* 为完整数据集上的得分。

思考力度:非思考、高和最高

GLM 模型不是只有一种速度。思考力度控制让您仅在需要时分配更多计算资源。

非思考

~63%

~35K 平均 token

快速编辑、模板代码、常规重构等延迟比深度更重要的场景。

最常用

~72%

~43K 平均 token

大多数智能体编程的默认选择:以约一半的 token 消耗接近最高档的质量。

最高

~74%

~83K 平均 token

困难的长周期问题 — 在任务确实需要时分配额外计算资源。

数据来自 Terminal-Bench 2.1、DeepSWE 和 SWE-Atlas QnA 的平均值,在 Claude Code 2.1.167 上评估。由模型作者报告。在相近的 token 预算下,GLM-5.2 的表现介于 Claude Opus 4.7 和 Opus 4.8 之间。

GLM 模型如何实现百万上下文

将上下文上限从 200K 提升到 100 万 token 是一个工程问题,而非配置参数。三项改动是关键。

IndexShare 稀疏注意力

每四个 Transformer 层共享一个轻量索引器。它位于四个层中的第一个,其 top-k 索引被其余三层复用 — 消除了四分之三层中的索引器点积和 top-k 计算。结果:在 100 万上下文长度下每 token FLOPs 降低 2.9 倍。从训练中期 128K 序列长度开始引入 IndexShare。

GLM 模型层共享与 IndexShare 层 N+3 层 N+2 层 N+1 层 N 共享 索引器

MTP 配合 IndexShare 与 KVShare

多 token 预测层在首个草稿步运行一次索引器,并在后续步骤中复用索引,消除了限制上一代的训练/推理 KV 缓存不匹配。结合拒绝采样和端到端 TV 损失,接受长度从 4.56 提升至 5.47 — 约 20% — 跨越 7 个 MTP 步骤。

MTP 接受长度消融实验
基线4.56
+ IndexShare + KVShare5.10
+ 拒绝采样5.29
+ 端到端 TV 损失5.47 (+20%)

高效服务百万上下文

超过几十万 token 后,瓶颈不再是计算,而是 KV 缓存容量、长上下文内核和 CPU 开销。三项修复:基于 LayerSplit 的细粒度内存管理和并行化、与缓存传输管道协调的上下文长度缩放内核优化,以及 CPU 侧缓存管理、请求调度和运行时路径调优。吞吐量优势随上下文增长而扩大。

归一化吞吐量优势

智能体强化学习训练

训练栈(slime)结合白盒和黑盒 rollout、紧凑轨迹和子智能体工作流。并行 OPD 训练在大约两天内合并了十余个专家模型,FP8 KV 缓存确保 rollout 内存不超预算。

反奖励黑客

长周期 RL 会诱生捷径,因此可疑动作先通过基于规则的召回过滤器,再经 LLM 裁判精确度检查。确认的黑客行为被在线拦截并以虚拟工具结果回应,使 rollout 得以继续而非被丢弃。基于 Critic 的 PPO 在单个 rollout 上保持压缩子轨迹的可训练性。

长周期 GLM 模型大显身手的场景

大规模实现

超越单个上下文窗口的多文件功能:模型将整个仓库状态保持在视野中,而不是每隔几轮重新读取。

自动化研究

数小时的实验循环,智能体需要规划、运行、读取结果和修正 — 这正是 FrontierSWE 和 PostTrainBench 设计来评估的工作负载。

性能优化

需要完整调用图、分析器输出和先前尝试保持在同一轨迹中的内核和系统工作。

复杂调试

漫长的复现追踪、不稳定测试和跨服务故障,截断上下文正是丢失 Bug 的原因。

以上所有场景均可在您自己的硬件上运行 — MIT 权重,transformers · vLLM · SGLang · xLLM · ktransformers。如何本地运行 GLM 模型 →

GLM 模型常见问题

GLM 是一个开放权重的大语言模型家族,当前旗舰为 GLM-5.2。产品线从 GLM-4.5-Air 和 GLM-4.7,到 GLM-5、GLM-5-Turbo、GLM-5.1 以及现在的 GLM-5.2,还有语音和视觉变体。每款核心 GLM 模型均在 MIT 许可证下发布,权重完全开放。

GLM-5.2 将上限从 200K 提升到稳定的 100 万 token,输出 token 最多 128K。"稳定"是关键词:模型在长编码智能体轨迹上进行了训练,因此质量在整个窗口中保持不变,而非在运行变复杂时退化。

已发布的结果包括 Terminal-Bench 2.1 得分 81.0、SWE-bench Pro 得分 62.1、FrontierSWE 得分 74.4、PostTrainBench 得分 34.3、DeepSWE 得分 46.2、MCP-Atlas 得分 76.8 和 AIME 2026 得分 99.2 — 在三项长周期评估中均为排名最高的开源模型。完整表格见上方。

取决于任务。GLM-5.2 在 FrontierSWE、PostTrainBench 和 Terminal-Bench 2.1 上领先 GPT-5.5,在几乎所有编程行上领先 Gemini 3.1 Pro,而 Claude Opus 4.8 在 SWE-bench Pro、NL2Repo 和 SWE-Marathon 上仍然领先。在 Claude Code 框架下,GLM-5.2 得分 82.7,Opus 4.8 得分 78.9。

它们控制模型在每个任务上消耗多少计算资源。在智能体编程评估上,报告曲线约为 63%(~35K 输出 token,非思考)、72%(~43K,高)和 74%(~83K,最高)。高是实用的默认选择;最高用于真正困难的长周期问题。

是的。核心 GLM 模型权重采用 MIT 许可证,无地区限制,已发布在 HuggingFace 和 ModelScope。支持通过 transformers、vLLM、SGLang、xLLM 和 ktransformers 进行本地推理,您可以在自己的硬件上运行 GLM 模型。

IndexShare 让每四个稀疏注意力层共享一个轻量索引器,其 top-k 索引只计算一次然后复用。这消除了四分之三层中的索引器工作,在百万上下文下将每 token FLOPs 降低 2.9 倍 — 这是让百万 token 窗口在服务层面可行的关键改变。

通过 OpenRouter 提供的免费开源大语言模型 — 不是 GLM-5.2,也不使用 GLM 权重。它的存在是为了让您在阅读已发布的 GLM 模型数据时可以即时测试实时模型。本站所有 GLM 基准数据均为模型作者报告的结果,而非在此处测量的结果。

免费体验实时 AI 模型 — 无需账号

阅读 GLM 模型基准测试,然后让真实模型开始工作。上方的体验场免费且无需任何信息;如果您想要更完整的 AI 工具包,合作伙伴的免费套餐从这里开始。