GLMMODEL — 为长周期任务打造的百万上下文开源 AI

GLM-5.3 是旗舰级开源 AI 模型 — 当前编程能力最强的开放权重模型,拥有稳定的 100 万 token 上下文。它在 Terminal-Bench 2.1 上报告得分 88.2,FrontierSWE 上得分 78.1,并在漏洞发现基准 CyberGym 上以 84.5 分达到当前最佳。下方可对比每款 模型 — 或先体验免费 AI 体验场。

1M
token 上下文
从 200K 提升,在智能体负载下保持稳定
88.2
Terminal-Bench 2.1
GLM-5.3 得分,较 GLM-5.2 的 81.0 有所提升
MIT
开源许可证
开放权重,无地区限制

免费 AI 体验场 — 体验实时开源大语言模型

无需注册、无需账号、无需额度。输入提示词即可获得流式回答。

回复将在此处流式输出…

本体验场使用 GLM 大语言模型,输入提示词即可获得实时流式回答。

GLMMODEL 家族的核心能力

四项能力定义了当前 模型世代 — 均由模型作者报告,可从开放权重复现。

稳定的百万上下文

100 万 token 上下文不仅可用,而且保持质量:GLM-5.3 延续了在大规模实现、自动化研究和复杂调试等长上下文编码智能体轨迹上的训练。

涌现的网络安全能力

在漏洞发现基准 CyberGym 上取得当前最佳成绩(84.5)。真实测试中在 269 个开源项目里识别出 2,436 个漏洞 — 最古老的可追溯至 1981 年。

IndexShare 架构

每四个稀疏注意力层共享一个轻量索引器,在 100 万上下文长度下将每 token FLOPs 降低 2.9 倍,长距离质量无损。

MIT 开源权重

MIT 许可证下的开源 模型:权重发布在 HuggingFace 和 ModelScope,无地区限制,支持通过 transformers、vLLM、SGLang、xLLM 和 ktransformers 本地部署。

GLM-5.3 基准测试:编程、智能体与网络安全

以下所有数据均为模型作者发布的 GLM-5.3 及对比模型的结果。glmmodel.net 仅做报告,不运行这些评估。

开源 SOTA
78.1%

FrontierSWE

任务时长可达 20 小时

GLM-5.378.1
Fable 588.2
Opus 4.866.5
GLM-5.267.5
胜过 Opus 4.8 与 GPT-5.6
39.8%

PostTrainBench

单张 H100 上最多 10 小时

GLM-5.339.8
Fable 541.8
GPT-5.6 Sol36.2
Opus 4.832.9
较 GLM-5.2 提升 2.2 倍
42.5%

SWE-Marathon

超长周期软件工程,最多 10 小时

GLM-5.342.5
Opus 4.848.8
Kimi K348.1
GLM-5.219.4

在这些长周期基准测试中,GLM-5.3 均为排名最高的开源模型 — 证明其百万上下文能转化为实际产出。它在 Terminal-Bench 3.0 上从 4.6 提升至 28.3,在 DeepSWE v1.1 上从 46.2 提升至 66.9,在漏洞利用类基准上的得分达到 GLM-5.2 的两倍以上 — 所有提升均来自同一基座模型上的后训练。

Terminal-Bench 2.1+7.2
GLM-5.388.2
GPT-5.6 Sol88.8
Kimi K388.3
GLM-5.281.0
Terminal-Bench 3.0+23.7(6.2×)
GLM-5.328.3
GPT-5.6 Sol34.6
Fable 533.7
GLM-5.24.6
NL2Repo+9.1
GLM-5.358.0
Opus 4.869.7
DeepSeek-V4 Pro61.1
GLM-5.248.9
DeepSWE v1.1+20.7(1.4×)
GLM-5.366.9
GPT-5.6 Sol72.7
Kimi K367.5
GLM-5.246.2
ProgramBench(Almost Solved)+9.5(2.0×)
GLM-5.319.0
Fable 533.0
GPT-5.6 Sol23.0
GLM-5.29.5
Toolathlon Verified+13.1
GLM-5.373.0
Kimi K376.5
Opus 4.876.2
GLM-5.259.9
AutomationBench+22.0(1.8×)
GLM-5.348.2
Kimi K346.7
GPT-5.6 Sol45.8
GLM-5.226.2
HLE(带工具)+7.8
GLM-5.362.5
GPT-5.6 Sol64.5
Fable 563.9
GLM-5.254.7

GLMMODEL 在 16 项基准测试中的得分

已发布的 GLMMODEL 基准结果,涵盖 8 个模型的 16 项评估。

已发布的 GLMMODEL 基准结果,涵盖每项评估和模型
基准测试GLM-5.3GLM-5.2Kimi K3DeepSeek-V4 ProQwen3.8-MaxClaude Opus 4.8Fable 5*GPT-5.6 Sol
编程
Terminal-Bench 2.188.281.088.387.986.685.088.088.8
Terminal-Bench 3.028.34.617.421.133.734.6
DeepSWE v1.166.946.267.562.756.658.069.772.7
NL2Repo58.048.958.061.155.969.7
ProgramBench(Almost Solved)19.09.517.510.515.533.023.0
FrontierSWE78.167.566.588.2
SWE-Marathon v1.142.519.448.148.833.142.5
PostTrainBench39.831.732.032.941.836.2
网络安全
CyberGym84.577.280.083.378.578.183.883.6
ExploitGym(2h / 6h)105 / 13029 / 3936 / 7014 / 2680 / 120181 / 247216 / 293
ExploitBench54.424.432.228.840.078.076.5
智能体
Toolathlon Verified73.059.976.574.172.576.274.774.9
AutomationBench v1.0.648.226.246.743.239.841.046.245.8
Agents' Last Exam(ALE-CLI)28.523.827.625.727.025.723.828.6
HLE(带工具)62.554.759.860.056.257.963.964.5
GDPval-AA v217691508168215901739158817431730

* Fable 5 为带 fallback 的报告结果。所有数据均为模型作者发布的结果。

推理力度:low、high 与 max

GLM-5.3 始终开启思考,提供三档力度。力度控制让您仅在任务需要时分配更多计算资源 — GLM-5.3 在每一档力度上都以更少的输出 token 胜过 GLM-5.2。

Low

快速

轻量推理

快速编辑、模板代码、常规重构等延迟比深度更重要的场景 — GLM-5.3 不再支持禁用思考,轻量推理默认常开。

最常用

High

31.4%

~50K 平均 token

大多数智能体编程的默认选择:High 力度下 GLM-5.3 以约 50K 输出 token 达到 31.4%,超过 Claude Opus 4.8(29.5% @ 120K)。

Max

34.5%

~75K 平均 token

最困难的长周期问题:约 75K 输出 token 达到 34.5%,而 GLM-5.2 为 96K 下 23.4% — 更少 token,更多产出。

数据来自智谱内部基准 Z.ai Code Bench v1.0 — 在真实本地开发环境中评估编码智能体,按力度档位衡量端到端任务完成率。由模型作者报告。GLM-5.3 在每一档力度上的性能与 token 效率均优于 GLM-5.2。

GLMMODEL 如何实现百万上下文

将上下文上限从 200K 提升到 100 万 token 是一个工程问题,而非配置参数。三项改动是关键。

IndexShare 稀疏注意力

每四个 Transformer 层共享一个轻量索引器。它位于四个层中的第一个,其 top-k 索引被其余三层复用 — 消除了四分之三层中的索引器点积和 top-k 计算。结果:在 100 万上下文长度下每 token FLOPs 降低 2.9 倍。从训练中期 128K 序列长度开始引入 IndexShare。

GLMMODEL 层共享与 IndexShare 层 N+3 层 N+2 层 N+1 层 N 共享 索引器

MTP 配合 IndexShare 与 KVShare

多 token 预测层在首个草稿步运行一次索引器,并在后续步骤中复用索引,消除了限制上一代的训练/推理 KV 缓存不匹配。结合拒绝采样和端到端 TV 损失,接受长度从 4.56 提升至 5.47 — 约 20% — 跨越 7 个 MTP 步骤。

MTP 接受长度消融实验
基线4.56
+ IndexShare + KVShare5.10
+ 拒绝采样5.29
+ 端到端 TV 损失5.47 (+20%)

高效服务百万上下文

超过几十万 token 后,瓶颈不再是计算,而是 KV 缓存容量、长上下文内核和 CPU 开销。三项修复:基于 LayerSplit 的细粒度内存管理和并行化、与缓存传输管道协调的上下文长度缩放内核优化,以及 CPU 侧缓存管理、请求调度和运行时路径调优。吞吐量优势随上下文增长而扩大。

归一化吞吐量优势

智能体强化学习训练

训练栈(slime)结合白盒和黑盒 rollout、紧凑轨迹和子智能体工作流。并行 OPD 训练在大约两天内合并了十余个专家模型,FP8 KV 缓存确保 rollout 内存不超预算。至 GLM-5.3,系统级优化将端到端 RL 训练吞吐量提升超过 2.3 倍。

反奖励黑客

长周期 RL 会诱生捷径,因此可疑动作先通过基于规则的召回过滤器,再经 LLM 裁判精确度检查。确认的黑客行为被在线拦截并以虚拟工具结果回应,使 rollout 得以继续而非被丢弃。基于 Critic 的 PPO 在单个 rollout 上保持压缩子轨迹的可训练性。

长周期 模型大显身手的场景

大规模实现

超越单个上下文窗口的多文件功能:模型将整个仓库状态保持在视野中,而不是每隔几轮重新读取。

自动化研究

数小时的实验循环,智能体需要规划、运行、读取结果和修正 — 这正是 FrontierSWE 和 PostTrainBench 设计来评估的工作负载。

性能优化

需要完整调用图、分析器输出和先前尝试保持在同一轨迹中的内核和系统工作。

复杂调试

漫长的复现追踪、不稳定测试和跨服务故障,截断上下文正是丢失 Bug 的原因。

以上所有场景均可在您自己的硬件上运行 — MIT 权重,transformers · vLLM · SGLang · xLLM · ktransformers。如何本地运行模型 →

GLMMODEL 常见问题

GLMMODEL 收录 GLM 开放权重大语言模型家族,当前旗舰为 GLM-5.3。产品线从 GLM-4.5-Air 和 GLM-4.7,到 GLM-5、GLM-5-Turbo、GLM-5.1、GLM-5.2 以及现在的 GLM-5.3 和原生多模态的 GLM-5.3-Flash,还有语音和视觉变体。每款核心 模型均在 MIT 许可证下发布,权重完全开放。

GLM-5.3 保持稳定的 100 万 token 上下文,输出 token 最多 128K。"稳定"是关键词:模型在长编码智能体轨迹上进行了训练,质量在整个窗口中保持一致。GLM-5.3-Flash 同样支持 1M 上下文,并以稀疏-线性混合注意力架构大幅降低长上下文服务成本。

已发布的结果包括 Terminal-Bench 2.1 得分 88.2、Terminal-Bench 3.0 得分 28.3(开源 SOTA)、FrontierSWE 得分 78.1、DeepSWE v1.1 得分 66.9、CyberGym 得分 84.5(当前最佳)和 Agents' Last Exam 得分 28.5 — 在编程、网络安全与长周期智能体评估中均为排名最高的开源模型。完整表格见上方。

随着后训练规模扩大,漏洞发现能力以超出预期的速度提升:GLM-5.3 在 CyberGym 上取得当前最佳成绩(84.5),在 ExploitBench 上的得分(54.4 对 24.4)达到 GLM-5.2 的两倍以上。在与安全团队的真实测试中,它在 269 个开源项目里识别出 2,436 个漏洞,最古老的漏洞可追溯至 1981 年。

取决于任务。GLM-5.3 在 FrontierSWE、DeepSWE、AutomationBench 和 CyberGym 上领先 Opus 4.8 与 GPT-5.6 Sol,在 SWE-Marathon 上与 GPT-5.6 Sol 战平(42.5)。闭源前沿模型仍在 Terminal-Bench 3.0、ExploitGym 和 NL2Repo 上领先。在 Z.ai Code Bench High 力度下,GLM-5.3(31.4% @ ~50K token)超过 Opus 4.8(29.5% @ 120K)。

GLM-5.3 始终开启思考,提供三档力度。在 Z.ai Code Bench v1.0 上,High 力度达到 31.4%(~50K 输出 token),Max 力度达到 34.5%(~75K),在每一档上均以更少 token 胜过 GLM-5.2。High 是实用的默认选择;Max 用于真正困难的长周期问题。

是的。核心 模型权重采用 MIT 许可证,无地区限制,已发布在 HuggingFace 和 ModelScope。GLM-5.3-Flash 权重同样开放,支持 SGLang、vLLM 和 TokenSpeed 本地推理 — 您可以在自己的硬件上运行 模型。

IndexShare 让每四个稀疏注意力层共享一个轻量索引器,其 top-k 索引只计算一次然后复用。这消除了四分之三层中的索引器工作,在百万上下文下将每 token FLOPs 降低 2.9 倍 — 这是让百万 token 窗口在服务层面可行的关键改变。

通过 OpenRouter 提供的免费开源大语言模型 — 不是 GLM-5.3,也不使用 GLM 权重。它的存在是为了让您在阅读已发布的 模型数据时可以即时测试实时模型。本站所有 基准数据均为模型作者报告的结果,而非在此处测量的结果。

免费体验实时 AI 模型 — 无需账号

阅读 GLMMODEL 基准测试,然后让真实模型开始工作。上方的体验场免费且无需任何信息;如果您想要更完整的 AI 工具包,合作伙伴的免费套餐从这里开始。