GLM-5.3 是旗舰级开源 AI 模型 — 当前编程能力最强的开放权重模型,拥有稳定的 100 万 token 上下文。它在 Terminal-Bench 2.1 上报告得分 88.2,FrontierSWE 上得分 78.1,并在漏洞发现基准 CyberGym 上以 84.5 分达到当前最佳。下方可对比每款 模型 — 或先体验免费 AI 体验场。
无需注册、无需账号、无需额度。输入提示词即可获得流式回答。
回复将在此处流式输出…
本体验场使用 GLM 大语言模型,输入提示词即可获得实时流式回答。
四项能力定义了当前 模型世代 — 均由模型作者报告,可从开放权重复现。
100 万 token 上下文不仅可用,而且保持质量:GLM-5.3 延续了在大规模实现、自动化研究和复杂调试等长上下文编码智能体轨迹上的训练。
在漏洞发现基准 CyberGym 上取得当前最佳成绩(84.5)。真实测试中在 269 个开源项目里识别出 2,436 个漏洞 — 最古老的可追溯至 1981 年。
每四个稀疏注意力层共享一个轻量索引器,在 100 万上下文长度下将每 token FLOPs 降低 2.9 倍,长距离质量无损。
MIT 许可证下的开源 模型:权重发布在 HuggingFace 和 ModelScope,无地区限制,支持通过 transformers、vLLM、SGLang、xLLM 和 ktransformers 本地部署。
以下所有数据均为模型作者发布的 GLM-5.3 及对比模型的结果。glmmodel.net 仅做报告,不运行这些评估。
任务时长可达 20 小时
单张 H100 上最多 10 小时
超长周期软件工程,最多 10 小时
在这些长周期基准测试中,GLM-5.3 均为排名最高的开源模型 — 证明其百万上下文能转化为实际产出。它在 Terminal-Bench 3.0 上从 4.6 提升至 28.3,在 DeepSWE v1.1 上从 46.2 提升至 66.9,在漏洞利用类基准上的得分达到 GLM-5.2 的两倍以上 — 所有提升均来自同一基座模型上的后训练。
已发布的 GLMMODEL 基准结果,涵盖 8 个模型的 16 项评估。
| 基准测试 | GLM-5.3 | GLM-5.2 | Kimi K3 | DeepSeek-V4 Pro | Qwen3.8-Max | Claude Opus 4.8 | Fable 5* | GPT-5.6 Sol |
|---|---|---|---|---|---|---|---|---|
| 编程 | ||||||||
| Terminal-Bench 2.1 | 88.2 | 81.0 | 88.3 | 87.9 | 86.6 | 85.0 | 88.0 | 88.8 |
| Terminal-Bench 3.0 | 28.3 | 4.6 | 17.4 | – | – | 21.1 | 33.7 | 34.6 |
| DeepSWE v1.1 | 66.9 | 46.2 | 67.5 | 62.7 | 56.6 | 58.0 | 69.7 | 72.7 |
| NL2Repo | 58.0 | 48.9 | 58.0 | 61.1 | 55.9 | 69.7 | – | – |
| ProgramBench(Almost Solved) | 19.0 | 9.5 | 17.5 | – | 10.5 | 15.5 | 33.0 | 23.0 |
| FrontierSWE | 78.1 | 67.5 | – | – | – | 66.5 | 88.2 | – |
| SWE-Marathon v1.1 | 42.5 | 19.4 | 48.1 | – | – | 48.8 | 33.1 | 42.5 |
| PostTrainBench | 39.8 | 31.7 | 32.0 | – | – | 32.9 | 41.8 | 36.2 |
| 网络安全 | ||||||||
| CyberGym | 84.5 | 77.2 | 80.0 | 83.3 | 78.5 | 78.1 | 83.8 | 83.6 |
| ExploitGym(2h / 6h) | 105 / 130 | 29 / 39 | 36 / 70 | – | 14 / 26 | 80 / 120 | 181 / 247 | 216 / 293 |
| ExploitBench | 54.4 | 24.4 | 32.2 | – | 28.8 | 40.0 | 78.0 | 76.5 |
| 智能体 | ||||||||
| Toolathlon Verified | 73.0 | 59.9 | 76.5 | 74.1 | 72.5 | 76.2 | 74.7 | 74.9 |
| AutomationBench v1.0.6 | 48.2 | 26.2 | 46.7 | 43.2 | 39.8 | 41.0 | 46.2 | 45.8 |
| Agents' Last Exam(ALE-CLI) | 28.5 | 23.8 | 27.6 | 25.7 | 27.0 | 25.7 | 23.8 | 28.6 |
| HLE(带工具) | 62.5 | 54.7 | 59.8 | 60.0 | 56.2 | 57.9 | 63.9 | 64.5 |
| GDPval-AA v2 | 1769 | 1508 | 1682 | 1590 | 1739 | 1588 | 1743 | 1730 |
* Fable 5 为带 fallback 的报告结果。所有数据均为模型作者发布的结果。
GLM-5.3 始终开启思考,提供三档力度。力度控制让您仅在任务需要时分配更多计算资源 — GLM-5.3 在每一档力度上都以更少的输出 token 胜过 GLM-5.2。
轻量推理
快速编辑、模板代码、常规重构等延迟比深度更重要的场景 — GLM-5.3 不再支持禁用思考,轻量推理默认常开。
~50K 平均 token
大多数智能体编程的默认选择:High 力度下 GLM-5.3 以约 50K 输出 token 达到 31.4%,超过 Claude Opus 4.8(29.5% @ 120K)。
~75K 平均 token
最困难的长周期问题:约 75K 输出 token 达到 34.5%,而 GLM-5.2 为 96K 下 23.4% — 更少 token,更多产出。
数据来自智谱内部基准 Z.ai Code Bench v1.0 — 在真实本地开发环境中评估编码智能体,按力度档位衡量端到端任务完成率。由模型作者报告。GLM-5.3 在每一档力度上的性能与 token 效率均优于 GLM-5.2。
将上下文上限从 200K 提升到 100 万 token 是一个工程问题,而非配置参数。三项改动是关键。
每四个 Transformer 层共享一个轻量索引器。它位于四个层中的第一个,其 top-k 索引被其余三层复用 — 消除了四分之三层中的索引器点积和 top-k 计算。结果:在 100 万上下文长度下每 token FLOPs 降低 2.9 倍。从训练中期 128K 序列长度开始引入 IndexShare。
多 token 预测层在首个草稿步运行一次索引器,并在后续步骤中复用索引,消除了限制上一代的训练/推理 KV 缓存不匹配。结合拒绝采样和端到端 TV 损失,接受长度从 4.56 提升至 5.47 — 约 20% — 跨越 7 个 MTP 步骤。
| 基线 | 4.56 |
| + IndexShare + KVShare | 5.10 |
| + 拒绝采样 | 5.29 |
| + 端到端 TV 损失 | 5.47 (+20%) |
超过几十万 token 后,瓶颈不再是计算,而是 KV 缓存容量、长上下文内核和 CPU 开销。三项修复:基于 LayerSplit 的细粒度内存管理和并行化、与缓存传输管道协调的上下文长度缩放内核优化,以及 CPU 侧缓存管理、请求调度和运行时路径调优。吞吐量优势随上下文增长而扩大。
归一化吞吐量优势
训练栈(slime)结合白盒和黑盒 rollout、紧凑轨迹和子智能体工作流。并行 OPD 训练在大约两天内合并了十余个专家模型,FP8 KV 缓存确保 rollout 内存不超预算。至 GLM-5.3,系统级优化将端到端 RL 训练吞吐量提升超过 2.3 倍。
长周期 RL 会诱生捷径,因此可疑动作先通过基于规则的召回过滤器,再经 LLM 裁判精确度检查。确认的黑客行为被在线拦截并以虚拟工具结果回应,使 rollout 得以继续而非被丢弃。基于 Critic 的 PPO 在单个 rollout 上保持压缩子轨迹的可训练性。
从 30B Flash 级别到百万上下文旗舰 — 选择一款 模型查看完整规格表和基准数据。
编程能力最强的开放权重模型:Z.ai Code Bench 较 GLM-5.2 提升 50%,Terminal-Bench 3.0 与 Agents' Last Exam 开源 SOTA,CyberGym 当前最佳。
GLM-5 系列首个原生多模态模型:总参数 320B / 激活 18B,混合注意力架构,1M 上下文 — 以十分之一价格超越 GLM-5.2。
上一代旗舰:100 万 token 上下文与长周期基座,GLM-5.3 的后训练正建立在其之上。
长周期专精:大幅提升的长周期能力和数小时自主工作的工程级输出。
更强的编程能力、更可靠的多步执行和更好的复杂智能体行为。
基础模型,针对长链、动态智能体场景进行调优。
增强的编程能力、稳定的多步推理和改进的前端生成。
300 亿参数;高效高性能,领先于同规模开源模型。
超越单个上下文窗口的多文件功能:模型将整个仓库状态保持在视野中,而不是每隔几轮重新读取。
数小时的实验循环,智能体需要规划、运行、读取结果和修正 — 这正是 FrontierSWE 和 PostTrainBench 设计来评估的工作负载。
需要完整调用图、分析器输出和先前尝试保持在同一轨迹中的内核和系统工作。
漫长的复现追踪、不稳定测试和跨服务故障,截断上下文正是丢失 Bug 的原因。
以上所有场景均可在您自己的硬件上运行 — MIT 权重,transformers · vLLM · SGLang · xLLM · ktransformers。如何本地运行模型 →