GLM-5.3は旗艦オープンソースのAIモデルであり、コーディング用の最も能力のあるオープンウェイトモデルで、100万トークンの安定したコンテキストを持っています。Terminal-Bench 2.1で88.2、FrontierSWEで78.1、CyberGymで最先端の84.5と、脆弱性の発見のための評価を示しています。以下で各モデルを比較したり、無料のAIサンドボックスを体験できます。
登録不要、アカウント不要、クオータ不要。プロンプトワードを入力することでリアルタイムストリーミングレスポンスを取得できます。
ここに返信がストリーミングで表示されます…
この体験はGLM大規模言語モデルを使用し、プロンプトワードを入力することでリアルタイムストリーミングレスポンスを取得できます。
四つの機能がモデルの現代世代を定義しています - モデルの著者によって報告され、オープンライツから再現可能です。
10万トークンのコンテキストが利用可能であり、しかも品質を維持しています:GLM-5.3は、大規模な実装、自動化された研究、複雑なデバッグなどの長文コーディングエージェントのトレースにトレーニングを継続しています。
CyberGym(84.5)での最先端の脆弱性発見。現実世界のテストでは、269のオープンソースプロジェクトで2,436の脆弱性が特定され、最も古いのは1981年にまで遡る。
4層のスパースアテンションレイヤーごとに軽量インデックスャーを共有し、1百万の文脈長でトークンあたりのFLOPsを2.9倍に減少させつつ、遠距離の品質を失わずに維持します。
MITライセンスのオープンソースモデル:重みはHuggingFaceとModelScopeに公開され、地域制限なく、transformers、vLLM、SGLang、xLLM、ktransformersを通じてローカルデプロイメントをサポートします。
以下のすべてのデータは、モデル作者が発表したGLM-5.3および比較モデルの結果です。glmmodel.netは報告のみを提供し、これらの評価を実行しません。
タスクの持续时间は20時間に達する
1 H100カードで最大10時間
10時間までの超長サイクルソフトウェアエンジニアリング
これらの長期スパンベンチマークでは、GLM-5.3が最上位のオープンソースモデルであり、その100万トークンのコンテキストが実際のオプトアウトに変換される証拠です。Terminal-Bench 3.0では4.6から28.3、DeepSWE v1.1では46.2から66.9に向上し、GLM-5.2のエクスプロイトベンチマークでは2倍以上に向上しました。これらの全ての向上は、同じベースモデルに対するトレーニング後のポストトレーニングによるものです。
モデルのベンチマーク結果を公開しました。8モデルの16評価をカバーしています
| バenchmarkテスト | GLM-5.3 | GLM-5.2 | Kimi K3 | DeepSeek-V4 Pro | Qwen3.8-Max | Claude Opus 4.8 | Fable 5* | GPT-5.6 Sol |
|---|---|---|---|---|---|---|---|---|
| コーディング | ||||||||
| Terminal-Bench 2.1 | 88.2 | 81.0 | 88.3 | 87.9 | 86.6 | 85.0 | 88.0 | 88.8 |
| Terminal-Bench 3.0 | 28.3 | 4.6 | 17.4 | – | – | 21.1 | 33.7 | 34.6 |
| DeepSWE v1.1 | 66.9 | 46.2 | 67.5 | 62.7 | 56.6 | 58.0 | 69.7 | 72.7 |
| NL2Repo | 58.0 | 48.9 | 58.0 | 61.1 | 55.9 | 69.7 | – | – |
| ProgramBench (Almost Solved) | 19.0 | 9.5 | 17.5 | – | 10.5 | 15.5 | 33.0 | 23.0 |
| FrontierSWE | 78.1 | 67.5 | – | – | – | 66.5 | 88.2 | – |
| SWE-Marathon v1.1 | 42.5 | 19.4 | 48.1 | – | – | 48.8 | 33.1 | 42.5 |
| PostTrainBench | 39.8 | 31.7 | 32.0 | – | – | 32.9 | 41.8 | 36.2 |
| サイバー | ||||||||
| CyberGym | 84.5 | 77.2 | 80.0 | 83.3 | 78.5 | 78.1 | 83.8 | 83.6 |
| ExploitGym (2h / 6h) | 105 / 130 | 29 / 39 | 36 / 70 | – | 14 / 26 | 80 / 120 | 181 / 247 | 216 / 293 |
| ExploitBench | 54.4 | 24.4 | 32.2 | – | 28.8 | 40.0 | 78.0 | 76.5 |
| エージェント | ||||||||
| Toolathlon Verified | 73.0 | 59.9 | 76.5 | 74.1 | 72.5 | 76.2 | 74.7 | 74.9 |
| AutomationBench v1.0.6 | 48.2 | 26.2 | 46.7 | 43.2 | 39.8 | 41.0 | 46.2 | 45.8 |
| Agents' Last Exam (ALE-CLI) | 28.5 | 23.8 | 27.6 | 25.7 | 27.0 | 25.7 | 23.8 | 28.6 |
| HLE (With Tools) | 62.5 | 54.7 | 59.8 | 60.0 | 56.2 | 57.9 | 63.9 | 64.5 |
| GDPval-AA v2 | 1769 | 1508 | 1682 | 1590 | 1739 | 1588 | 1743 | 1730 |
Fable 5の結果はフェールバックで報告されます。すべてのデータはモデルの著者によって公開された結果です。
GLM-5.3は常に3つの強度レベルで考える。努力制御により、タスクが必要なときだけ計算リソースを消費できます — GLM-5.3はすべての努力レベルでGLM-5.2を凌ぎつつ、より少ない出力トークンを消費します。
軽量推論
拡張子が深さよりも latancy(遅延)が重要なシナリオ、例えば素早い編集、テンプレートコード、ルーチン的なリファクタリングなどで、GLM-5.3は思考を無効にするのをやめ、軽い推論がデフォルトでオンになります。
50K平均トークン
大多数エージェントコーディングのデフォルト:高努力でGLM-5.3は約50Kの出力トークンで31.4%に達し、Claude Opus 4.8(120Kで29.5%)を越えます。
75K平均トークン
最も難しい長期展望の問題:約75K出力トークンで34.5%、GLM-5.2の96Kで23.4%に対して - 少数のトークンで多くの結果。
Z.ai Code Bench v1.0のデータは、現実のローカル開発環境でコーディングエージェントを評価する内部ベンチマークです。制御された努力レベルでのエンドツーエンドのタスク完了を測定しています。モデルの著者によって報告されています。GLM-5.3は、全ての努力レベルでGLM-5.2を上回るパフォーマンスとトークン効率を向上させます。
コンテキストの制限を200Kから100万トークンに増やすのは、設定パラメータではなく工学問題です。3つの改良が鍵となります。
4つのTransformerレイヤーのうち、それぞれの4つで軽量インデックスャーを共有しています。それは4つのうちの最初のレイヤーに位置し、そのtop-kインデックスは他の3つのレイヤーで再利用されます——これにより、3分の4のレイヤーでのドットプロダクトとtop-k計算が排除されます。結果:1千万トークンのコンテキスト長で、各トークンのFLOPsは2.9倍に削減されます。IndexShareはトレーニング中の中期から128Kのシーケンス長で導入されました。
マルチトークン予測レイヤーは最初の草案ステップでインデックスャーを一度実行し、その後のステップで再利用します。これにより、前世代のトレーニング/推論KVキャッシュのミスマッチが解消されます。拒否サンプリングとエンドツーエンドTVロスと組み合わせると、受け入れ可能な長さは4.56から5.47に増加し、約20%になります。これは7つのMTPステップにわたってです。
| ベースライン | 4.56 |
| + IndexShare + KVShare | 5.10 |
| + サンプリングを拒否 | 5.29 |
| エンドツーエンド TV ロス | 5.47 (+20%) |
数万トークンを超えると、ボトルネックは計算ではなく、KVキャッシュ容量、長文コア、CPUオーバーヘッドです。3つの対策:LayerSplitに基づく微細なメモリ管理と並列化、キャッシュ転送パイプラインと連携した文脈長スケーリングのためのカーネル最適化、CPU側のキャッシュ管理、リクエストスケジューリング、ランタイムパス最適化。文脈の成長とともに、スループットの利点が拡大します。
ノーマライズドスループトアドバンテージ
訓練スタック(slime)は、ホワイトボックスとブラックボックスのロールアウト、コンパクトなトレジャクトライ、サブエージェントワークフローの組み合わせです。並列OPD訓練は約2日で12以上の専門モデルを統合し、FP8 KVキャッシングでロールアウトメモリを予算内に保ちます。GLM-5.3を通じて、システムレベルの最適化により、エンドツーエンドのRL訓練の通過率が2.3倍以上向上しました。
長期RLはショートカットを引き起こすことがありますので、疑わしいアクションはまずルールベースのリコールフィルタを通して処理され、その後LLM判決で精度が確認されます。確認された悪意のあるアクションはオンラインでインターセプトされ、バーチャルツールの結果で応答し、ロールアウトを廃棄する代わりに続行させます。CriticのPPOに基づき、トレーニング中の中期から128Kのシーケンス長で圧縮可能なサブトレイルが維持されます。
30B Flashレベルから一百万コンテキストの旗艦モデルまで - モデルを選択して完全な仕様表とベンチマークデータを表示します。
コーディングに最も適したオープンウェイトモデル:Z.aiコードベンチで+50%、Terminal-Bench 3.0とAgents' Last ExamでのオープンソースSOTA、CyberGymでの最先端技術。
第1号ネイティブマルチモーダルGLM-5モデル:総計320B / 活性パラメータ18B、ハイブリッドアテンション、1Mコンテキスト - 価格の1/10でGLM-5.2を凌駕する性能。
前世代の旗艦モデル:GLM-5.3のトレーニング後が築く、一百万トークンコンテキストと長期展望の基盤。
長期専門家:長期能力と工学レベルの成果が大幅に向上し、数時間自主的に作業できる。
強化されたプログラミング能力、より信頼性の高い多段階実行、およびより良い複雑なエージェントの行動。
基本モデル — 長いチェーンと動的知能エージェントシナリオ向けに最適化
プログラミング能力の向上、安定した多段階推論、およびフロントエンド生成の改善。
3000億のパラメータ;高い効率と性能、同じ規模のモデルの中で先頭に立っています。
単一のコンテキストウィンドウを超える多ファイル機能:モデルは全体のリポジトリ状態を視覚化し、数回のループごとに再読み込みするのではなく保持します。
数時間の実験サイクルを通じて、エージェントは計画、実行、結果を読み、修正する必要があります。これは、FrontierSWEとPostTrainBenchによって評価されるべき作業量です。
完全なコールグラフ、アナライザの出力、およびカーネルとシステムが前回の試みと同じ軌道で動作することを必要とします。
長期再現性の追跡、不安定なテスト、およびクロスサービスの障害;文脈の切り詰めがバグの失われ方の理由です。
上記のすべてのシナリオは、あなた自身のハードウェアで実行できます - MITの重み、transformers · vLLM · SGLang · xLLM · ktransformers。モデルをローカルで実行する方法 →