GLMMODEL — 100万のコンテキストを持つ長期タスク向けのオープンソースAI

GLM-5.3は旗艦オープンソースのAIモデルであり、コーディング用の最も能力のあるオープンウェイトモデルで、100万トークンの安定したコンテキストを持っています。Terminal-Bench 2.1で88.2、FrontierSWEで78.1、CyberGymで最先端の84.5と、脆弱性の発見のための評価を示しています。以下で各モデルを比較したり、無料のAIサンドボックスを体験できます。

1M
トークンコンテキスト
200Kから向上させ、エージェント負荷下での安定性を維持
88.2
Terminal-Bench 2.1
GLM-5.3のスコアは、GLM-5.2の81.0を上回っています。
MIT
オープンソースライセンス
地理的な制限なしのオープンウェイト

フリーAI体験センター — 実時オープンソースの大規模言語モデルを体験

登録不要、アカウント不要、クオータ不要。プロンプトワードを入力することでリアルタイムストリーミングレスポンスを取得できます。

ここに返信がストリーミングで表示されます…

この体験はGLM大規模言語モデルを使用し、プロンプトワードを入力することでリアルタイムストリーミングレスポンスを取得できます。

GLMMODELファミリーの核能力

四つの機能がモデルの現代世代を定義しています - モデルの著者によって報告され、オープンライツから再現可能です。

安定した100万のコンテキスト

10万トークンのコンテキストが利用可能であり、しかも品質を維持しています:GLM-5.3は、大規模な実装、自動化された研究、複雑なデバッグなどの長文コーディングエージェントのトレースにトレーニングを継続しています。

自発的なサイバーカラビリティ

CyberGym(84.5)での最先端の脆弱性発見。現実世界のテストでは、269のオープンソースプロジェクトで2,436の脆弱性が特定され、最も古いのは1981年にまで遡る。

IndexShareアーキテクチャ

4層のスパースアテンションレイヤーごとに軽量インデックスャーを共有し、1百万の文脈長でトークンあたりのFLOPsを2.9倍に減少させつつ、遠距離の品質を失わずに維持します。

MITオープンソースウェイト

MITライセンスのオープンソースモデル:重みはHuggingFaceとModelScopeに公開され、地域制限なく、transformers、vLLM、SGLang、xLLM、ktransformersを通じてローカルデプロイメントをサポートします。

GLM-5.3ベンチマークテスト:コーディング、エージェントとサイバー

以下のすべてのデータは、モデル作者が発表したGLM-5.3および比較モデルの結果です。glmmodel.netは報告のみを提供し、これらの評価を実行しません。

オープンソースのSOTA
78.1%

FrontierSWE

タスクの持续时间は20時間に達する

GLM-5.378.1
Fable 588.2
Opus 4.866.5
GLM-5.267.5
Beats Opus 4.8 & GPT-5.6
39.8%

PostTrainBench

1 H100カードで最大10時間

GLM-5.339.8
Fable 541.8
GPT-5.6 Sol36.2
Opus 4.832.9
2.2× over GLM-5.2
42.5%

SWE-Marathon

10時間までの超長サイクルソフトウェアエンジニアリング

GLM-5.342.5
Opus 4.848.8
Kimi K348.1
GLM-5.219.4

これらの長期スパンベンチマークでは、GLM-5.3が最上位のオープンソースモデルであり、その100万トークンのコンテキストが実際のオプトアウトに変換される証拠です。Terminal-Bench 3.0では4.6から28.3、DeepSWE v1.1では46.2から66.9に向上し、GLM-5.2のエクスプロイトベンチマークでは2倍以上に向上しました。これらの全ての向上は、同じベースモデルに対するトレーニング後のポストトレーニングによるものです。

Terminal-Bench 2.1+7.2
GLM-5.388.2
GPT-5.6 Sol88.8
Kimi K388.3
GLM-5.281.0
Terminal-Bench 3.0+23.7 (6.2×)
GLM-5.328.3
GPT-5.6 Sol34.6
Fable 533.7
GLM-5.24.6
NL2Repo+9.1
GLM-5.358.0
Opus 4.869.7
DeepSeek-V4 Pro61.1
GLM-5.248.9
DeepSWE v1.1+20.7 (1.4×)
GLM-5.366.9
GPT-5.6 Sol72.7
Kimi K367.5
GLM-5.246.2
ProgramBench (Solved)+9.5 (2.0×)
GLM-5.319.0
Fable 533.0
GPT-5.6 Sol23.0
GLM-5.29.5
Toolathlon Verified+13.1
GLM-5.373.0
Kimi K376.5
Opus 4.876.2
GLM-5.259.9
AutomationBench+22.0 (1.8×)
GLM-5.348.2
Kimi K346.7
GPT-5.6 Sol45.8
GLM-5.226.2
HLE (With Tools)+7.8
GLM-5.362.5
GPT-5.6 Sol64.5
Fable 563.9
GLM-5.254.7

モデルの16のベンチマークテストでのスコア

モデルのベンチマーク結果を公開しました。8モデルの16評価をカバーしています

モデルのベンチマーク結果を公開しました。各評価とモデルをカバーしています
バenchmarkテストGLM-5.3GLM-5.2Kimi K3DeepSeek-V4 ProQwen3.8-MaxClaude Opus 4.8Fable 5*GPT-5.6 Sol
コーディング
Terminal-Bench 2.188.281.088.387.986.685.088.088.8
Terminal-Bench 3.028.34.617.421.133.734.6
DeepSWE v1.166.946.267.562.756.658.069.772.7
NL2Repo58.048.958.061.155.969.7
ProgramBench (Almost Solved)19.09.517.510.515.533.023.0
FrontierSWE78.167.566.588.2
SWE-Marathon v1.142.519.448.148.833.142.5
PostTrainBench39.831.732.032.941.836.2
サイバー
CyberGym84.577.280.083.378.578.183.883.6
ExploitGym (2h / 6h)105 / 13029 / 3936 / 7014 / 2680 / 120181 / 247216 / 293
ExploitBench54.424.432.228.840.078.076.5
エージェント
Toolathlon Verified73.059.976.574.172.576.274.774.9
AutomationBench v1.0.648.226.246.743.239.841.046.245.8
Agents' Last Exam (ALE-CLI)28.523.827.625.727.025.723.828.6
HLE (With Tools)62.554.759.860.056.257.963.964.5
GDPval-AA v217691508168215901739158817431730

Fable 5の結果はフェールバックで報告されます。すべてのデータはモデルの著者によって公開された結果です。

推理労力:低、高、最大

GLM-5.3は常に3つの強度レベルで考える。努力制御により、タスクが必要なときだけ計算リソースを消費できます — GLM-5.3はすべての努力レベルでGLM-5.2を凌ぎつつ、より少ない出力トークンを消費します。

高速

軽量推論

拡張子が深さよりも latancy(遅延)が重要なシナリオ、例えば素早い編集、テンプレートコード、ルーチン的なリファクタリングなどで、GLM-5.3は思考を無効にするのをやめ、軽い推論がデフォルトでオンになります。

最常用

31.4%

50K平均トークン

大多数エージェントコーディングのデフォルト:高努力でGLM-5.3は約50Kの出力トークンで31.4%に達し、Claude Opus 4.8(120Kで29.5%)を越えます。

最大

34.5%

75K平均トークン

最も難しい長期展望の問題:約75K出力トークンで34.5%、GLM-5.2の96Kで23.4%に対して - 少数のトークンで多くの結果。

Z.ai Code Bench v1.0のデータは、現実のローカル開発環境でコーディングエージェントを評価する内部ベンチマークです。制御された努力レベルでのエンドツーエンドのタスク完了を測定しています。モデルの著者によって報告されています。GLM-5.3は、全ての努力レベルでGLM-5.2を上回るパフォーマンスとトークン効率を向上させます。

モデルはどうやって百万のコンテキストを達成しますか?

コンテキストの制限を200Kから100万トークンに増やすのは、設定パラメータではなく工学問題です。3つの改良が鍵となります。

IndexShare スパースアテンション

4つのTransformerレイヤーのうち、それぞれの4つで軽量インデックスャーを共有しています。それは4つのうちの最初のレイヤーに位置し、そのtop-kインデックスは他の3つのレイヤーで再利用されます——これにより、3分の4のレイヤーでのドットプロダクトとtop-k計算が排除されます。結果:1千万トークンのコンテキスト長で、各トークンのFLOPsは2.9倍に削減されます。IndexShareはトレーニング中の中期から128Kのシーケンス長で導入されました。

GLMMODELのレイヤー共有とIndexShare Layer N+3 Layer N+2 Layer N+1 層 N 共有 インデクサ

MTPとIndexShare、KVShareの組み合わせ

マルチトークン予測レイヤーは最初の草案ステップでインデックスャーを一度実行し、その後のステップで再利用します。これにより、前世代のトレーニング/推論KVキャッシュのミスマッチが解消されます。拒否サンプリングとエンドツーエンドTVロスと組み合わせると、受け入れ可能な長さは4.56から5.47に増加し、約20%になります。これは7つのMTPステップにわたってです。

MTP承認長削減実験
ベースライン4.56
+ IndexShare + KVShare5.10
+ サンプリングを拒否5.29
エンドツーエンド TV ロス5.47 (+20%)

百万のコンテキスト向け効率的なサービス

数万トークンを超えると、ボトルネックは計算ではなく、KVキャッシュ容量、長文コア、CPUオーバーヘッドです。3つの対策:LayerSplitに基づく微細なメモリ管理と並列化、キャッシュ転送パイプラインと連携した文脈長スケーリングのためのカーネル最適化、CPU側のキャッシュ管理、リクエストスケジューリング、ランタイムパス最適化。文脈の成長とともに、スループットの利点が拡大します。

ノーマライズドスループトアドバンテージ

エージェント強化学習トレーニング

訓練スタック(slime)は、ホワイトボックスとブラックボックスのロールアウト、コンパクトなトレジャクトライ、サブエージェントワークフローの組み合わせです。並列OPD訓練は約2日で12以上の専門モデルを統合し、FP8 KVキャッシングでロールアウトメモリを予算内に保ちます。GLM-5.3を通じて、システムレベルの最適化により、エンドツーエンドのRL訓練の通過率が2.3倍以上向上しました。

アンチリワードハッカー

長期RLはショートカットを引き起こすことがありますので、疑わしいアクションはまずルールベースのリコールフィルタを通して処理され、その後LLM判決で精度が確認されます。確認された悪意のあるアクションはオンラインでインターセプトされ、バーチャルツールの結果で応答し、ロールアウトを廃棄する代わりに続行させます。CriticのPPOに基づき、トレーニング中の中期から128Kのシーケンス長で圧縮可能なサブトレイルが維持されます。

各モデルの紹介、バージョンごとに

30B Flashレベルから一百万コンテキストの旗艦モデルまで - モデルを選択して完全な仕様表とベンチマークデータを表示します。

すべてのモデルを見る →

長サイクルのモデルが優れるシナリオ

大規模実装

単一のコンテキストウィンドウを超える多ファイル機能:モデルは全体のリポジトリ状態を視覚化し、数回のループごとに再読み込みするのではなく保持します。

自動化された研究

数時間の実験サイクルを通じて、エージェントは計画、実行、結果を読み、修正する必要があります。これは、FrontierSWEとPostTrainBenchによって評価されるべき作業量です。

パフォーマンス最適化

完全なコールグラフ、アナライザの出力、およびカーネルとシステムが前回の試みと同じ軌道で動作することを必要とします。

複雑なデバッグ

長期再現性の追跡、不安定なテスト、およびクロスサービスの障害;文脈の切り詰めがバグの失われ方の理由です。

上記のすべてのシナリオは、あなた自身のハードウェアで実行できます - MITの重み、transformers · vLLM · SGLang · xLLM · ktransformers。モデルをローカルで実行する方法 →

モデルに関するよくある質問

GLMMODELはオープンウェイトの大規模言語モデルのファミリーであり、現在の旗艦モデルはGLM-5.3です。製品ラインはGLM-4.5-AirとGLM-4.7からGLM-5、GLM-5-Turbo、GLM-5.1、GLM-5.2、そして今GLM-5.3とネイティブマルチモーダルのGLM-5.3-Flash(音声と視覚のバリエーションを含む)に至ります。各コアモデルはMITライセンスの下でリリースされ、重みは完全にオープンです。

GLM-5.3は安定した100万トークンの制限を維持し、出力トークンの制限は最大128Kです。「安定」がキーワードです:モデルは長いコーディングエージェントのトレイルで訓練されているため、品質はウィンドウ全体で一貫しています。GLM-5.3-Flashもハイブリッドスパースラインアテンションアーキテクチャを用いて1Mのコンテキストに達し、長いコンテキストのサービスコストを大幅に削減します。

Terminal-Bench 2.1で88.2、Terminal-Bench 3.0(オープンソースのSOTA)で28.3、FrontierSWEで78.1、DeepSWE v1.1で66.9、CyberGym(最先端の技術)で84.5、Agents' Last Examで28.5と、コーディング、サイバー、長期予測のエージェント評価における最高ランクのオープンソースモデルです。詳細なテーブルは上記に示されています。

トレーニングのスケールアップに伴い、脆弱性発見能力は予想以上に速く成長しました:GLM-5.3はCyberGym(84.5)で最先端の技術であり、ExploitBench(54.4 vs 24.4)ではGLM-5.2を2倍以上に超えます。セキュリティチームとの現実世界のテストでは、269のオープンソースプロジェクトの間で2,436の脆弱性を特定し、そのうちいくつかは1981年にさかのぼります。

タスクによって異なります。GLM-5.3はFrontierSWE、DeepSWE、AutomationBench、CyberGymでOpus 4.8とGPT-5.6 Solをリードし、SWE-Marathon(42.5)でGPT-5.6 Solとタイです。クローズドフロンティアモデルはまだTerminal-Bench 3.0、ExploitGym、NL2Repoでリードしています。Z.ai Code BenchのハイエフォートでGLM-5.3(約50Kトークンで31.4%)はOpus 4.8(120Kで29.5%)を超えます。

GLM-5.3は常に考え、3つの努力レベルを提供します。Z.ai Code Bench v1.0では、高い努力で31.4%(約50Kの出力トークン)で34.5%(約75K)でMaxに達し、GLM-5.2を全レベルで破っています。トークンを使いながらも。Highは実用的なデフォルト;Maxは最も難しい長期問題に保留されています。

はい。コアのモデルの重みはMITライセンスの下で、地域制限なく、HuggingFaceとModelScopeにリリースされています。GLM-5.3-Flashの重みも公開されており、SGLang、vLLM、TokenSpeedをサポートしてローカル推論を実行できます。あなた自身のハードウェアでモデルを実行できます。

IndexShareは、4つのスパースアテンションレイヤーごとに軽量インデックスャーを共有し、そのtop-kインデックスは一度だけ計算され、その後再利用されます。これにより、インデックスャーの作業が4分の3削減され、100万トークンのコンテキストでは各トークンのFLOPsが2.9倍に減少します。これが、サービスレベルで100万トークンのウィンドウを実現可能にする鍵となる変更です。

OpenRouterを通じて提供される無料オープンソースの大規模言語モデルです。GLM-5.3やGLMウェイトを使用していません。その存在は、公開されたモデルデータを読む際にリアルタイムモデルをすぐにテストできるようにすることです。このサイト上のすべてのGLMベンチマークデータは、ここで測定されたものではなく、モデルの著者によって報告された結果です。

フリーリアルタイムAIモデル体験 — アカウント不要

モデルのベンチマークテストを読んで、実際のモデルを動かしてください。上のサンドボックスは無料で、情報を必要としません;もっと完全なAIツールキットが必要な場合は、パートナーからの無料パッケージがここから始まります。