GLMモデル — 長期タスクのための100万トークンのコンテキストのオープンソースAI

GLM-5.2は旗艦級のオープンソースGLM AIモデルであり、安定した100万トークンのコンテキスト、非思考/高い/最高いの三つの思考力で、Terminal-Bench 2.1で81.0、FrontierSWEで74.4と報告されています。各GLMモデルを比較するか、無料のAI体験場を試してみてください。

1M
トークン 上下文
200Kから向上し、エージェントの負荷下でも安定しています。
81.0
Terminal-Bench 2.1
GLM-5.2のスコアは、GLM-5.1の63.5を上回っています。
MIT
オープンソースライセンス
オープンな重み、地域制限なし

免费 AI 体験場 — 体验实时开源大语言モデル

登録不要、アカウント不要、クレジット不要。タグを入力するとストリーミング回答を受け取ることができます。

返信はここでストリーミング出力されます…

本体験はGLM大規模言語モデルを使用しており、入力タグを入力するとリアルタイムのストリーミング回答を受け取ることができます。

GLMモデルファミリーの核能力

4つの能力が現在のGLMモデル世代を定義しています — 全てモデルの著者によって報告され、オープンアクセスで再現可能です。

安定した百万上下文

100万トークンのコンテキストは利用可能であり、質を維持します:GLM-5.2は大規模な実装、自動化研究、複雑なデバッグなどの長いコンテキストのエージェントの軌跡で訓練されています。

柔軟な思考の強度

非思考、高い、最高いの三つのレベルで、タスクに応じて遅延と能力のバランスを取ることができます。アーキテクトプログラミング評価では、約63%(~35Kのオプトトークン)から74%(~83K)までです。

IndexShare アーキテクチャ

4つの稀疏な注意力層が1つの軽量インデックスエンジンを共有し、100万トークンのコンテキスト長さで各トークンのFLOPsを2.9倍に削減し、長距離の品質を無損に保ちます。

MITオープンソース重み

MITライセンスの下でのオープンソースのGLMモデルで、ウェイトはHuggingFaceとModelScopeで公開され、地域制限はありません。transformers、vLLM、SGLang、xLLM、ktransformersを通じてローカルデプロイメントをサポートします。

GLM 5.2 グランドテスト:長期結果

以下のすべてのデータは、モデルの著者が発表したGLM-5.2および比較モデルの結果です。glmmodel.netはこれらの評価を実行しません。

オープンソースモデルの第1位
74.4%

FrontierSWE

タスクの長さは最大20時間まで達します

GLM-5.274.4
Opus 4.875.1
GPT-5.572.6
Gemini 3.1 Pro39.6
総合第2位
34.3%

PostTrainBench

H100の1枚上で最大10時間

GLM-5.234.3
Opus 4.837.2
Opus 4.728.6
GPT-5.525.0
Opus シリーズに続く
13.0%

SWE-Marathon

非常に長いサイクルのソフトウェアエンジニアリング、最大10時間

GLM-5.213.0
Opus 4.826.0
GPT-5.512.0
Gemini 3.1 Pro4.0

長期の基準テストでGLM-5.2は常に最も高いいランクを持つオープンソースモデルであり、百万トークンのコンテキストが実際の生産性に変換されることを証明しており、受け入れ可能なトークン数を超えるだけでなく、実際のトークン数です。FrontierSWEではOpus 4.8に1ポイント、GPT-5.5に1ポイント、前世代のOpus 4.7に11ポイントリードしています。

Terminal-Bench 2.1+17.5
GLM-5.281.0
Opus 4.885.0
GLM-5.163.5
SWE-bench Pro+3.7
GLM-5.262.1
Opus 4.869.2
GLM-5.158.4
NL2Repo+6.2
GLM-5.248.9
Opus 4.869.7
GLM-5.142.7
DeepSWE+28.2 (2.6×)
GLM-5.246.2
GPT-5.570.0
GLM-5.118.0
ProgramBench+12.8
GLM-5.263.7
Opus 4.871.9
GLM-5.150.9
MCP-Atlas+5.0
GLM-5.276.8
Opus 4.877.8
GLM-5.171.8
Tool-Decathlon+7.5
GLM-5.248.2
Opus 4.859.9
GLM-5.140.7
HLE+9.5
GLM-5.240.5
Opus 4.849.8
GLM-5.131.0

GLM モデル在 17 项基準テスト中的得分

発表されたGLMモデルの基準結果は、8つのモデルの17項の評価をカバーしています。

リリースされたGLMモデルの基準結果で、各評価項目とモデルをカバーしています。
基準テストGLM-5.2GLM-5.1Qwen3.7-MaxMiniMax M3DeepSeek-V4-ProClaude Opus 4.8GPT-5.5Gemini 3.1 Pro
推論
HLE40.531.041.437.037.749.8*41.4*45.0
HLE(ツール付き)54.752.353.548.257.9*52.2*51.4*
CritPt20.94.613.43.712.920.927.117.7
AIME 202699.295.397.094.695.798.398.2
HMMT 2025年11月94.494.095.084.494.496.596.594.8
HMMT 2026年2月92.582.697.184.495.296.796.787.3
IMOAnswerBench91.083.890.089.883.581.0
GPQA-Diamond91.286.290.093.090.193.693.694.3
プログラミング
SWE-bench Pro62.158.460.659.055.469.258.654.2
NL2Repo48.942.747.242.135.569.750.733.4
DeepSWE46.218.018.020.08.058.070.010.0
ProgramBench63.750.947.871.970.839.5
Terminal-Bench 2.1 (Terminus-2)81.063.575.065.064.085.084.074.0
Terminal-Bench 2.1(最適なフレームワーク)82.7 (Claude Code)69.0 (Claude Code)78.9 (Claude Code)83.4 (Codex)70.7 (Gemini CLI)
FrontierSWE Dominance74.430.529.075.172.639.6
PostTrainBench34.320.137.228.421.6
SWE-Marathon13.01.026.012.04.0
エージェント
MCP-Atlas(公開セット)76.871.876.474.273.677.875.369.2
Tool-Decathlon48.240.752.859.955.648.8

* 完整データセット上のスコアです。

思考の強度:非思考、高い、最高い

GLMモデルには1つの速度だけではありません。思考の強度制御により、必要なときにのみ多くの計算リソースを割り当てることができます。

非思考

~63%

~35K 平均トークン

迅速な編集、テンプレートコード、一般的なリファクタリングなどの遅延が深さよりも重要なシーン。

最もよく使われる

高いい

~72%

~43K 平均トークン

大多数のエージェントプログラミングのデフォルト選択:約半分のトークン消費で最高いクラスの品質に近づけます。

最高い

~74%

~83K 平均トークン

困難な長期問題 — 必要な場合にのみ追加の計算リソースを割り当てます。

データはTerminal-Bench 2.1、DeepSWE、SWE-Atlas QnAの平均値で、Claude Code 2.1.167で評価されています。モデルの著者によって報告されています。近似のトークン予算で、GLM-5.2のパフォーマンスはClaude Opus 4.7とOpus 4.8の間に位置しています。

GLMモデルはどうやって百万のコンテキストを実現していますか?

コンテキストの上限を200Kから100万トークンに引き上げるのは、設定パラメータではなく技術的な問題です。3つの変更が鍵となります。

IndexShare スパースアテンション

4つのTransformer層ごとに軽量インデックスエンジンを共有します。これは最初の層に位置し、top-kインデックスは残りの3層で共有されるため、4分の3の層でのインデックスエンジンの点積とtop-k計算を省略します。結果として、100万のコンテキスト長さで、各トークンのFLOPsは2.9倍に低下します。IndexShareはトレーニング中期の128Kシーケンス長さから導入されました。

GLM モデル层共有与 IndexShare 層N+3 層N+2 層N+1 層 N 共有 インデックスエンジン

MTPとIndexShare、KVShareの組み合わせ

多トークン予測層は最初の草稿ステップでインデックスエンジンを実行し、その後のステップでインデックスを再利用し、前世代のトレーニング/推論のKVキャッシュの不適合を解消します。拒絶サンプリングとエンドツーエンドのTV損失を組み合わせ、長さは4.56から5.47に増加し、約20%、7つのMTPステップを越えます。

MTP 接受長度消融実験
ベースライン4.56
+ IndexShare + KVShare5.10
+ サンプルを拒否5.29
+ 端到端 TV 損失5.47 (+20%)

百万上下文に対する効率的なサービス

数十万トークンを超えると、ボトルネックは計算ではなく、KVキャッシュ容量、長いコンテキストのカーネル、CPUコストになります。三つの修正として、LayerSplitに基づく微細なメモリ管理と並列化、キャッシュ伝送パイプラインと調整されたコンテキスト長さのスケーリングカーネル最適化、CPU側のキャッシュ管理、リクエストスケジューリング、ランタイムパスの最適化があります。スループットの利点はコンテキストの増加に伴って拡大します。

正規化通量の利点

エージェント強化学習トレーニング

トレーニングスタック(slime)は、白盒とブラックボックスのrollout、コンパクトな軌跡とサブエージェントのワークフローを組み合わせています。並行OPDトレーニングは約2日で10数個の専門モデルを統合し、FP8 KVキャッシュはrolloutのメモリ予算を超えないことを確保します。

反報酬ハッカーズ

長期のRLは短絡を引き起こすため、まずルールに基づく召回フィルタを通じて疑わしいアクションを先にし、その後LLMの精度チェックを通じて正確に評価します。確認されたハッキング行為はオンラインでインターセプトされ、仮想ツールの結果で応答し、rolloutが継続されることを確保します。Criticに基づくPPOは単一のrolloutでトレーニング可能な子トレイルを圧縮します。

各GLMモデル、バージョンごとに紹介

30Bフラッシュレベルから百万トークンのコンテキストの旗艦モデルまで — 一つのGLMモデルを選択して完全なスペック表と基準データを確認してください。

すべてのGLMモデルを確認 →

長いサイクルのGLMモデルが活躍するシーン

大規模な実装

単一のコンテキストウィンドウを超える多ファイル機能:モデルは全体のリポジトリの状態を視野に保ち、数回ごとに再読み込みするのではなく、全てを保持します。

自動化研究

数時間の実験サイクルで、エージェントは計画、実行、結果の読み取り、修正を行う必要があります。これがFrontierSWEとPostTrainBenchが評価する作業負荷です。

パフォーマンス最適化

完全な呼び出しグラフ、解析器の出力、および前回の試みを同じ軌道に保つために必要な内核とシステムの動作を分析する必要があります。

複雑なデバッグ

長い再現追跡、不安定なテスト、およびサービス間の障害が続く中、コンテキストのカットオフがバグの原因となりました。

上記のすべてのシナリオは、自分のハードウェアで実行できます。MITウェイト、transformers · vLLM · SGLang · xLLM · ktransformersです。GLMモデルをローカルで実行する方法 →

GLMモデルのよくある質問

GLMはオープンウェイトの大規模言語モデルのファミリーであり、現在の旗艦モデルはGLM-5.2です。製品ラインはGLM-4.5-Air、GLM-4.7からGLM-5、GLM-5-Turbo、GLM-5.1、現在のGLM-5.2に至ります。さらに、音声と視覚のバリエーションもあります。各核心GLMモデルはMITライセンスの下で公開され、ウェイトは完全にオープンです。

GLM-5.2は上限を200Kから安定した100万トークンに引き上げ、出力トークンは最大128Kです。"安定"が鍵語です:モデルは長いコーディングエージェントの軌跡で訓練されているため、全体のウィンドウ中で質が一定です。運行が複雑になるにつれて劣化するのではなく、一定です。

発表された結果には、Terminal-Bench 2.1の得点81.0、SWE-bench Proの得点62.1、FrontierSWEの得点74.4、PostTrainBenchの得点34.3、DeepSWEの得点46.2、MCP-Atlasの得点76.8、AIME 2026の得点99.2が含まれており、これらはすべて長期評価で最も高いいランクを持つオープンソースモデルです。詳細なテーブルは上記にあります。

タスクによって異なります。GLM-5.2はFrontierSWE、PostTrainBench、Terminal-Bench 2.1でGPT-5.5をリードし、ほぼすべてのプログラミング行でGemini 3.1 Proをリードしており、Claude Opus 4.8はSWE-bench Pro、NL2Repo、SWE-Marathonで引き続きリードしています。Claude Codeフレームワークの下で、GLM-5.2は82.7、Opus 4.8は78.9と得点しました。

これらはモデルが各タスクでどれだけの計算リソースを消費するかを制御します。アーキテクトプログラミング評価では、約63%(~35Kのオプトトークン、非思考)、72%(~43K、高い)、74%(~83K、最高い)の報告曲線です。高いは実用的なデフォルトの選択肢であり、最高いは本当に難しい長期問題に使用されます。

はい。核心GLMモデルのウェイトはMITライセンスで、地域制限はありません。HuggingFaceとModelScopeで公開されています。transformers、vLLM、SGLang、xLLM、ktransformersを通じてローカル推論をサポートし、自分のハードウェアでGLMモデルを実行できます。

IndexShareは4つの稀疏な注意力層ごとに軽量なインデックスエンジンを共有し、top-kインデックスは一度だけ計算され、その後再利用されます。これにより、4分の3の層でのインデックスエンジンの作業が省略され、百万トークンのコンテキストで各トークンのFLOPsは2.9倍に低下します。これは百万トークンのウィンドウをサービスレベルで実行可能にする鍵となる変更です。

OpenRouterを通じて提供される無料のオープンソースの大規模言語モデルではありません。GLM-5.2でもなく、GLMウェイトを使用していません。これは、既に発表されたGLMモデルのデータを読みながらリアルタイムモデルをテストできるようにするために存在します。このサイトのすべてのGLM基準データはモデルの著者によって報告された結果であり、ここで測定された結果ではありません。

無料体験リアルタイムAIモデル — アカウント不要

GLMモデルの基準テストを読んでから、実際のモデルを動かします。上記の体験場は無料で、情報は必要ありません。より完全なAIツールキットが必要な場合は、パートナーズの無料パッケージから始めてください。