GLMMODEL — Открытый исходный код AI, созданный для долгосрочных задач с одним миллионом контекста

GLM-5.3 — это флагманский открытый исходный код AI-модель — наиболее способный открытый модель с весами для программирования, с стабильным контекстом в один миллион токенов. Она показывает 88.2 на Terminal-Bench 2.1, 78.1 на FrontierSWE и передовое 84.5 на CyberGym для обнаружения уязвимостей. Ниже вы можете сравнить каждую модель — или сначала попробовать бесплатную AI песочницу.

1M
Контекст токенов
Улучшен с 200K, поддерживая стабильность под нагрузкой агента
88.2
Terminal-Bench 2.1
Рейтинги модели-5.3, улучшение по сравнению с 81.0 у GLM-5.2.
MIT
Лицензия на открытом-source
Открываем весовые параметры, без географических ограничений

Бесплатный центр опыта AI — Опыт реального времени открытых исходных кодов больших языковых моделей

Не требуется регистрация, не требуется учетная запись, не требуется квота. Реальные ответы в режиме потока можно получить, введя ключевые слова.

Ответ будет транслироваться здесь...

Этот опыт использует крупномасштабную языковую модель, и можно получить ответы в реальном времени, введя слова-провокаторы.

Основные возможности семейства GLMMODEL

Четыре возможности определяют текущее поколение моделей — все это сообщается авторами модели и может быть воспроизведено на основе открытых прав.

Стабильные миллион контекстов

Контекст из миллиона токенов доступен не только, но и поддерживает качество: GLM-5.3 продолжает обучение на траекториях агентов с длинным контекстом кодирования, таких как крупномасштабная реализация, автоматизированное исследование и сложная отладка.

Эмерджентная кибер-возможность

На CyberGym (84.5) достигнут уровень передовых технологий для обнаружения уязвимостей. В реальных тестах было выявлено 2 436 уязвимостей в 269 проектах с открытым исходным кодом — самая старая из которых датируется 1981 годом.

Архитектура IndexShare

Каждые четыре спарсенные слои внимания делят лёгкий индексатор, уменьшая количество FLOPs на токен в 2.9 раза при длине контекста в один миллион, сохраняя при этом качество на больших расстояниях без потери.

MIT Open Source Веса

Открытые исходные коды моделей под лицензией MIT: весы публикуются на HuggingFace и ModelScope, без региональных ограничений, и поддерживают локальное развертывание через transformers, vLLM, SGLang, xLLM и ktransformers.

Тест бенчмарка GLM-5.3: Кодирование, Агенты и Кибер

Все следующие данные являются результатами GLM-5.3 и сравнительных моделей, опубликованных авторами моделей. glmmodel.net предоставляет только отчеты и не выполняет эти оценки.

Open-Source SOTA
78.1%

FrontierSWE

Продолжительность задачи может достигать 20 часов

GLM-5.378.1
Fable 588.2
Opus 4.866.5
GLM-5.267.5
Beats Opus 4.8 & GPT-5.6
39.8%

PostTrainBench

До 10 часов на одной карте H100

GLM-5.339.8
Fable 541.8
GPT-5.6 Sol36.2
Opus 4.832.9
2.2× over GLM-5.2
42.5%

SWE-Marathon

Ультра-долгий цикл программирования, до 10 часов

GLM-5.342.5
Opus 4.848.8
Kimi K348.1
GLM-5.219.4

В этих долгосрочных бенчмарках GLM-5.3 является модели с наивысшим рейтингом среди открытых источников — это доказательство того, что контекст из миллиона токенов преобразуется в реальный вывод. Он улучшает свои результаты с 4.6 до 28.3 на Terminal-Bench 3.0, с 46.2 до 66.9 на DeepSWE v1.1 и более чем удваивает GLM-5.2 на бенчмарках эксплуатации — каждый прирост достигается за счет постобучения на одном и том же базовом модели.

Terminal-Bench 2.1+7.2
GLM-5.388.2
GPT-5.6 Sol88.8
Kimi K388.3
GLM-5.281.0
Terminal-Bench 3.0+23.7 (6.2×)
GLM-5.328.3
GPT-5.6 Sol34.6
Fable 533.7
GLM-5.24.6
NL2Repo+9.1
GLM-5.358.0
Opus 4.869.7
DeepSeek-V4 Pro61.1
GLM-5.248.9
DeepSWE v1.1+20.7 (1.4×)
GLM-5.366.9
GPT-5.6 Sol72.7
Kimi K367.5
GLM-5.246.2
ProgramBench (Solved)+9.5 (2.0×)
GLM-5.319.0
Fable 533.0
GPT-5.6 Sol23.0
GLM-5.29.5
Toolathlon Verified+13.1
GLM-5.373.0
Kimi K376.5
Opus 4.876.2
GLM-5.259.9
AutomationBench+22.0 (1.8×)
GLM-5.348.2
Kimi K346.7
GPT-5.6 Sol45.8
GLM-5.226.2
HLE (With Tools)+7.8
GLM-5.362.5
GPT-5.6 Sol64.5
Fable 563.9
GLM-5.254.7

Результаты GLMMODEL в 16 тестах бенчмарков

Опубликованы результаты тестирования бенчмарка GLMMODEL, охватывающие 16 оценок 8 моделей.

Опубликованы результаты тестирования бенчмарка GLMMODEL, охватывающие каждую оценку и модель
Тест бенчмаркаGLM-5.3GLM-5.2Kimi K3DeepSeek-V4 ProQwen3.8-MaxClaude Opus 4.8Fable 5*GPT-5.6 Sol
Программирование
Terminal-Bench 2.188.281.088.387.986.685.088.088.8
Terminal-Bench 3.028.34.617.421.133.734.6
DeepSWE v1.166.946.267.562.756.658.069.772.7
NL2Repo58.048.958.061.155.969.7
ProgramBench (Almost Solved)19.09.517.510.515.533.023.0
FrontierSWE78.167.566.588.2
SWE-Marathon v1.142.519.448.148.833.142.5
PostTrainBench39.831.732.032.941.836.2
Кибер
CyberGym84.577.280.083.378.578.183.883.6
ExploitGym (2h / 6h)105 / 13029 / 3936 / 7014 / 2680 / 120181 / 247216 / 293
ExploitBench54.424.432.228.840.078.076.5
Агент
Toolathlon Verified73.059.976.574.172.576.274.774.9
AutomationBench v1.0.648.226.246.743.239.841.046.245.8
Agents' Last Exam (ALE-CLI)28.523.827.625.727.025.723.828.6
HLE (With Tools)62.554.759.860.056.257.963.964.5
GDPval-AA v217691508168215901739158817431730

Результаты Fable 5 представлены с использованием запасного варианта. Все данные — это результаты, опубликованные авторами модели.

Уровень усилий рассуждения: низкий, высокий и максимальный

GLM-5.3 всегда думает на трёх уровнях интенсивности. Управление усилием позволяет тратить вычислительные ресурсы только тогда, когда это необходимо — GLM-5.3 превосходит GLM-5.2 на каждом уровне усилия, потребляя меньше токенов вывода.

Низкая

Быстро

легкое рассуждение

Сценарии, где задержка важнее глубины, такие как быстрое редактирование, шаблонный код и рутинное рефакторирование — GLM-5.3 больше не отключает мышление, поэтому легкое рассуждение включено по умолчанию.

Чаще всего

Высокая

31.4%

~50K средних токенов

По умолчанию для большинства агентских кодировок: при высоких усилиях GLM-5.3 достигает 31.4% с大约 50K выходных токенов, превосходит Claude Opus 4.8 (29.5% при 120K).

Макс

34.5%

~75K средних токенов

Самые сложные долгосрочные проблемы: 34.5% примерно при 75K токенах вывода, против 23.4% у GLM-5.2 при 96K токенах — больше результатов с fewer токенов.

Данные с Z.ai Code Bench v1.0, внутреннего бенчмарка, который оценивает агентов кодирования в реальных условиях локального развития, измеряя завершение задач от начала до конца на контролируемых уровнях усилий. Отчет подготовлен авторами модели. GLM-5.3 улучшает как производительность, так и эффективность токенов по сравнению с GLM-5.2 на каждом уровне усилий.

Как GLMMODEL достигает миллиона контекстов?

Увеличение ограничения контекста с 200K до одного миллиона токенов является инженерной проблемой, а не параметром конфигурации. Три модификации являются ключевыми.

Спарсная аттеншн в IndexShare

Каждые четыре слоя Transformer делят между собой легковесный индексатор. Он расположен на первом слое из четырех, и его топ-k индекс повторно используется другими тремя слоями — это eliminates the dot product and top-k calculation in three-quarters of the layers. Результат: FLOPs каждого токена уменьшается в 2.9 раза при длине контекста в один миллион. IndexShare был введен с длиной последовательности 128K в середине фазы обучения.

Обмен слоев модели и IndexShare Layer N+3 Layer N+2 Layer N+1 Слой N Общий Индексатор

MTP в сочетании с IndexShare и KVShare

Многосимвольный предсказывающий слой запускает индексатор один раз на первом этапе черновика и повторно использует его в последующих шагах, устраняя несоответствие между обучающим/инференсным KV кэшем предыдущего поколения. В сочетании с отбором по отклонению и потерь TV на всем протяжении, длина принятого текста увеличивается с 4.56 до 5.47 — около 20% — на 7 шагах MTP.

Эксперимент по абляции длины принятия решения MTP
Базовая4.56
+ IndexShare + KVShare5.10
+ Отказ от выборки5.29
+ Конечная потеря TV5.47 (+20%)

Эффективная служба для миллиона контекстов

После нескольких десятков тысяч токенов узел больше не computation, а KV cache capacity, long context kernel и CPU overhead. Три решения: детализированное управление памятью и параллелизация на основе LayerSplit, оптимизация ядра для масштабирования длины контекста, координируемая с потоком передачи кэша, и управление кэшем, планирование запросов и оптимизация маршрута выполнения на стороне CPU. Преимущество производительности растет с увеличением контекста.

Преимущество нормализованной производительности

Обучение агента с использованием методов обучения с подкреплением

Обучение стэк (slime) комбинирует белые ящики и черные ящики rollouts, компактные траектории и подагентские рабочие процессы. Параллельное обучение OPD объединяет более dozen экспертов моделей за около двух дней, и FP8 KV кэширование поддерживает память rollouts в бюджете. Через GLM-5.3, системные оптимизации увеличили пропускную способность RL обучения от начала до конца более чем в 2.3 раза.

Анти-хакер поощрений

Долгосрочное RL может вызывать краткие пути, поэтому подозрительные действия сначала проходят через фильтр回忆 на основе правил, а затем проверяются на точность судьей LLM. Подтвержденные вредоносные действия перехватываются в реальном времени и отвечаются виртуальными результатами инструментов, позволяя продолжить rollout, а не выбрасывать его. На основе PPO Critic поддерживаются сжатые под-треки для обучения на одном rollout.

Введение в каждую модель, версия за версией

От уровня Flash 30B до флагманской модели с миллионом контекстов — выберите модель, чтобы просмотреть полную таблицу спецификаций и данные тестирования.

GLM-5.3ФлагманНовый

Самый способный модель с открытыми весами для программирования: +50% на Z.ai Code Bench,开源 SOTA на Terminal-Bench 3.0 и Agents' Last Exam, передовые технологии на CyberGym.

GLM-5.3-FlashНовыйМультимодальный

Первый нативно мультимодальный модель-5: 320B общих параметров / 18B активных параметров, гибридное внимание, 1M контекста — производительность, превышающая GLM-5.2, за одну десятую цены.

GLM-5.2Рассуждение

Предыдущее поколение флагманской модели: контекст из одного миллиона токенов и долгосрочная основа, на которой строятся постобучения GLM-5.3.

GLM-5.1Рассуждение

Долгосрочный специалист: значительно улучшенные долгосрочные возможности и результаты на уровне инженерии, которые могут работать автономно несколько часов.

GLM-5Рассуждение

Более мощные возможности программирования, более надежная многошаговая执 и улучшенное поведение сложных агентов.

GLM-5-TurboРассуждение

Основная модель, оптимизированная для сценариев длинных цепочек и динамических интеллектуальных агентов.

GLM-4.7Рассуждение

Улучшенные возможности программирования, стабильная многошаговая инференция и улучшенная генерация интерфейса.

GLM-4.7-FlashОблегчённый

300 миллиардов параметров; высокая эффективность и производительность, лидирует среди моделей одного масштаба.

Все модели →

Сцены, где модели с длинным циклом показывают наилучшие результаты

Масштабируемое внедрение

Многофайловая функциональность за пределами одного окна контекста: модель поддерживает состояние всего репозитория в поле зрения, а не перечитывает его каждый несколько раундов.

Автоматизированное исследование

Несколько часов опытных циклов, агенты должны планировать, запускать, читать результаты и исправлять — это именно та нагрузка, которая предназначена для оценки FrontierSWE и PostTrainBench.

Оптимизация производительности

Полные графики вызовов, результаты анализатора и поддержание ядра и системы на одном уровне с предыдущими попытками требуются.

Комплексная отладка

Долгосрочное отслеживание повторяемости, нестабильные тесты и跨服务故障; обрезание контекста является причиной потери ошибок.

Все перечисленные сценарии могут быть запущены на вашем собственном оборудовании — веса MIT, трансформеры · vLLM · SGLang · xLLM · ktransformers.Как запустить модель локально →

Общие вопросы о GLMMODEL

GLMMODEL — это семья открытых весовых больших языковых моделей, текущим флагманом которой является GLM-5.3. Линия продуктов включает модели от GLM-4.5-Air и GLM-4.7 до GLM-5, GLM-5-Turbo, GLM-5.1, GLM-5.2 и теперь GLM-5.3 и нативно мультимодальный GLM-5.3-Flash, включая голосовые и визуальные варианты. Каждый ядренный модель выпускается под лицензией MIT, с полными открытыми весами.

GLM-5.3 поддерживает стабильный лимит в один миллион токенов, с ограничением на количество токенов в выходе до 128K. 'Стабильность' — это ключевое слово: модель была обучена на долгих траекториях агента кодирования, поэтому качество остается постоянным на протяжении всего окна. GLM-5.3-Flash также достигает 1M контекста с гибридной архитектурой спарсelinear attention, которая резко сокращает затраты на обслуживание долгого контекста.

Результаты, опубликованные, включают 88.2 на Terminal-Bench 2.1, 28.3 на Terminal-Bench 3.0 (открытый исходный код SOTA), 78.1 на FrontierSWE, 66.9 на DeepSWE v1.1, 84.5 на CyberGym (состояние искусства) и 28.5 на Последний экзамен агентов — это модель с наивысшим рейтингом среди открытых исходных кодов в оценках программирования, кибернетики и агентских оценок на долгосрочный горизонт. Полная таблица показана выше.

Как масштабирование после обучения увеличивалось, способность к обнаружению уязвимостей росла быстрее, чем ожидалось: GLM-5.3 является передовым на CyberGym (84.5) и более чем удваивает GLM-5.2 на ExploitBench (54.4 против 24.4). В реальных тестах с командами по безопасности было выявлено 2 436 уязвимостей в 269 открытых проектах, некоторые из которых датируются 1981 годом.

Это зависит от задачи. GLM-5.3 превосходит Opus 4.8 и GPT-5.6 Sol на FrontierSWE, DeepSWE, AutomationBench и CyberGym, и равен GPT-5.6 Sol на SWE-Marathon (42.5). Закрытые модели frontier все еще лидируют на Terminal-Bench 3.0, ExploitGym и NL2Repo. На Z.ai Code Bench с высокой нагрузкой GLM-5.3 (31.4% при ~50K токенах) превосходит Opus 4.8 (29.5% при 120K).

GLM-5.3 всегда думает и предлагает три уровня усилий. На Z.ai Code Bench v1.0 он достигает 31.4% на высоком уровне усилий (~50K токенов) и 34.5% на максимуме (~75K), обойдя GLM-5.2 на каждом уровне при использовании fewer токенов. Высокий уровень — это практический стандарт; Максимальный уровень резервируется для самых сложных долгосрочных проблем.

Да. Основные веса модели находятся под лицензией MIT, без региональных ограничений и были выпущены на HuggingFace и ModelScope. Веса GLM-5.3-Flash также являются общедоступными, поддерживая SGLang, vLLM и TokenSpeed для локальной инференции — так что вы можете запускать модели на своем собственном оборудовании.

IndexShare позволяет каждому четырем спаренным слоям внимания делиться на легкий индексатор, чей топ-k индекс вычисляется только один раз и затем повторно используется. Это устраняет работу индексатора в трех четвертях слоев, уменьшая количество FLOPs каждого токена в миллион-токенном контексте в 2.9 раза — ключевые изменения, делающие миллион-токенное окно возможным на уровне сервиса.

Бесплатные открытые-source крупные языковые модели, предоставляемые через OpenRouter — не GLM-5.3 и не использующие веса GLM. Его существование позволяет вам тестировать модели в реальном времени сразу после чтения опубликованных данных моделей. Все данные бенчмарков на этом сайте являются результатами, сообщенными авторами модели, не измеренными здесь.

Бесплатный опыт реального времени AI модели — не требуется учетная запись

Прочитайте тесты бенчмарков модели, а затем начнётся работа реальной модели. Сandbox выше бесплатен и не требует информации; если вам нужно более completo набор инструментов AI, бесплатный пакет от партнёров начинается здесь.