GLM-5.3 — это флагманский открытый исходный код AI-модель — наиболее способный открытый модель с весами для программирования, с стабильным контекстом в один миллион токенов. Она показывает 88.2 на Terminal-Bench 2.1, 78.1 на FrontierSWE и передовое 84.5 на CyberGym для обнаружения уязвимостей. Ниже вы можете сравнить каждую модель — или сначала попробовать бесплатную AI песочницу.
Не требуется регистрация, не требуется учетная запись, не требуется квота. Реальные ответы в режиме потока можно получить, введя ключевые слова.
Ответ будет транслироваться здесь...
Этот опыт использует крупномасштабную языковую модель, и можно получить ответы в реальном времени, введя слова-провокаторы.
Четыре возможности определяют текущее поколение моделей — все это сообщается авторами модели и может быть воспроизведено на основе открытых прав.
Контекст из миллиона токенов доступен не только, но и поддерживает качество: GLM-5.3 продолжает обучение на траекториях агентов с длинным контекстом кодирования, таких как крупномасштабная реализация, автоматизированное исследование и сложная отладка.
На CyberGym (84.5) достигнут уровень передовых технологий для обнаружения уязвимостей. В реальных тестах было выявлено 2 436 уязвимостей в 269 проектах с открытым исходным кодом — самая старая из которых датируется 1981 годом.
Каждые четыре спарсенные слои внимания делят лёгкий индексатор, уменьшая количество FLOPs на токен в 2.9 раза при длине контекста в один миллион, сохраняя при этом качество на больших расстояниях без потери.
Открытые исходные коды моделей под лицензией MIT: весы публикуются на HuggingFace и ModelScope, без региональных ограничений, и поддерживают локальное развертывание через transformers, vLLM, SGLang, xLLM и ktransformers.
Все следующие данные являются результатами GLM-5.3 и сравнительных моделей, опубликованных авторами моделей. glmmodel.net предоставляет только отчеты и не выполняет эти оценки.
Продолжительность задачи может достигать 20 часов
До 10 часов на одной карте H100
Ультра-долгий цикл программирования, до 10 часов
В этих долгосрочных бенчмарках GLM-5.3 является модели с наивысшим рейтингом среди открытых источников — это доказательство того, что контекст из миллиона токенов преобразуется в реальный вывод. Он улучшает свои результаты с 4.6 до 28.3 на Terminal-Bench 3.0, с 46.2 до 66.9 на DeepSWE v1.1 и более чем удваивает GLM-5.2 на бенчмарках эксплуатации — каждый прирост достигается за счет постобучения на одном и том же базовом модели.
Опубликованы результаты тестирования бенчмарка GLMMODEL, охватывающие 16 оценок 8 моделей.
| Тест бенчмарка | GLM-5.3 | GLM-5.2 | Kimi K3 | DeepSeek-V4 Pro | Qwen3.8-Max | Claude Opus 4.8 | Fable 5* | GPT-5.6 Sol |
|---|---|---|---|---|---|---|---|---|
| Программирование | ||||||||
| Terminal-Bench 2.1 | 88.2 | 81.0 | 88.3 | 87.9 | 86.6 | 85.0 | 88.0 | 88.8 |
| Terminal-Bench 3.0 | 28.3 | 4.6 | 17.4 | – | – | 21.1 | 33.7 | 34.6 |
| DeepSWE v1.1 | 66.9 | 46.2 | 67.5 | 62.7 | 56.6 | 58.0 | 69.7 | 72.7 |
| NL2Repo | 58.0 | 48.9 | 58.0 | 61.1 | 55.9 | 69.7 | – | – |
| ProgramBench (Almost Solved) | 19.0 | 9.5 | 17.5 | – | 10.5 | 15.5 | 33.0 | 23.0 |
| FrontierSWE | 78.1 | 67.5 | – | – | – | 66.5 | 88.2 | – |
| SWE-Marathon v1.1 | 42.5 | 19.4 | 48.1 | – | – | 48.8 | 33.1 | 42.5 |
| PostTrainBench | 39.8 | 31.7 | 32.0 | – | – | 32.9 | 41.8 | 36.2 |
| Кибер | ||||||||
| CyberGym | 84.5 | 77.2 | 80.0 | 83.3 | 78.5 | 78.1 | 83.8 | 83.6 |
| ExploitGym (2h / 6h) | 105 / 130 | 29 / 39 | 36 / 70 | – | 14 / 26 | 80 / 120 | 181 / 247 | 216 / 293 |
| ExploitBench | 54.4 | 24.4 | 32.2 | – | 28.8 | 40.0 | 78.0 | 76.5 |
| Агент | ||||||||
| Toolathlon Verified | 73.0 | 59.9 | 76.5 | 74.1 | 72.5 | 76.2 | 74.7 | 74.9 |
| AutomationBench v1.0.6 | 48.2 | 26.2 | 46.7 | 43.2 | 39.8 | 41.0 | 46.2 | 45.8 |
| Agents' Last Exam (ALE-CLI) | 28.5 | 23.8 | 27.6 | 25.7 | 27.0 | 25.7 | 23.8 | 28.6 |
| HLE (With Tools) | 62.5 | 54.7 | 59.8 | 60.0 | 56.2 | 57.9 | 63.9 | 64.5 |
| GDPval-AA v2 | 1769 | 1508 | 1682 | 1590 | 1739 | 1588 | 1743 | 1730 |
Результаты Fable 5 представлены с использованием запасного варианта. Все данные — это результаты, опубликованные авторами модели.
GLM-5.3 всегда думает на трёх уровнях интенсивности. Управление усилием позволяет тратить вычислительные ресурсы только тогда, когда это необходимо — GLM-5.3 превосходит GLM-5.2 на каждом уровне усилия, потребляя меньше токенов вывода.
легкое рассуждение
Сценарии, где задержка важнее глубины, такие как быстрое редактирование, шаблонный код и рутинное рефакторирование — GLM-5.3 больше не отключает мышление, поэтому легкое рассуждение включено по умолчанию.
~50K средних токенов
По умолчанию для большинства агентских кодировок: при высоких усилиях GLM-5.3 достигает 31.4% с大约 50K выходных токенов, превосходит Claude Opus 4.8 (29.5% при 120K).
~75K средних токенов
Самые сложные долгосрочные проблемы: 34.5% примерно при 75K токенах вывода, против 23.4% у GLM-5.2 при 96K токенах — больше результатов с fewer токенов.
Данные с Z.ai Code Bench v1.0, внутреннего бенчмарка, который оценивает агентов кодирования в реальных условиях локального развития, измеряя завершение задач от начала до конца на контролируемых уровнях усилий. Отчет подготовлен авторами модели. GLM-5.3 улучшает как производительность, так и эффективность токенов по сравнению с GLM-5.2 на каждом уровне усилий.
Увеличение ограничения контекста с 200K до одного миллиона токенов является инженерной проблемой, а не параметром конфигурации. Три модификации являются ключевыми.
Каждые четыре слоя Transformer делят между собой легковесный индексатор. Он расположен на первом слое из четырех, и его топ-k индекс повторно используется другими тремя слоями — это eliminates the dot product and top-k calculation in three-quarters of the layers. Результат: FLOPs каждого токена уменьшается в 2.9 раза при длине контекста в один миллион. IndexShare был введен с длиной последовательности 128K в середине фазы обучения.
Многосимвольный предсказывающий слой запускает индексатор один раз на первом этапе черновика и повторно использует его в последующих шагах, устраняя несоответствие между обучающим/инференсным KV кэшем предыдущего поколения. В сочетании с отбором по отклонению и потерь TV на всем протяжении, длина принятого текста увеличивается с 4.56 до 5.47 — около 20% — на 7 шагах MTP.
| Базовая | 4.56 |
| + IndexShare + KVShare | 5.10 |
| + Отказ от выборки | 5.29 |
| + Конечная потеря TV | 5.47 (+20%) |
После нескольких десятков тысяч токенов узел больше не computation, а KV cache capacity, long context kernel и CPU overhead. Три решения: детализированное управление памятью и параллелизация на основе LayerSplit, оптимизация ядра для масштабирования длины контекста, координируемая с потоком передачи кэша, и управление кэшем, планирование запросов и оптимизация маршрута выполнения на стороне CPU. Преимущество производительности растет с увеличением контекста.
Преимущество нормализованной производительности
Обучение стэк (slime) комбинирует белые ящики и черные ящики rollouts, компактные траектории и подагентские рабочие процессы. Параллельное обучение OPD объединяет более dozen экспертов моделей за около двух дней, и FP8 KV кэширование поддерживает память rollouts в бюджете. Через GLM-5.3, системные оптимизации увеличили пропускную способность RL обучения от начала до конца более чем в 2.3 раза.
Долгосрочное RL может вызывать краткие пути, поэтому подозрительные действия сначала проходят через фильтр回忆 на основе правил, а затем проверяются на точность судьей LLM. Подтвержденные вредоносные действия перехватываются в реальном времени и отвечаются виртуальными результатами инструментов, позволяя продолжить rollout, а не выбрасывать его. На основе PPO Critic поддерживаются сжатые под-треки для обучения на одном rollout.
От уровня Flash 30B до флагманской модели с миллионом контекстов — выберите модель, чтобы просмотреть полную таблицу спецификаций и данные тестирования.
Самый способный модель с открытыми весами для программирования: +50% на Z.ai Code Bench,开源 SOTA на Terminal-Bench 3.0 и Agents' Last Exam, передовые технологии на CyberGym.
Первый нативно мультимодальный модель-5: 320B общих параметров / 18B активных параметров, гибридное внимание, 1M контекста — производительность, превышающая GLM-5.2, за одну десятую цены.
Предыдущее поколение флагманской модели: контекст из одного миллиона токенов и долгосрочная основа, на которой строятся постобучения GLM-5.3.
Долгосрочный специалист: значительно улучшенные долгосрочные возможности и результаты на уровне инженерии, которые могут работать автономно несколько часов.
Более мощные возможности программирования, более надежная многошаговая执 и улучшенное поведение сложных агентов.
Основная модель, оптимизированная для сценариев длинных цепочек и динамических интеллектуальных агентов.
Улучшенные возможности программирования, стабильная многошаговая инференция и улучшенная генерация интерфейса.
300 миллиардов параметров; высокая эффективность и производительность, лидирует среди моделей одного масштаба.
Многофайловая функциональность за пределами одного окна контекста: модель поддерживает состояние всего репозитория в поле зрения, а не перечитывает его каждый несколько раундов.
Несколько часов опытных циклов, агенты должны планировать, запускать, читать результаты и исправлять — это именно та нагрузка, которая предназначена для оценки FrontierSWE и PostTrainBench.
Полные графики вызовов, результаты анализатора и поддержание ядра и системы на одном уровне с предыдущими попытками требуются.
Долгосрочное отслеживание повторяемости, нестабильные тесты и跨服务故障; обрезание контекста является причиной потери ошибок.
Все перечисленные сценарии могут быть запущены на вашем собственном оборудовании — веса MIT, трансформеры · vLLM · SGLang · xLLM · ktransformers.Как запустить модель локально →
Прочитайте тесты бенчмарков модели, а затем начнётся работа реальной модели. Сandbox выше бесплатен и не требует информации; если вам нужно более completo набор инструментов AI, бесплатный пакет от партнёров начинается здесь.