Z.ai выпустила GLM-5.3-Flash — открытую модель на 320 млрд параметров, из которых в каждый момент работают только 18 млрд. Это первая нативно мультимодальная модель в линейке GLM-5: она понимает текст, изображения и видео в одном контексте. Веса опубликованы под лицензией MIT, а цена вызова — в десять раз ниже, чем у GLM-5.2.

Рынок открытых моделей последние месяцы двигался в одну сторону: больше параметров, длиннее контекст, выше качество — и выше цена запуска. GLM-5.3-Flash ломает эту логику. Модель набирает 57 баллов в индексе интеллекта Artificial Analysis при цене $0,045 за задачу со скидкой. Раньше такой уровень интеллекта стоил примерно в десять раз дороже.

До релиза модель тестировали анонимно под именем ox-alpha на платформах OpenCode и OpenRouter. Она быстро стала самой популярной моделью недели — и весь этот трафик обслуживался на китайских чипах, а не на привычных ускорителях NVIDIA. Для тех, кто строит агентов и пишет код с помощью ИИ, это сигнал: появилась дешёвая рабочая модель, которую при желании можно развернуть у себя.

320 млрд параметров, но работают только 18 млрд

Ключевая идея GLM-5.3-Flash — разреженная архитектура. Из 320 млрд параметров модели в каждый момент вычисления задействованы только 18 млрд. Это называется смесью экспертов: модель хранит много знаний, но для конкретного запроса активирует лишь небольшую часть. Такой подход резко снижает стоимость вызова без потери качества.

Сравнение с прошлым поколением наглядно. У GLM-4.5 было 355 млрд общих параметров и 32 млрд активных, а также 92 слоя. У GLM-5.3-Flash — 320 млрд общих, 18 млрд активных и 45 слоёв. Почти вдвое меньше активных параметров и вдвое меньше слоёв при сопоставимом общем размере. Это и есть главный источник дешевизны.

В архитектуре впервые применена гибридная схема внимания: линейное внимание отвечает за локальные зависимости, а разреженное — за поиск нужного глобального контекста через лёгкий индексатор. Для контекста в миллион токенов добавлен механизм IndexPool, который сжимает четыре вектора индексатора в один. В сумме это даёт снижение вычислительной нагрузки внимания в 3 раза и размера кэша в 4,4 раза по сравнению с GLM-5.3.

Где модель обходит предшественника

На шести бенчмарках кода и агентных задач GLM-5.3-Flash стабильно обходит GLM-5.2, часто с большим отрывом. На DeepSWE v1.1 — тесте долгих программистских задач — 63,4 против 46,2. На AutomationBench — автоматизации корпоративных процессов — 48,8 против 26,2. В целом модель приближается к Claude Opus 4.8.

То же подтверждает внутренний тест Z.ai Code Bench v1.0, запущенный в среде Claude Code 2.1.207. На максимальном уровне усилий GLM-5.3-Flash набирает 29,0 — почти вплотную к 29,5 у Claude Opus 4.8. При этом на каждом уровне усилий модель заметно опережает GLM-5.2.

Базовая модель тоже выросла. В сравнении с GLM-4.5-Base новая модель лучше по всем тестам: LiveCodeBench-Base — 37,6 против 28,1, SimpleQA — 33,5 против 30,0, MMLU — 88,1 против 86,1. По HellaSwag она держится на уровне предшественника (87,1), а по BBH — 86,6 против 86,2.

БенчмаркGLM-5.3-FlashGLM-5.2Opus 4.8GPT-5.6 Terra
Terminal Bench 2.184,381,085,087,4
DeepSWE v1.163,446,258,069,6
NL2Repo56,348,969,7
Toolathlon Verified78,459,976,274,9
AutomationBench v1.0.648,826,241,037,2
Agents’ Last Exam26,320,427,028,0
HLE w/ Tools55,354,757,9

Зрение встроено в цикл написания кода

GLM-5.3-Flash — первая модель GLM-5 с нативной мультимодальностью. Это значит, что изображения и видео обрабатываются тем же механизмом, что и текст, без подключения отдельных модулей. Для кодинга это важнее, чем кажется.

Когда модель пишет фронтенд, игру или 3D-симуляцию, итог — не просто код, а интерфейс, взаимодействие или мир, который видит пользователь. Многие ошибки проявляются только при отрисовке или в процессе игры. Модель со встроенным зрением может сама посмотреть на результат, заметить проблему в вёрстке и исправить её, не дожидаясь человека.

Для этого Z.ai построила конвейеры синтеза данных, где модель взаимодействует со средой, проверяет собственный вывод и итеративно его дорабатывает. Для фронтенда дополнительно применялось обучение с подкреплением на обратной связи от среды. Проверка вышла за рамки «код работает» — теперь оценивается и то, как результат выглядит и насколько им удобно пользоваться.

Инсайт: зрение превращает модель из генератора кода в исполнителя, который видит результат своей работы. Именно это отличает вайб-кодинг от простого автодополнения.

Не только код: документы, таблицы, презентации

Зрительный интеллект расширяет модель за пределы программирования. Значительная часть профессиональной работы — это разбор разнородной визуальной и структурированной информации: документов, таблиц, презентаций, дашбордов, интерфейсов, материалов совещаний.

Модель рассуждает сразу над текстовым, визуальным и структурным контекстом. Пользователю не нужно переводить рабочее окружение в текстовые инструкции — модель сама разбирает артефакты задачи и находит нужное. Она также сверяет собственный результат с визуальным контекстом и задуманным итогом, что делает самопроверку точнее.

Модель, которая обслуживает сама себя

Отдельная история — как модель запускают. За последнюю неделю GLM-5.3-Flash обслуживалась на большом кластере китайских чипов. У отдельных чипов ограничены вычислительная мощность и память, поэтому под эту архитектуру построили собственный движок вывода поверх фреймворка SGLang.

Любопытная деталь: оптимизацию ускорял инфраструктурный агент на базе GLM-5.3. Он помогал инженерам разрабатывать и оптимизировать ядра, искать узкие места и улучшать стек обслуживания. Получился замкнутый цикл: модель помогала оптимизировать систему, которая обслуживает саму модель.

В итоге производительность выросла втрое по сравнению с исходным базовым вариантом на том же железе, а стоимость токена вышла на уровень, сопоставимый с обычными ускорителями NVIDIA. Это демонстрирует, что китайские чипы способны экономично обслуживать топовые модели в масштабе.

Что это значит для тех, кто строит агентов

Для практика главное — сочетание трёх вещей: качество кода и агентных задач на уровне дорогих моделей, цена в десять раз ниже и открытые веса. Это редкая комбинация. Большинство дешёвых моделей проигрывают в качестве, а большинство качественных — закрыты и дороги.

Сценарий первый — вайб-кодинг. Модель пишет код, видит результат и доводит задачу до конца. На DeepSWE и Terminal Bench она показывает результаты, близкие к Claude Opus 4.8, при цене уровня Flash-моделей.

Сценарий второй — агенты. Toolathlon Verified 78,4 и AutomationBench 48,8 говорят о том, что модель уверенно вызывает инструменты и выполняет многошаговые задачи. Для оркестрации субагентов и автоматизации процессов это рабочий кандидат.

Сценарий третий — самостоятельное развёртывание. Веса открыты под MIT, а вывод уже поддерживают SGLang, vLLM и TokenSpeed. Если данные нельзя отдавать в облако, модель можно поднять на своей инфраструктуре. Контекст до миллиона токенов позволяет удерживать целый проект.

Что стоит проверить перед переходом

Первое — бенчмарки публикует сам вендор. Цифры DeepSWE и AutomationBench внушительные, но независимых подтверждений пока мало. Модель только вышла, и её поведение на реальных задачах ещё предстоит проверить.

Второе — размер кэша. Несмотря на снижение в 4,4 раза по сравнению с GLM-5.3, кэш ключей и значений у GLM-5.3-Flash всё ещё немного больше, чем у Kimi-K3 и DeepSeek-V4-Flash. Для очень длинных контекстов это остаётся зоной для улучшения.

Третье — самостоятельное развёртывание 320-миллиардной модели — нетривиальная инженерная задача. Нужны серьёзные вычислительные ресурсы и настройка движка вывода. Для большинства команд проще начать с API, а локальный запуск оставить на потом.

Четвёртое — экосистема. Модель новая, и не все фреймворки вывода её уже поддерживают. Заявлены SGLang, vLLM и TokenSpeed, остальные появятся позже. Если ваш стек завязан на конкретный инструмент — проверьте совместимость заранее.

Кому подходит и как проверить

Модель стоит тестировать, если вы пишете код с помощью ИИ, строите агентов или ищете дешёвую замену дорогим закрытым моделям. Пользователям тарифа GLM Coding Plan она уже доступна с утроенной квотой по сравнению с GLM-5.3.

Минимальный сценарий проверки: возьмите одну повторяющуюся задачу — реализацию фичи, рефакторинг, генерацию отчёта из данных. Прогоните 20–30 реальных примеров. Сравните GLM-5.3-Flash с текущей моделью по трём метрикам: качество результата, время выполнения и стоимость одного ответа.

Если модель справляется не хуже текущей, а стоит в разы меньше — это рабочий аргумент для переключения. Но проверяйте на своих задачах, а не на чужих бенчмарках. Бенчмарк показывает потенциал, а не гарантированный результат в вашем процессе.

Дешёвый интеллект перестаёт быть компромиссом

GLM-5.3-Flash показывает, что топовый интеллект не обязан стоить как топовый. Это не результат одного приёма, а трёх слоёв, работающих вместе: архитектура, которая даёт больше качества из меньших вычислений, богатый мультимодальный корпус предобучения и инфраструктура, спроектированная под конкретное железо.

Для рынка агентов это важный сдвиг. Когда дешёвая открытая модель приближается к уровню дорогих закрытых, экономика агентных систем меняется: можно запускать больше агентов, дольше их держать в работе и не бояться счёта за токены. Вопрос перестаёт быть «какую модель выбрать» — он становится «какой процесс ей доверить».

Ссылки

Ссылки