GLM-5.3-Flash: три числа параметров, и только одно влияет на счёт

320B всего, 18B активных, 45 слоёв. Каждое число отвечает на свой вопрос, а самый обсуждаемый тред на r/LocalLLaMA спорил не о том.

GLM-5.3-Flash: три числа параметров, и только одно влияет на счёт

У GLM-5.3-Flash в спецификации три числа параметров, и всю неделю запуска спорили о том, которое отвечает на наименьшее количество вопросов. 320B всего. 18B активных. 45 слоёв. Каждое определяет своё, и если взять не то, вы получите очень уверенный ответ на вопрос, которого не задавали.

Нагляднее всего это вышло в треде на r/LocalLLaMA. Один из самых заплюсованных ответов состоял целиком из фразы «320B flash oof. This is an M5 Ultra ad.» Выше него — «320B total parameters and just 18B active parameters Oh joy.» Оба читают одну и ту же спецификацию. Оба правы. Они отвечают на разные вопросы и приходят к противоположным настроениям.

Цифры ниже взяты из документации и прайс-листа Z.ai, сверено 2026-08-28. Цитаты сообщества — высказывания пользователей, помечены как таковые, и доказывают только сам факт высказывания.

Что определяет каждое из трёх чисел?

Документация Z.ai приводит все три и сразу же делает сравнение:

Despite a similar total parameter count (320B vs. 355B), it nearly halves both the activated parameter count (18B vs. 32B) and the number of layers (45 vs. 92).

ЧислоFlashGLM-5.3Что определяет
Всего параметров320B355BПоместятся ли веса в память
Активных на токен18B32BВычисления на токен, за которыми идёт цена
Слоёв4592Последовательные шаги на токен, за которыми идёт задержка

Прочтите таблицу по горизонтали — и форма модели становится очевидной. Общий размер почти не изменился: 320B против 355B, минус десять процентов. А два числа, которые уменьшились вдвое, никто не вынес в заголовок.

Вся статья умещается в одно наблюдение: число, которое осталось прежним, отвечает за локальное развёртывание; числа, которые сократились вдвое, отвечают за ваш счёт.

Почему в девять раз дешевле при почти том же размере?

Потому что вы платите не за файл весов. Вы платите за арифметику на токен, а в MoE-модели её задают активные параметры и глубина, а не общий размер.

Прайс-лист Z.ai, за миллион токенов:

GLM-5.3-FlashGLM-5.3Отношение
Вход$0,15$1,49,3x
Вход из кэша$0,03$0,268,7x
Выход$0,5$4,48,8x

Около девяти раз, ровно по всем трём строкам. Теперь сравните с архитектурой: 32B активных до 18B — это множитель 1,8; 92 слоя до 45 — множитель 2,0. Их произведение даёт примерно 3,6x механической экономии.

То есть из примерно девятикратного разрыва около 3,6x даёт архитектура, а оставшиеся 2,6x — решение о ценообразовании. У таких решений есть дата, и здесь начинается часть, которую большинство пропустило.

Та ли это цена, которую вы называете?

В этом месяце — скорее всего нет. На странице цен Z.ai оговорка написана прямым текстом:

GLM-5.3-Flash is available at a 50% discount (strikethrough prices are list prices). The promotion ends at 24:00 on September 9, 2026 (UTC+8, Singapore time).

Цифры $0,075 и $0,25, которые ходят по тредам запуска, — это со скидкой. Прайс — $0,15 и $0,5. На нашей странице модели GLM-5.3-Flash вы увидите ту же пару: цену со скидкой и зачёркнутый прайс, потому что мы транслируем акцию вендора, а не устраиваем собственную.

Практическое следствие небольшое, но реальное: если сегодня заложить в бюджет $0,075, а акция закончится в срок, удельная стоимость удвоится, притом что ни один архитектурный факт о модели не изменится. Стройте модель затрат по прайсу, а скидку считайте окном, а не тарифом.

Один из заметных комментариев в треде запуска: «$0.075 / $0.25 per 1M on OpenRouter for Opus 4.8 performance. 100x lower cost than Anthropic was providing in May.» Здесь с одной стороны промо-цена, с другой — цифра пятимесячной давности. Это впечатление пользователя, а не бенчмарк, и такие утверждения тихо устаревают.

Веса открыты — значит, можно поднять у себя?

Вот здесь 320B отказывается помогать.

Активные параметры снижают вычисления на один проход. Они не снижают то, что нужно загрузить. Чтобы обслуживать GLM-5.3-Flash самостоятельно, нужно держать 320B параметров в адресуемой памяти, причём маршрутизатор на любом токене может обратиться к любому эксперту — так что нельзя оставить резидентными «горячие» 18B, а остальное подкачивать, не заплатив за это задержкой.

В этом и состоит всё содержание фразы «This is an M5 Ultra ad.» Автор не путался. Он читал единственное число, релевантное его вопросу, и корректно заключил, что ответ — нет, или как минимум недёшево. А ответ «just 18B active parameters Oh joy» читал единственное число, релевантное вопросу о стоимости инференса, и так же корректно пришёл к противоположному выводу.

Ни одно из чисел не ошибочно. Это ответы на разные вопросы, которые просто напечатаны в соседних строках одной спецификации.

Для сопоставимой модели мы считали сторону самостоятельного хостинга отдельно: 8xH200 на vLLM против облака за $30 в месяц и квантованный путь в запуске GLM 5.2 локально.

Что сообщество поняло неверно?

Одну вещь, конкретную и проверяемую.

Ответ со 129 голосами гласит: «People thought it was fable-level. it’s 380B parameters and open-weights.» В документации Z.ai написано 320B. Это не округление и не путаница между общим и активным — просто число на 60B больше, разошедшееся вместе с плюсами.

Стоит назвать это прямо, потому что так вообще ломается информация в неделю запуска: быстрее всего расходятся утверждения, которые выглядят как факт и дёшевы в пересказе. «380B» отличается от «320B» одним символом и при беглом взгляде читается одинаково. Лечение скучное: открывайте страницу модели у вендора до того, как процитируете число, даже если число пришло с социальным подтверждением.

В том же треде есть и первоисточниковая деталь, которой досталось куда меньше внимания. Z.ai запускала модель как анонимного участника до релиза, и комментарий с 563 голосами цитирует их: модель тестировали «anonymously as ox-alpha on OpenCode and OpenRouter to gather user feedback», и она «quickly became the most popular model of the week». Это утверждение о предрелизном позиционировании, и на нарратив запуска оно влияет сильнее, чем число параметров.

Как это меняет маршрутизацию запросов?

Четыре проверки, по убыванию экономии.

  1. Сначала определите вопрос, потом читайте спецификацию. Стоимость инференса — вопрос про активные параметры. Самостоятельный хостинг — про общее число. Задержка — про число слоёв. Не то число даёт уверенный ответ не на тот вопрос.
  2. Считайте по прайсу, а не по акции. $0,15 и $0,5, а скидка — апсайд, истекающий 2026-09-09.
  3. Смотрите строку кэша, а не только вход и выход. Вход из кэша по прайсу $0,03 за миллион — на порядок ниже некэшированного. В агентных циклах, которые раз за разом переигрывают длинный системный промпт, эта строка двигает счёт сильнее заголовочной ставки.
  4. «Почти догоняет Opus 4.8» — это заявление вендора. В документации Z.ai сказано, что модель «clearly outperforms GLM-5.2 at every effort level, and at max effort nearly matches Claude Opus 4.8 (29.0 vs. 29.5)». Это результат первой стороны на выбранной ею метрике: повод провести собственную оценку, а не заменить её.

Механика цен и эндпоинтов старшей модели — в GLM 5.3 API: цены, эндпоинты и reasoning_effort, сводка возможностей на день запуска — в GLM 5.3: бенчмарки и доступ.

Спецификация ничего не скрывает. Все три числа опубликованы в одном предложении, и сравнение уже сделано за вас. Остаётся только решить, с каким вопросом вы к ней пришли.

Источники

Процитированные выше комментарии сообщества — чтобы вы могли проверить сами. Это высказывания пользователей, а не проверенные утверждения:

Часто задаваемые вопросы

Сколько параметров у GLM-5.3-Flash?
Три числа, и они не взаимозаменяемы. В документации Z.ai указано 320B всего параметров, 18B активных и 45 слоёв. Общее число определяет, поместятся ли веса в вашу память. Активные параметры определяют объём вычислений на токен — именно за это вы платите. Число слоёв определяет количество последовательных шагов на токен, то есть задержку. Комментарий на Reddit со 129 голосами называл 380B; первоисточник говорит 320B.
Почему GLM-5.3-Flash дешевле GLM-5.3 примерно в девять раз?
Потому что на токен активируется 18B параметров против 32B у GLM-5.3, а слоёв 45 против 92, при почти неизменном общем размере (320B против 355B). Стоимость инференса зависит от активных параметров и глубины, а не от размера файла весов. По прайс-листу Z.ai это 9,3x на входе ($0,15 против $1,4 за миллион) и 8,8x на выходе ($0,5 против $4,4).
Можно ли развернуть GLM-5.3-Flash локально?
Только если вы способны держать 320B параметров в памяти — а это как раз то число, которое не уменьшилось. 18B активных снижают вычисления на токен, но не объём загрузки. Именно об этом был самый заметный ответ в треде запуска: «This is an M5 Ultra ad.»
Эта цена навсегда?
Нет. На странице цен Z.ai написано, что GLM-5.3-Flash доступен со скидкой 50% и что «the promotion ends at 24:00 on September 9, 2026 (UTC+8, Singapore time)». Со скидкой это $0,075 за вход и $0,25 за выход за миллион токенов; прайс — $0,15 и $0,5. Считайте бюджет по прайсу, а скидку рассматривайте как окно.
Что такое гибридная архитектура внимания в GLM-5.3-Flash?
Z.ai описывает модель как «the first open-source frontier model to adopt a hybrid architecture combining sparse attention and linear attention», применённую «to minimize attention costs in long-context scenarios». Это механизм, благодаря которому контекст в 1M токенов не тарифицируется соответствующе. Это заявление вендора об архитектуре, а не наш замер.