GLM-5.3-Flash 便宜九倍:能不能自己跑看 320B,要花多少看 18B

第三个数是层数,45 对 92 直接砍半。九倍差价里架构只占 3.6 倍,其余是定价决策;r/LocalLLaMA 上吵得最凶的那条,还把参数量说错了。

GLM-5.3-Flash 便宜九倍:能不能自己跑看 320B,要花多少看 18B

GLM-5.3-Flash 的规格表上有三个参数量,而发布周吵得最凶的那条,拿的恰好是回答问题最少的那个。 320B 总参、18B 激活、45 层。三个数各管一件事,取错了哪个,你会对一个自己没问的问题给出很有把握的答案。

把这件事摆明的是 r/LocalLLaMA 上的一个帖子。一条高赞回复全文只有一句:「320B flash oof. This is an M5 Ultra ad.」更高的那条是:「320B total parameters and just 18B active parameters Oh joy.」两条在读同一张规格表,两条都没读错,只是在回答不同的问题,然后得出了相反的情绪。

下面的数字都来自 Z.ai 自己的模型文档与定价页,2026-08-28 当日回源。社区引述都是用户原话,只能证明有人这么说,不能当证据用。

三个数分别管什么?

Z.ai 的模型文档把三个数和对比都写在同一句里:

Despite a similar total parameter count (320B vs. 355B), it nearly halves both the activated parameter count (18B vs. 32B) and the number of layers (45 vs. 92).

FlashGLM-5.3它决定什么
总参数320B355B权重装不装得进你的内存
每 token 激活18B32B每 token 的算力,价格跟着它走
层数4592每 token 的串行步数,延迟跟着它走

横着读一遍,这个模型的形状就出来了。总参几乎没动,320B 对 355B 只降了一成。砍掉一半的那两个数,没人拿去做标题。

一句话说完这篇文章:没变的那个数决定你能不能自己跑,砍半的那两个数决定你的账单。

体积几乎没变,凭什么便宜九倍?

因为你不是按权重文件付费的。你按的是每 token 实际做了多少次运算,而在 MoE 结构里这由激活参数和深度决定,跟总参没有直接关系。

Z.ai 公布的牌价,每百万 token:

GLM-5.3-FlashGLM-5.3倍数
输入$0.15$1.49.3 倍
缓存命中输入$0.03$0.268.7 倍
输出$0.5$4.48.8 倍

三行都在九倍上下,很整齐。再看架构:激活参数 32B 降到 18B 是 1.8 倍,层数 92 降到 45 是 2.0 倍,两者相乘约 3.6 倍。

也就是说,九倍左右的差价里,架构占约 3.6 倍,剩下的约 2.6 倍是定价决策。 而定价决策是带日期的,这就说到了大多数人跳过的那一段。

你看到的那个价,是真价吗?

这个月看到的,大概率不是。Z.ai 定价页把话说得很直白:

GLM-5.3-Flash is available at a 50% discount (strikethrough prices are list prices). The promotion ends at 24:00 on September 9, 2026 (UTC+8, Singapore time).

发布帖里传的 $0.075 和 $0.25 是折后价,牌价是 $0.15 和 $0.5。我们自己的 GLM-5.3-Flash 模型页上挂的是同一组数字,折后价配划掉的牌价——因为这是把厂商的促销原样透传,不是我们自己另做的折扣。

实际影响不大但真实:今天按 $0.075 排预算,促销如期结束后单位成本翻倍,而这个模型的每一条架构事实一个字都没变。按牌价建成本模型,把折扣当窗口期。

发布帖里另一条 199 赞的评论是:「$0.075 / $0.25 per 1M on OpenRouter for Opus 4.8 performance. 100x lower cost than Anthropic was providing in May.」这句一边用促销价、一边用五个月前的价,是读者印象不是跑分,而且是那种会悄悄过期的说法。

权重开源了,那到底能不能自己跑?

到这里 320B 就不肯帮忙了。

激活参数降的是单次前向的算力,不是你必须加载的体积。要自己起 GLM-5.3-Flash,你得把 320B 参数放进可寻址内存;而且路由在任一 token 上都可能命中任一专家,你没法只把热的 18B 常驻、其余换页——换页的代价会以延迟的形式还回来。

「This is an M5 Ultra ad.」这句话的全部内容就是这个。那位评论者没糊涂,他读的正是对他那个问题唯一有意义的数,并且正确地得出了「跑不动,或者至少不便宜」的结论。而「just 18B active parameters Oh joy」那条,读的是对推理成本唯一有意义的数,同样正确地得出了相反的结论。

两个数都没错。它们是两个不同问题的答案,只是恰好印在同一张规格表的相邻两行上。

同代模型的自部署账我们单独算过,8×H200 起 vLLM 对比每月 30 美元云方案在自建 GLM 5.2 的硬件成本,2-bit 量化那条路在本地跑 GLM 5.2

社区把哪条读错了?

有一条,具体且可核。

一条 129 赞的回复写着:「People thought it was fable-level. it’s 380B parameters and open-weights.」Z.ai 自己的模型文档写的是 320B。不是四舍五入的差,也不是总参和激活搞混,就是一个大了 60B 的数,还带着赞数传开了。

这条值得单独点出来,因为它是发布周信息的典型失效方式:传得最快的说法,长得像事实、复述成本又低。「380B」和「320B」只差一个字符,扫一眼分不出来。修法很无趣——引用任何数字之前先打开厂商的模型页,哪怕这个数字是带着社会认同来的。

同一个帖子里还有一条一手细节,关注度低得多。Z.ai 在发布前把模型当匿名选手放出去跑过,一条 563 赞的评论引了原话:模型此前「anonymously as ox-alpha on OpenCode and OpenRouter to gather user feedback」,并且「quickly became the most popular model of the week」。这是关于发布前定位的说法,对一次发布叙事的影响远比一个参数量大。

那该怎么用这三个数做选型?

四步,按省钱多少排的。

  1. 先想清楚你在问哪个问题,再去读规格表。 推理成本是激活参数的问题,自部署是总参的问题,延迟是层数的问题。读错数,你会对一个没问的问题得到很有把握的答案。
  2. 按牌价算,不按促销算。 $0.15 和 $0.5,把折扣当成 2026-09-09 到期的上行空间。
  3. 别只看输入输出,看缓存那一行。 缓存命中输入牌价 $0.03,比未命中低一个数量级。在反复重放长系统提示的 agent 循环里,这一行对账单的影响比标价那行大。
  4. 「接近 Opus 4.8」当厂商口径看。 Z.ai 文档写的是模型「clearly outperforms GLM-5.2 at every effort level, and at max effort nearly matches Claude Opus 4.8 (29.0 vs. 29.5)」。这是一手跑分、用的是厂商选定的指标,是你该自己跑一轮的理由,不是自己跑一轮的替代品。

满血版的定价与接口细节在 GLM 5.3 API 的价格、端点与 reasoning_effort,发布当天的能力清单在 GLM 5.3 跑分与获取方式

规格表什么都没藏。三个数写在同一句话里,对比也替你做好了。剩下的工作只有一件:想清楚你是带着哪个问题来的。

参考

上文引用的社区评论原帖,方便你自己去核。这些都是用户发言,不是已核实的结论:

常见问题

GLM-5.3-Flash 到底有多少参数?
三个数,互相不能替换。Z.ai 模型文档写的是总参 320B、激活 18B、45 层。总参决定权重能不能装进你的显存,激活参数决定每 token 的算力开销、也就是价格跟着走的那个数,层数决定每 token 要走多少次串行计算、也就是延迟跟着走的那个数。Reddit 上一条 129 赞的评论说是 380B,一手文档写的是 320B。
为什么 GLM-5.3-Flash 比 GLM-5.3 便宜九倍?
因为它每 token 激活 18B 而 GLM-5.3 是 32B,层数 45 对 92,而总参几乎没动(320B 对 355B)。推理成本跟着激活参数和深度走,不跟权重文件大小走。按 Z.ai 牌价算,输入 $0.15 对 $1.4 是 9.3 倍,输出 $0.5 对 $4.4 是 8.8 倍。
GLM-5.3-Flash 能自己部署吗?
前提是你能把 320B 参数装进内存,而这正是那个没缩水的数。18B 激活降的是每 token 的算力,不是你要加载的体积。r/LocalLLaMA 上被顶得最高的反应之一就是「This is an M5 Ultra ad.」,说的就是这个落差。
现在这个价格是长期价吗?
不是。Z.ai 定价页原文写着 GLM-5.3-Flash 是五折,并且「the promotion ends at 24:00 on September 9, 2026 (UTC+8, Singapore time)」。折后是每百万 token 输入 $0.075、输出 $0.25,牌价是 $0.15 和 $0.5。算预算按牌价算,把折扣当窗口期而不是费率。
混合注意力架构是什么意思?
Z.ai 自己的说法是「the first open-source frontier model to adopt a hybrid architecture combining sparse attention and linear attention」,目的是「to minimize attention costs in long-context scenarios」。这是 1M 上下文没有被按 1M 定价的机制原因。这条是厂商的架构自陈,不是我们实测的结论。