GLM 5.3:跑分、API 接入与开源权重时间表(2026)

GLM 5.3 的独立 API 已开放,与 5.2 同价。这里有官方规格、全部跑分、权重进度,以及 thinking 关不掉之后的迁移成本实测。

两块一模一样的灰色石板立在暖色摄影棚台面上,右边那块接着一根发着琥珀色光的开关和线缆,阴影里还放着一个上了锁、尚未开封的运输木箱

GLM 5.3 发布时没有按 token 计费的 API,五天之后这个口子补上了:独立 API 已开放,$1.4 输入 / $4.4 输出,与 GLM 5.2 同价,OpenRouter 和第三方网关也都上架了。 现在只剩权重还没放。模型沿用 GLM 5.2 的基座,全部提升来自后训练。

发布时间:   2026-08-14(Z.ai 发布说明)
基座模型:   与 GLM 5.2 相同,提升全部来自后训练
规格:       1M 上下文,最大输出 128K(Z.ai 模型页)
价格:       $1.4 输入 / $0.26 缓存输入 / $4.4 输出,与 GLM 5.2 同价
开源权重:   仍未公开,HuggingFace 仓库返回 401
编程能力:   Terminal Bench 3.0 从 4.6 到 28.3,开源模型 SOTA
破坏性变更: thinking.type "disabled" 取消;reasoning_effort 只剩 low/high/max
独立 API:   已开放,api.z.ai,三种协议
其他入口:   OpenRouter、各家聚合网关、GLM Coding Plan、ZCode
快照日期:   2026-08-19

GLM 5.3 是什么?

它是 GLM 5.2 的一次后训练升级,不是新的模型家族。 这话是 Z.ai 自己在 GLM-5.3 发布说明第一段写的:模型「用的是和 GLM-5.2 相同的基座」,「所有提升都来自后训练」。

  • 基座权重与 z-ai/glm-5.2 完全一致,上面多加了一个月的强化学习
  • 训练环境是合成的长程任务,有些任务放给资深工程师做也要好几天
  • 目标很明确,就是 agent 编程:终端任务、仓库级改动、多步工具调用
  • 发布说明里还有很长一节讲安全研究能力,不在本文范围内,感兴趣直接看原文

r/LocalLLaMA 的发布贴几小时内冲过 800 赞、赞同率 0.99,热评都盯着一件事:一个 743B 量级的模型在和大得多的对手掰手腕。不过这个参数量是社区自己算的,官方没公布过,所以别当事实引用。

GLM 5.3 什么时候发布的?

2026 年 8 月 14 日,当天就对 GLM Coding Plan 订阅用户全量开放。

各个入口的开放进度并不齐,去找之前先看这张表:

入口2026-08-14 状态2026-08-19 状态
Z.ai 发布说明已发布未变
GLM Coding Plan / ZCode全量可用全量可用
Z.ai 文档模型页还没上已上线,1M 上下文 + 128K 输出
独立模型 API「即将上线」,未给日期已开放,api.z.ai 三种协议
Z.ai 定价表最高只到 GLM 5.2已有 GLM-5.3 行,$1.4 / $0.26 / $4.4
OpenRouter 目录没有z-ai/glm-5.3,上下文 1,048,576
包括 ofox 在内的各聚合网关尚未上架z-ai/glm-5.3 已上架
HuggingFace 权重仓库已建,未公开仍返回 401

五天时间,从只有订阅能用变成除权重外全线可用。这是 Z.ai 发版的固定节奏,方向值得记住:套餐先拿到模型,按量 API 隔几天跟上,权重最后放。

GLM 5.3 开源了吗?

还没有。Z.ai 承诺在发布约两周后放出权重,条件是「安全评估和加固完成」。

这一条我们没有直接采信,而是实际去查了。HuggingFace 上 zai-org/GLM-5.3 仓库已经存在,通过 API 请求返回 401,而 zai-org/GLM-5.2 返回 200。401 而不是 404,说明仓库已经建好并处于受控状态,不是根本没有。这更像排好期的发布,而不是一句空话。8 月 19 日、也就是发布第五天再查,返回的仍然是 401,按两周算大概会落在 8 月底。

上一轮可以当参照。Simon Willison 在 2026 年 6 月 17 日记录过:「中国的 Z.ai 在 6 月 13 日把 GLM-5.2 交给 coding plan 订阅用户,昨天(6 月 16 日)就放出了 MIT 许可的完整开源权重。」上次隔了三天,这次官方说的是两周。许可证也值得盯一眼——5.2 是 MIT,5.3 用什么 Z.ai 还没说。

现在就要能下载的权重,那还是 GLM 5.2。我们的 GLM 5.2 本地部署指南讲了各档 GGUF 量化各自吃多少资源,自建成本与硬件配置里有 vLLM 的实测数据。5.3 和 5.2 共用基座,显存占用和部署形态基本不变——后训练升级唯一让人省心的地方就在这儿,容量规划不用重做。

GLM 5.3 多少钱?

输入 $1.40、缓存输入 $0.26、输出 $4.40,每 100 万 token。和 GLM 5.2 一模一样。 开发者文档的定价表已经有 GLM-5.3 这一行,价格与 5.2、5.1 逐项相同。

项目价格
输入$1.40 / 100 万 token
缓存输入$0.26 / 100 万 token
缓存存储免费,标注为限时
输出$4.40 / 100 万 token
GLM Coding Plan积分配额,输入、缓存输入、输出分别计
非高峰折扣标准积分的 50%
高峰时段工作日 14:00–18:00(UTC+8)

同价升级是少见的情况:定价这个问题自己就回答了自己,除非你要权重、或者要关掉思考,否则没有留在 5.2 的成本理由。这个持平的单价还盖住了一件事——按 Z.ai 自己的数据,GLM 5.3 的 token 效率更高,同一个任务应该更便宜,而不是持平。

真正省钱的是缓存那一行。$0.26 对 $1.40,重复前缀只花冷读的 19%,而且促销期内缓存写入免费。OpenRouter 挂的也是 $1.4 / $4.4、上下文 1,048,576,说明第三方是原价透传,没有加价。端点表、迁移顺序,以及每个 reasoning_effort 档位的实测单次成本,见我们的 GLM 5.3 API 接入与定价。

GLM 5.3 的上下文窗口有多大?

1M token,最大输出 128K,两个数字都是官方写明的。 Z.ai 的 GLM-5.3 模型页列了这一对,智谱中文文档口径一致。

不过 Z.ai 自己跑评测时并没有全都拉满,这反而透露了模型实际被压到什么程度:

评测实际使用上下文最大输出
Terminal Bench 3.0400K128K
Terminal Bench 2.1未说明65,536
DeepSWE v1.1400K未说明
Agents’ Last Exam (CLI)1M64K
SWE-Marathon、PostTrainBench1M128K
NL2Repo1M64K
HLE with tools300,000,配上下文管理策略163,840

如果你本来打算吃满这 100 万,这个差距值得留意:1M 是模型能接受的上限,而 400K 是 Z.ai 给自己主打的编程榜单选的值。将来提供 5.3 服务的 endpoint 也可能自己再压一档,以那边公布的数字为准。

GLM 5.3 编程能力强了多少?

新的 agent 类榜单上提升很大,已经跑饱和的老榜单上提升有限。 下面所有数字都出自 Z.ai 自己。Terminal Bench、SWE-Marathon、Agents’ Last Exam 用的是 Claude Code 2.1.207,reasoning effort 拉到 max;DeepSWE 用的是 mini-swe-agent。

评测GLM 5.3GLM 5.2Kimi K3Opus 4.8GPT-5.6 Sol
Terminal Bench 3.028.34.617.421.134.6
Terminal Bench 2.188.281.088.385.088.8
DeepSWE v1.166.946.267.558.072.7
SWE-Marathon v1.142.519.448.148.842.5
Agents’ Last Exam (CLI)28.523.827.625.728.6
GDPval-AA v217691508168215881730

真正撑起这次发布的是 Terminal Bench 3.0 那一行:4.6 到 28.3,而 GLM 5.2 在这个榜单上基本算没参赛。换到 Terminal Bench 2.1,所有模型挤在 85 到 89 之间,同一次升级只值 7 分,排名一位没动。新榜单有空间显示变化,老榜单没有。

Z.ai 主推的其实不是分数,是 token。High 档下 GLM 5.3 在自家 Code Bench 上拿 31.4%,每题约 50K 输出 token;Claude Opus 4.8 是 29.5%,花掉 120K。

这条最值得自己验一遍,因为你付钱付的就是 token 数。Z.ai 还报了 Max 档 34.5%、约 75K token,对应 GLM 5.2 是 23.4%、96K。Claude Fable 5 在这个私有榜上仍以 39.5% 领先,Terminal Bench 3.0 的头名还是 GPT-5.6 Sol,所以准确的说法是「开源模型 SOTA」,不是「SOTA」。

整张表还有一点要提醒:它是一个私有榜加一批由厂商自己跑的公开榜。表里 Kimi K3 和 Claude Opus 4.8 的成绩是 Z.ai 跑的,不是各自厂商跑的。

升级 GLM 5.3 要改代码吗?

如果你关过思考,那就要改。thinking.type: "disabled" 已经取消,Z.ai 明说请求会直接失败。

新的约定:

  • thinking.type 只接受 enabled
  • reasoning_effort 接受 low、high、max,默认 max
  • 编程任务 Z.ai 建议用 max
  • 迁移顺序有讲究:先改成 enabled 加 reasoning_effort: "low",再换模型 ID
{
  "model": "glm-5.3",
  "thinking": { "type": "enabled" },
  "reasoning_effort": "max"
}

失去 disabled 的代价很容易被低估,所以我们在 2026 年 8 月 14 日拿 GLM 5.2 通过 OpenAI 兼容 endpoint 实测了一遍。同一条最简 prompt「Reply with the single word: ok」,每种配置跑三次:

请求配置输出 token(3 次)
默认(思考开启)144, 138, 90
reasoning_effort: "low"69, 86, 122
reasoning_effort: "max"101, 120, 102
thinking.type: "disabled"2, 2, 2

这么短的 prompt 上,思考档位之间的抖动比 low 和 max 的差距还大,所以别从这三行里读出什么排序。有意义的是最后一行:关掉思考每次都是 2 个输出 token,而最省的思考档也要 69 到 122。在 GLM 5.3 上,最后这一行没有了。

这张表测的是 GLM 5.2,而从它推出来的那个结论后来被推翻了。2026-08-19 直接在 GLM 5.3 上实测,一个单词答案的分类 prompt 在 reasoning_effort: "low" 下输出中位数是 3 个 token(10 次),max 是 105。5.3 上的地板不是 70 token,基本回到了当年 disabled 的水平。麻烦的是默认档就是 max,所以不显式设这个参数直接搬过去,拿到的就是 105 token 那一版。GLM 5.2 与 GPT-5.5 成本对比里有这类流量的具体算法。

GLM 5.3 支持哪些能力?

纯文本输入输出,外加思考模式、流式、Function Calling、上下文缓存、结构化输出。 这五项是 Z.ai 模型页当前列出的全部。

能力状态
输入 / 输出模态仅文本
思考模式low、high、max,不能关闭
流式输出支持
Function Calling支持
上下文缓存支持
结构化输出支持,含 JSON
MCP能力列表里已经不再列出

MCP 这一行值得单独说,因为它动过:8 月 15 日模型页的能力列表里还有 MCP 的链接,8 月 19 日就没有了,官方没有任何说明。所以别把 MCP 当成确定支持,接进去之前自己测一遍。

除此之外相对 GLM 5.2 没有任何新增,和「只做了后训练」的说法对得上。视觉、生图、语音仍在 GLM-5V 和 GLM-Image 那几条独立产品线上。

怎么用上 GLM 5.3?

现在有四条路:Z.ai 按量 API、GLM Coding Plan、ZCode,或者任何上架了 z-ai/glm-5.3 的聚合平台。

路径能拿到什么代价
Z.ai 模型 API按 token 计费 $1.4 / $4.4,三种协议订阅过 Coding Plan 的账号只能走一种协议,见下
GLM Coding Plan积分配额,非高峰五折订阅制,不是用多少付多少
ZCodeGoal 模式、98%+ 缓存命中率、限时 1.5 倍配额(至 2026-08-31)Z.ai 自家客户端
Claude Code / Cline / OpenCode沿用现有工具,换个模型走的是套餐配额,不是计量 key
聚合平台与网关一个 key 打通多模型模型 ID 各家不同,OpenRouter 和 ofox 上都是 z-ai/glm-5.3

真正落地的 endpoint 和发布当天预告的那套不一样。模型页现在写的是:OpenAI Chat Completion 协议走 https://api.z.ai/api/coding/paas/v4,OpenAI Response 协议走 https://api.z.ai/api/v1,Anthropic Message 协议走 https://api.z.ai/api/anthropic。发布当天那份说明里的 open.bigmodel.cn/api/paas/v4 不是最终形态,别再照抄。更麻烦的是同一个页面里的 Quick Start 示例请求打的是 https://api.z.ai/api/paas/v4/chat/completions,没有 /coding 这一段——一个页面两个口径,其中一个 404 的话,先试另一个,别急着怀疑 key。

还有一条限制容易漏:凡是订阅过 GLM Coding Plan 的账号(包括已过期的),目前只能走 OpenAI Chat Completion 协议访问模型 API。

走聚合平台的话,改两行就行:

from openai import OpenAI

client = OpenAI(api_key="YOUR_KEY", base_url="https://api.ofox.ai/v1")

r = client.chat.completions.create(
    model="z-ai/glm-5.3",
    messages=[{"role": "user", "content": "Refactor this module and run the tests."}],
    reasoning_effort="low",   # 5.3 上没有 "disabled" 这个选项了
)
print(r.usage)

模型 ID 的前缀是 z-ai 而不是 zai,写错这一点是拿到下面这个报错最常见的原因:

{"error":{"message":"Model 'zai/glm-5.3' not found","type":"model_not_found","code":404}}

z-ai/glm-5.2 在同一个 endpoint、同一把 key 上就能跑,所以两个模型之间切换只是改一个字符串。key 的完整配置步骤见 GLM 5.2 接入教程。

昨天刚发的模型,怎么让编程工具用上?

只要工具允许你自己填 endpoint,改一个字符串就够了。 发布周的样子每次都一样:订阅产品第一天就有这个模型,计量 API 隔几天才开,文档页比公告晚一天,而你手上每个工具都写死了一份模型列表。GLM 5.3 从 8 月 14 日到 8 月 19 日把这套流程完整走了一遍,权重还排在队尾。

你能控制的只有一件事:换个模型要重新接多少管子。允许你设 base_url 和模型字符串的工具,遇到新模型就是改一行。锁死下拉框的工具,只能等它自己发版——r/opencodeCLI 上的帖子在公告一小时内就出现了,原因就在这里。

Claude Code、OpenCode 和大多数工具说的都是 OpenAI 兼容的 HTTP,所以一个 key 挂一个 base URL,就能让它们共用同一份账单和同一套故障切换。ofox 的同一个 endpoint 后面挂着约 130 个模型,z-ai/glm-5.3 和 z-ai/glm-5.2 都已上架,两者之间来回切就是上面那段代码,别的什么都不用动。

GLM 5.3 和 GLM 5.2 到底差在哪?

差在后训练,以及三件你需要动手应对的事:思考关不掉了、权重还下不到、Terminal Bench 3.0 从 4.6 变成了 28.3。

GLM 5.3GLM 5.2
基座模型相同相同
上下文 / 最大输出1M / 128K1M / 128K
公布 token 单价$1.40 / $0.26 / $4.40$1.40 / $0.26 / $4.40
计量 API已可用已可用
聚合平台上架已上,z-ai/glm-5.3已上,z-ai/glm-5.2
权重仍未公开已公开,MIT
关闭思考不支持支持
思考档位low / high / max,默认 max档位之外还有 disabled
Terminal Bench 3.028.34.6

价格这一项既然打平,真正还站得住的理由只剩一个:你要能下载的权重。另一个候选——为高频短请求保留 thinking.type: "disabled"——一实测就没了:5.3 上 low 回答分类 prompt 的输出中位数是 3 个 token。其余情况都指向 5.3,而且 GLM 5.2 接入教程可以原样套用,key、endpoint、请求结构都没变。

参考信息来源

常见问题

GLM 5.3 的独立 API 现在能用了吗?
能用了。Z.ai 定价表已经有 GLM-5.3 这一行:输入 $1.4、缓存输入 $0.26、输出 $4.4,与 GLM 5.2 完全同价。OpenRouter 和包括 ofox 在内的网关也都已上架,模型 ID 是 z-ai/glm-5.3。GLM Coding Plan 仍是另一条按积分计费的路径。
GLM 5.3 最大能输出多少 token?
128K,上下文窗口 1M,这两个数字写在 Z.ai 模型页上。智谱自己跑 benchmark 时用的上限还更低一些:Terminal Bench 3.0 和 PostTrainBench 是 128K,Agents' Last Exam 只有 64K。将来真正提供服务的那个 endpoint 可能还会有自己的上限。
GLM 5.3 能配 Claude Code 用吗?
可以。Z.ai 把 Claude Code、Cline、OpenCode 列为 GLM Coding Plan 支持的编程工具,它自己跑分用的也是 Claude Code 2.1.207。注意别再传 thinking 关闭,改用 reasoning_effort,5.3 已经不接受关思考了。
GLM 5.3 和 Kimi K3 谁更强?
按智谱自己那张表:Terminal Bench 3.0 是 28.3 对 17.4、AutomationBench 是 48.2 对 46.7,GLM 5.3 赢;Toolathlon 76.5 对 73.0、SWE-Marathon 48.1 对 42.5,Kimi K3 赢。这些数字全部由 Z.ai 跑出,当成厂商声明看,别当第三方结论。
GLM 5.3 换基座了吗?
没有。Z.ai 明说 GLM 5.3 用的是和 GLM 5.2 完全相同的基座模型,所有提升都来自后训练。发布博文开头第一句就是「Scaling post-training is all we did for GLM-5.3」。
GLM 5.3 有免费额度吗?
没有免费档。按量计费是输入 $1.4 / 输出 $4.4(每 100 万 token)。想少付钱只有两条路:缓存输入按 $0.26 计,缓存写入限时免费;或者订阅 GLM Coding Plan,非高峰时段调用只消耗标准积分的一半,高峰是工作日 14:00–18:00(UTC+8)。
哪里能下载 GLM 5.3 权重?
暂时哪里都下不到。发布五天后,HuggingFace 上 zai-org/GLM-5.3 通过 API 访问仍返回 401,而 GLM 5.2 返回 200。Z.ai 说安全评估和加固做完之后放权重,大约在发布后两周,也就是 8 月底前后。