【GLM 5.3 接入】API 还没开放,现在只能这么用(附跑分与权重时间表)
GLM 5.3 已发布,但按 token 计费的独立 API 仍是「即将上线」,眼下唯一的官方入口是 GLM Coding Plan。这里有官方规格(1M 上下文 / 128K 输出)、全部跑分、权重发布时间,以及 thinking 关不掉之后的迁移成本实测。
GLM 5.3 在 2026 年 8 月 14 日发布,一天过去,按 token 计费的独立 API 仍挂着「即将上线」,所有官方入口都只有 GLM Coding Plan 一条路。 模型沿用 GLM 5.2 的基座,全部提升来自后训练。权重承诺两周后放出。
发布时间: 2026-08-14(Z.ai 发布说明)
基座模型: 与 GLM 5.2 相同,提升全部来自后训练
规格: 1M 上下文,最大输出 128K(Z.ai 模型页)
开源权重: 未放出,Z.ai 称约两周后
编程能力: Terminal Bench 3.0 从 4.6 到 28.3,开源模型 SOTA
破坏性变更: thinking.type "disabled" 取消;reasoning_effort 只剩 low/high/max
当前可用: GLM Coding Plan、ZCode、Claude Code / Cline / OpenCode
独立 API: 「即将上线」,未给日期
尚未上架: OpenRouter、各家聚合网关、HuggingFace
快照日期: 2026-08-15
GLM 5.3 是什么?
它是 GLM 5.2 的一次后训练升级,不是新的模型家族。 这话是 Z.ai 自己在 GLM-5.3 发布说明第一段写的:模型「用的是和 GLM-5.2 相同的基座」,「所有提升都来自后训练」。
- 基座权重与
z-ai/glm-5.2完全一致,上面多加了一个月的强化学习 - 训练环境是合成的长程任务,有些任务放给资深工程师做也要好几天
- 目标很明确,就是 agent 编程:终端任务、仓库级改动、多步工具调用
- 发布说明里还有很长一节讲安全研究能力,不在本文范围内,感兴趣直接看原文
r/LocalLLaMA 的发布贴几小时内冲过 800 赞、赞同率 0.99,热评都盯着一件事:一个 743B 量级的模型在和大得多的对手掰手腕。不过这个参数量是社区自己算的,官方没公布过,所以别当事实引用。
GLM 5.3 什么时候发布的?
2026 年 8 月 14 日,当天就对 GLM Coding Plan 订阅用户全量开放。
各个入口的开放进度并不齐,去找之前先看这张表:
| 入口 | 2026-08-15 状态 |
|---|---|
| Z.ai 发布说明 | 已发布(08-14) |
| GLM Coding Plan / ZCode | 全量可用 |
| Z.ai 文档模型页 | 已上线,写明 1M 上下文 + 128K 输出 |
| 独立模型 API | 「即将上线」,未给日期 |
| Z.ai 定价表 | 仍无 5.3 一行,最高还是 5.2 |
| OpenRouter 目录 | 没有 glm-5.3 |
| 包括 ofox 在内的各聚合网关 | 尚未上架 |
| HuggingFace 权重 | 仓库已建,未公开 |
模型页比公告晚了一天才出现,这是发布流程的常态:第一天以发布说明为准,文档随后补齐。真正还没补上的是按 token 计费的那部分,而这恰恰是最多人等的。
GLM 5.3 开源了吗?
还没有。Z.ai 承诺在发布约两周后放出权重,条件是「安全评估和加固完成」。
这一条我们没有直接采信,而是实际去查了。HuggingFace 上 zai-org/GLM-5.3 仓库已经存在,通过 API 请求返回 401,而 zai-org/GLM-5.2 返回 200。401 而不是 404,说明仓库已经建好并处于受控状态,不是根本没有。这更像排好期的发布,而不是一句空话,但两周之后的承诺终究还是承诺。
上一轮可以当参照。Simon Willison 在 2026 年 6 月 17 日记录过:「中国的 Z.ai 在 6 月 13 日把 GLM-5.2 交给 coding plan 订阅用户,昨天(6 月 16 日)就放出了 MIT 许可的完整开源权重。」上次隔了三天,这次官方说的是两周。许可证也值得盯一眼——5.2 是 MIT,5.3 用什么 Z.ai 还没说。
这个月就要能下载的权重,那还是 GLM 5.2。我们的 GLM 5.2 本地部署指南讲了各档 GGUF 量化各自吃多少资源,自建成本与硬件配置里有 vLLM 的实测数据。5.3 和 5.2 共用基座,显存占用和部署形态基本不变——后训练升级唯一让人省心的地方就在这儿,容量规划不用重做。
GLM 5.3 多少钱?
Z.ai 还没公布 GLM 5.3 的 token 单价,而且这个价格要对应的独立 API 本身也还没开。 开发者文档里的定价表截至本次快照仍然停在 GLM 5.2。
目前有明确口径的只有这些:
| 项目 | 价格 |
|---|---|
| GLM 5.2 输入(参照) | $1.40 / 100 万 token |
| GLM 5.2 缓存输入 | $0.26 / 100 万 token |
| GLM 5.2 输出 | $4.40 / 100 万 token |
| GLM Coding Plan | 积分配额,输入、缓存输入、输出分别计 |
| 非高峰折扣 | 标准积分的 50% |
| 高峰时段 | 工作日 14:00–18:00(UTC+8) |
三个结论。第一,所有路径都没有免费档,最便宜的入口是订阅 Coding Plan,不是申请试用 key。第二,高峰只占每周 20 小时,其余时间(含整个周末)都按半价积分计,所以夜里跑的批量任务默认就是五折,不用去谈。第三,在 5.3 那一行出现之前,任何人给你报的 GLM 5.3 单价都是从 5.2 推算的。
GLM 5.3 的上下文窗口有多大?
1M token,最大输出 128K,两个数字都是官方写明的。 Z.ai 的 GLM-5.3 模型页列了这一对,智谱中文文档口径一致。
不过 Z.ai 自己跑评测时并没有全都拉满,这反而透露了模型实际被压到什么程度:
| 评测 | 实际使用上下文 | 最大输出 |
|---|---|---|
| Terminal Bench 3.0 | 400K | 128K |
| Terminal Bench 2.1 | 未说明 | 65,536 |
| DeepSWE v1.1 | 400K | 未说明 |
| Agents’ Last Exam (CLI) | 1M | 64K |
| SWE-Marathon、PostTrainBench | 1M | 128K |
| NL2Repo | 1M | 64K |
| HLE with tools | 300,000,配上下文管理策略 | 163,840 |
如果你本来打算吃满这 100 万,这个差距值得留意:1M 是模型能接受的上限,而 400K 是 Z.ai 给自己主打的编程榜单选的值。将来提供 5.3 服务的 endpoint 也可能自己再压一档,以那边公布的数字为准。
GLM 5.3 编程能力强了多少?
新的 agent 类榜单上提升很大,已经跑饱和的老榜单上提升有限。 下面所有数字都出自 Z.ai 自己。Terminal Bench、SWE-Marathon、Agents’ Last Exam 用的是 Claude Code 2.1.207,reasoning effort 拉到 max;DeepSWE 用的是 mini-swe-agent。
| 评测 | GLM 5.3 | GLM 5.2 | Kimi K3 | Opus 4.8 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal Bench 3.0 | 28.3 | 4.6 | 17.4 | 21.1 | 34.6 |
| Terminal Bench 2.1 | 88.2 | 81.0 | 88.3 | 85.0 | 88.8 |
| DeepSWE v1.1 | 66.9 | 46.2 | 67.5 | 58.0 | 72.7 |
| SWE-Marathon v1.1 | 42.5 | 19.4 | 48.1 | 48.8 | 42.5 |
| Agents’ Last Exam (CLI) | 28.5 | 23.8 | 27.6 | 25.7 | 28.6 |
| GDPval-AA v2 | 1769 | 1508 | 1682 | 1588 | 1730 |
真正撑起这次发布的是 Terminal Bench 3.0 那一行:4.6 到 28.3,而 GLM 5.2 在这个榜单上基本算没参赛。换到 Terminal Bench 2.1,所有模型挤在 85 到 89 之间,同一次升级只值 7 分,排名一位没动。新榜单有空间显示变化,老榜单没有。
Z.ai 主推的其实不是分数,是 token。High 档下 GLM 5.3 在自家 Code Bench 上拿 31.4%,每题约 50K 输出 token;Claude Opus 4.8 是 29.5%,花掉 120K。
这条最值得自己验一遍,因为你付钱付的就是 token 数。Z.ai 还报了 Max 档 34.5%、约 75K token,对应 GLM 5.2 是 23.4%、96K。Claude Fable 5 在这个私有榜上仍以 39.5% 领先,Terminal Bench 3.0 的头名还是 GPT-5.6 Sol,所以准确的说法是「开源模型 SOTA」,不是「SOTA」。
整张表还有一点要提醒:它是一个私有榜加一批由厂商自己跑的公开榜。表里 Kimi K3 和 Claude Opus 4.8 的成绩是 Z.ai 跑的,不是各自厂商跑的。
升级 GLM 5.3 要改代码吗?
如果你关过思考,那就要改。thinking.type: "disabled" 已经取消,Z.ai 明说请求会直接失败。
新的约定:
thinking.type只接受enabledreasoning_effort接受low、high、max,默认max- 编程任务 Z.ai 建议用
max - 迁移顺序有讲究:先改成
enabled加reasoning_effort: "low",再换模型 ID
{
"model": "glm-5.3",
"thinking": { "type": "enabled" },
"reasoning_effort": "max"
}
失去 disabled 的代价很容易被低估,所以我们在 2026 年 8 月 14 日拿 GLM 5.2 通过 OpenAI 兼容 endpoint 实测了一遍。同一条最简 prompt「Reply with the single word: ok」,每种配置跑三次:
| 请求配置 | 输出 token(3 次) |
|---|---|
| 默认(思考开启) | 144, 138, 90 |
reasoning_effort: "low" | 69, 86, 122 |
reasoning_effort: "max" | 101, 120, 102 |
thinking.type: "disabled" | 2, 2, 2 |
这么短的 prompt 上,思考档位之间的抖动比 low 和 max 的差距还大,所以别从这三行里读出什么排序。有意义的是最后一行:关掉思考每次都是 2 个输出 token,而最省的思考档也要 69 到 122。在 GLM 5.3 上,最后这一行没有了。
分类、路由、抽取这类高频短答场景,换模型之前先把这笔账算清楚,因为 low 现在就是地板。GLM 5.2 与 GPT-5.5 成本对比里有这类流量的具体算法。
GLM 5.3 支持哪些能力?
纯文本输入输出,外加思考模式、流式、Function Calling、上下文缓存、结构化输出和 MCP。 Z.ai 模型页六项全列,智谱中文页除 MCP 外相同。
| 能力 | 状态 |
|---|---|
| 输入 / 输出模态 | 仅文本 |
| 思考模式 | low、high、max,不能关闭 |
| 流式输出 | 支持 |
| Function Calling | 支持 |
| 上下文缓存 | 支持 |
| 结构化输出 | 支持,含 JSON |
| MCP | Z.ai 模型页列出 |
相对 GLM 5.2 这里没有任何新增,和「只做了后训练」的说法对得上。视觉、生图、语音仍在 GLM-5V 和 GLM-Image 那几条独立产品线上。
怎么用上 GLM 5.3?
当下只有三条路:GLM Coding Plan、ZCode,或者任何允许你自己填 endpoint 的编程工具。按 token 计费的 API 还没开。
| 路径 | 能拿到什么 | 代价 |
|---|---|---|
| GLM Coding Plan | 积分配额,非高峰五折 | 订阅制,不是用多少付多少 |
| ZCode | Goal 模式、98%+ 缓存命中率、限时 1.5 倍配额(至 2026-08-31) | Z.ai 自家客户端 |
| Claude Code / Cline / OpenCode | 沿用现有工具,换个模型 | 走的是套餐配额,不是计量 key |
| 独立模型 API | 按 token 计费 | 「即将上线」,没日期也没价格 |
| 聚合平台与网关 | 一个 key 打通多模型 | 本次快照时尚未上架 5.3 |
智谱把 API 将来落地的 endpoint 先公布了:OpenAI Chat Completion 协议走 https://open.bigmodel.cn/api/paas/v4,OpenAI Response 协议走 /api/v1,Anthropic Message 协议走 /api/anthropic。同一段里还藏着一条容易漏掉的限制:凡是订阅过 GLM Coding Plan 的账号(包括已过期的),暂时只能走 Chat Completion 协议。
只要是 OpenAI 兼容的通道,等你的服务商上架之后改两行就行:
from openai import OpenAI
client = OpenAI(api_key="YOUR_KEY", base_url="https://api.ofox.ai/v1")
r = client.chat.completions.create(
model="z-ai/glm-5.3",
messages=[{"role": "user", "content": "Refactor this module and run the tests."}],
reasoning_effort="low", # 5.3 上没有 "disabled" 这个选项了
)
print(r.usage)
在目录更新之前跑这段,会拿到意料之中的报错。先知道长什么样,免得去排查鉴权问题:
{"error":{"message":"Model 'z-ai/glm-5.3' not found","type":"model_not_found","code":404}}
z-ai/glm-5.2 在同一个 endpoint 上今天就能跑通,也就是说 endpoint、key 和请求结构现在全都是对的,5.3 一上架直接就能用。key 的完整配置步骤见 GLM 5.2 接入教程。
昨天刚发的模型,怎么让编程工具用上?
只要工具允许你自己填 endpoint,改一个字符串就够了。 发布周的样子每次都一样:订阅产品里有这个模型,计量 API 里没有,文档页晚一天,而你手上每个工具都写死了一份模型列表。2026 年 8 月 15 日这个断层在 GLM 5.3 上是双向的:Coding Plan 订阅用户已经在跑,而 OpenRouter 和各家网关连东西都还拿不到,HuggingFace 仓库也锁着。
你能控制的只有一件事:换个模型要重新接多少管子。允许你设 base_url 和模型字符串的工具,遇到新模型就是改一行。锁死下拉框的工具,只能等它自己发版——r/opencodeCLI 上的帖子在公告一小时内就出现了,原因就在这里。
Claude Code、OpenCode 和大多数工具说的都是 OpenAI 兼容的 HTTP,所以一个 key 挂一个 base URL,就能让它们共用同一份账单和同一套故障切换。ofox 充值立减 15%,活动至 2026-08-31,同一个 endpoint 后面挂着约 130 个模型,GLM 5.2 也在里面。本次快照时 5.3 还没上,上了之后要改的就是上面那段代码。
GLM 5.3 和 GLM 5.2 到底差在哪?
差在后训练,以及三件你需要动手应对的事:思考关不掉了、权重还下不到、Terminal Bench 3.0 从 4.6 变成了 28.3。
| GLM 5.3 | GLM 5.2 | |
|---|---|---|
| 基座模型 | 相同 | 相同 |
| 上下文 / 最大输出 | 1M / 128K | 1M / 128K |
| 权重 | 发布后约两周 | 已公开 |
| 关闭思考 | 不支持 | 支持 |
| 思考档位 | low / high / max,默认 max | 档位之外还有 disabled |
| Terminal Bench 3.0 | 28.3 | 4.6 |
| 公布 token 单价 | 尚无 | $1.40 / $4.40 |
| 计量 API | 即将上线 | 已可用 |
| 聚合平台上架 | 否 | 是 |
这个月就要下载权重、要有明码单价、要按量计费,或者需要为短请求关掉思考省钱,那就继续用 GLM 5.2。手上的活是长程 agent 编程、而且已经在订阅 Coding Plan,那 GLM 5.3 值得换,差距明显的也只有这一块。
参考信息来源
常见问题
- GLM 5.3 的独立 API 现在能用了吗?
- 还不能。Z.ai 模型页顶部挂着「The GLM-5.3 API is coming soon」,智谱中文文档写的是「模型 API 将会尽快上线」,两边都没给日期。目前唯一的官方入口是 GLM Coding Plan,订阅用户已经全量可用。
- GLM 5.3 最大能输出多少 token?
- 128K,上下文窗口 1M,这两个数字写在 Z.ai 模型页上。智谱自己跑 benchmark 时用的上限还更低一些:Terminal Bench 3.0 和 PostTrainBench 是 128K,Agents' Last Exam 只有 64K。将来真正提供服务的那个 endpoint 可能还会有自己的上限。
- GLM 5.3 能配 Claude Code 用吗?
- 可以。Z.ai 把 Claude Code、Cline、OpenCode 列为 GLM Coding Plan 支持的编程工具,它自己跑分用的也是 Claude Code 2.1.207。注意别再传 thinking 关闭,改用 reasoning_effort,5.3 已经不接受关思考了。
- GLM 5.3 和 Kimi K3 谁更强?
- 按智谱自己那张表:Terminal Bench 3.0 是 28.3 对 17.4、AutomationBench 是 48.2 对 46.7,GLM 5.3 赢;Toolathlon 76.5 对 73.0、SWE-Marathon 48.1 对 42.5,Kimi K3 赢。这些数字全部由 Z.ai 跑出,当成厂商声明看,别当第三方结论。
- GLM 5.3 换基座了吗?
- 没有。Z.ai 明说 GLM 5.3 用的是和 GLM 5.2 完全相同的基座模型,所有提升都来自后训练。发布博文开头第一句就是「Scaling post-training is all we did for GLM-5.3」。
- GLM 5.3 有免费额度吗?
- 没有免费档。目前只能通过按积分计费的 GLM Coding Plan 或 ZCode 用。非高峰时段调用只消耗标准积分的一半,高峰是工作日 14:00–18:00(UTC+8),这是眼下唯一能拿到的折扣。
- 哪里能下载 GLM 5.3 权重?
- 暂时哪里都下不到。HuggingFace 上 zai-org/GLM-5.3 这个仓库已经建好但没公开,通过 API 访问返回 401,而 GLM 5.2 返回 200。Z.ai 说安全评估和加固做完之后放权重,大约在发布后两周。


