【GLM 5.3 接入】API 还没开放,现在只能这么用(附跑分与权重时间表)

GLM 5.3 已发布,但按 token 计费的独立 API 仍是「即将上线」,眼下唯一的官方入口是 GLM Coding Plan。这里有官方规格(1M 上下文 / 128K 输出)、全部跑分、权重发布时间,以及 thinking 关不掉之后的迁移成本实测。

【GLM 5.3 接入】API 还没开放,现在只能这么用(附跑分与权重时间表)

GLM 5.3 在 2026 年 8 月 14 日发布,一天过去,按 token 计费的独立 API 仍挂着「即将上线」,所有官方入口都只有 GLM Coding Plan 一条路。 模型沿用 GLM 5.2 的基座,全部提升来自后训练。权重承诺两周后放出。

发布时间:   2026-08-14(Z.ai 发布说明)
基座模型:   与 GLM 5.2 相同,提升全部来自后训练
规格:       1M 上下文,最大输出 128K(Z.ai 模型页)
开源权重:   未放出,Z.ai 称约两周后
编程能力:   Terminal Bench 3.0 从 4.6 到 28.3,开源模型 SOTA
破坏性变更: thinking.type "disabled" 取消;reasoning_effort 只剩 low/high/max
当前可用:   GLM Coding Plan、ZCode、Claude Code / Cline / OpenCode
独立 API:   「即将上线」,未给日期
尚未上架:   OpenRouter、各家聚合网关、HuggingFace
快照日期:   2026-08-15

GLM 5.3 是什么?

它是 GLM 5.2 的一次后训练升级,不是新的模型家族。 这话是 Z.ai 自己在 GLM-5.3 发布说明第一段写的:模型「用的是和 GLM-5.2 相同的基座」,「所有提升都来自后训练」。

  • 基座权重与 z-ai/glm-5.2 完全一致,上面多加了一个月的强化学习
  • 训练环境是合成的长程任务,有些任务放给资深工程师做也要好几天
  • 目标很明确,就是 agent 编程:终端任务、仓库级改动、多步工具调用
  • 发布说明里还有很长一节讲安全研究能力,不在本文范围内,感兴趣直接看原文

r/LocalLLaMA 的发布贴几小时内冲过 800 赞、赞同率 0.99,热评都盯着一件事:一个 743B 量级的模型在和大得多的对手掰手腕。不过这个参数量是社区自己算的,官方没公布过,所以别当事实引用。

GLM 5.3 什么时候发布的?

2026 年 8 月 14 日,当天就对 GLM Coding Plan 订阅用户全量开放。

各个入口的开放进度并不齐,去找之前先看这张表:

入口2026-08-15 状态
Z.ai 发布说明已发布(08-14)
GLM Coding Plan / ZCode全量可用
Z.ai 文档模型页已上线,写明 1M 上下文 + 128K 输出
独立模型 API「即将上线」,未给日期
Z.ai 定价表仍无 5.3 一行,最高还是 5.2
OpenRouter 目录没有 glm-5.3
包括 ofox 在内的各聚合网关尚未上架
HuggingFace 权重仓库已建,未公开

模型页比公告晚了一天才出现,这是发布流程的常态:第一天以发布说明为准,文档随后补齐。真正还没补上的是按 token 计费的那部分,而这恰恰是最多人等的。

GLM 5.3 开源了吗?

还没有。Z.ai 承诺在发布约两周后放出权重,条件是「安全评估和加固完成」。

这一条我们没有直接采信,而是实际去查了。HuggingFace 上 zai-org/GLM-5.3 仓库已经存在,通过 API 请求返回 401,而 zai-org/GLM-5.2 返回 200。401 而不是 404,说明仓库已经建好并处于受控状态,不是根本没有。这更像排好期的发布,而不是一句空话,但两周之后的承诺终究还是承诺。

上一轮可以当参照。Simon Willison 在 2026 年 6 月 17 日记录过:「中国的 Z.ai 在 6 月 13 日把 GLM-5.2 交给 coding plan 订阅用户,昨天(6 月 16 日)就放出了 MIT 许可的完整开源权重。」上次隔了三天,这次官方说的是两周。许可证也值得盯一眼——5.2 是 MIT,5.3 用什么 Z.ai 还没说。

这个月就要能下载的权重,那还是 GLM 5.2。我们的 GLM 5.2 本地部署指南讲了各档 GGUF 量化各自吃多少资源,自建成本与硬件配置里有 vLLM 的实测数据。5.3 和 5.2 共用基座,显存占用和部署形态基本不变——后训练升级唯一让人省心的地方就在这儿,容量规划不用重做。

GLM 5.3 多少钱?

Z.ai 还没公布 GLM 5.3 的 token 单价,而且这个价格要对应的独立 API 本身也还没开。 开发者文档里的定价表截至本次快照仍然停在 GLM 5.2。

目前有明确口径的只有这些:

项目价格
GLM 5.2 输入(参照)$1.40 / 100 万 token
GLM 5.2 缓存输入$0.26 / 100 万 token
GLM 5.2 输出$4.40 / 100 万 token
GLM Coding Plan积分配额,输入、缓存输入、输出分别计
非高峰折扣标准积分的 50%
高峰时段工作日 14:00–18:00(UTC+8)

三个结论。第一,所有路径都没有免费档,最便宜的入口是订阅 Coding Plan,不是申请试用 key。第二,高峰只占每周 20 小时,其余时间(含整个周末)都按半价积分计,所以夜里跑的批量任务默认就是五折,不用去谈。第三,在 5.3 那一行出现之前,任何人给你报的 GLM 5.3 单价都是从 5.2 推算的。

GLM 5.3 的上下文窗口有多大?

1M token,最大输出 128K,两个数字都是官方写明的。 Z.ai 的 GLM-5.3 模型页列了这一对,智谱中文文档口径一致。

不过 Z.ai 自己跑评测时并没有全都拉满,这反而透露了模型实际被压到什么程度:

评测实际使用上下文最大输出
Terminal Bench 3.0400K128K
Terminal Bench 2.1未说明65,536
DeepSWE v1.1400K未说明
Agents’ Last Exam (CLI)1M64K
SWE-Marathon、PostTrainBench1M128K
NL2Repo1M64K
HLE with tools300,000,配上下文管理策略163,840

如果你本来打算吃满这 100 万,这个差距值得留意:1M 是模型能接受的上限,而 400K 是 Z.ai 给自己主打的编程榜单选的值。将来提供 5.3 服务的 endpoint 也可能自己再压一档,以那边公布的数字为准。

GLM 5.3 编程能力强了多少?

新的 agent 类榜单上提升很大,已经跑饱和的老榜单上提升有限。 下面所有数字都出自 Z.ai 自己。Terminal Bench、SWE-Marathon、Agents’ Last Exam 用的是 Claude Code 2.1.207,reasoning effort 拉到 max;DeepSWE 用的是 mini-swe-agent。

评测GLM 5.3GLM 5.2Kimi K3Opus 4.8GPT-5.6 Sol
Terminal Bench 3.028.34.617.421.134.6
Terminal Bench 2.188.281.088.385.088.8
DeepSWE v1.166.946.267.558.072.7
SWE-Marathon v1.142.519.448.148.842.5
Agents’ Last Exam (CLI)28.523.827.625.728.6
GDPval-AA v217691508168215881730

真正撑起这次发布的是 Terminal Bench 3.0 那一行:4.6 到 28.3,而 GLM 5.2 在这个榜单上基本算没参赛。换到 Terminal Bench 2.1,所有模型挤在 85 到 89 之间,同一次升级只值 7 分,排名一位没动。新榜单有空间显示变化,老榜单没有。

Z.ai 主推的其实不是分数,是 token。High 档下 GLM 5.3 在自家 Code Bench 上拿 31.4%,每题约 50K 输出 token;Claude Opus 4.8 是 29.5%,花掉 120K。

这条最值得自己验一遍,因为你付钱付的就是 token 数。Z.ai 还报了 Max 档 34.5%、约 75K token,对应 GLM 5.2 是 23.4%、96K。Claude Fable 5 在这个私有榜上仍以 39.5% 领先,Terminal Bench 3.0 的头名还是 GPT-5.6 Sol,所以准确的说法是「开源模型 SOTA」,不是「SOTA」。

整张表还有一点要提醒:它是一个私有榜加一批由厂商自己跑的公开榜。表里 Kimi K3Claude Opus 4.8 的成绩是 Z.ai 跑的,不是各自厂商跑的。

升级 GLM 5.3 要改代码吗?

如果你关过思考,那就要改。thinking.type: "disabled" 已经取消,Z.ai 明说请求会直接失败。

新的约定:

  • thinking.type 只接受 enabled
  • reasoning_effort 接受 lowhighmax,默认 max
  • 编程任务 Z.ai 建议用 max
  • 迁移顺序有讲究:先改成 enabledreasoning_effort: "low",再换模型 ID
{
  "model": "glm-5.3",
  "thinking": { "type": "enabled" },
  "reasoning_effort": "max"
}

失去 disabled 的代价很容易被低估,所以我们在 2026 年 8 月 14 日拿 GLM 5.2 通过 OpenAI 兼容 endpoint 实测了一遍。同一条最简 prompt「Reply with the single word: ok」,每种配置跑三次:

请求配置输出 token(3 次)
默认(思考开启)144, 138, 90
reasoning_effort: "low"69, 86, 122
reasoning_effort: "max"101, 120, 102
thinking.type: "disabled"2, 2, 2

这么短的 prompt 上,思考档位之间的抖动比 lowmax 的差距还大,所以别从这三行里读出什么排序。有意义的是最后一行:关掉思考每次都是 2 个输出 token,而最省的思考档也要 69 到 122。在 GLM 5.3 上,最后这一行没有了。

分类、路由、抽取这类高频短答场景,换模型之前先把这笔账算清楚,因为 low 现在就是地板。GLM 5.2 与 GPT-5.5 成本对比里有这类流量的具体算法。

GLM 5.3 支持哪些能力?

纯文本输入输出,外加思考模式、流式、Function Calling、上下文缓存、结构化输出和 MCP。 Z.ai 模型页六项全列,智谱中文页除 MCP 外相同。

能力状态
输入 / 输出模态仅文本
思考模式lowhighmax,不能关闭
流式输出支持
Function Calling支持
上下文缓存支持
结构化输出支持,含 JSON
MCPZ.ai 模型页列出

相对 GLM 5.2 这里没有任何新增,和「只做了后训练」的说法对得上。视觉、生图、语音仍在 GLM-5V 和 GLM-Image 那几条独立产品线上。

怎么用上 GLM 5.3?

当下只有三条路:GLM Coding Plan、ZCode,或者任何允许你自己填 endpoint 的编程工具。按 token 计费的 API 还没开。

路径能拿到什么代价
GLM Coding Plan积分配额,非高峰五折订阅制,不是用多少付多少
ZCodeGoal 模式、98%+ 缓存命中率、限时 1.5 倍配额(至 2026-08-31)Z.ai 自家客户端
Claude Code / Cline / OpenCode沿用现有工具,换个模型走的是套餐配额,不是计量 key
独立模型 API按 token 计费「即将上线」,没日期也没价格
聚合平台与网关一个 key 打通多模型本次快照时尚未上架 5.3

智谱把 API 将来落地的 endpoint 先公布了:OpenAI Chat Completion 协议走 https://open.bigmodel.cn/api/paas/v4,OpenAI Response 协议走 /api/v1,Anthropic Message 协议走 /api/anthropic。同一段里还藏着一条容易漏掉的限制:凡是订阅过 GLM Coding Plan 的账号(包括已过期的),暂时只能走 Chat Completion 协议。

只要是 OpenAI 兼容的通道,等你的服务商上架之后改两行就行:

from openai import OpenAI

client = OpenAI(api_key="YOUR_KEY", base_url="https://api.ofox.ai/v1")

r = client.chat.completions.create(
    model="z-ai/glm-5.3",
    messages=[{"role": "user", "content": "Refactor this module and run the tests."}],
    reasoning_effort="low",   # 5.3 上没有 "disabled" 这个选项了
)
print(r.usage)

在目录更新之前跑这段,会拿到意料之中的报错。先知道长什么样,免得去排查鉴权问题:

{"error":{"message":"Model 'z-ai/glm-5.3' not found","type":"model_not_found","code":404}}

z-ai/glm-5.2 在同一个 endpoint 上今天就能跑通,也就是说 endpoint、key 和请求结构现在全都是对的,5.3 一上架直接就能用。key 的完整配置步骤见 GLM 5.2 接入教程

昨天刚发的模型,怎么让编程工具用上?

只要工具允许你自己填 endpoint,改一个字符串就够了。 发布周的样子每次都一样:订阅产品里有这个模型,计量 API 里没有,文档页晚一天,而你手上每个工具都写死了一份模型列表。2026 年 8 月 15 日这个断层在 GLM 5.3 上是双向的:Coding Plan 订阅用户已经在跑,而 OpenRouter 和各家网关连东西都还拿不到,HuggingFace 仓库也锁着。

你能控制的只有一件事:换个模型要重新接多少管子。允许你设 base_url 和模型字符串的工具,遇到新模型就是改一行。锁死下拉框的工具,只能等它自己发版——r/opencodeCLI 上的帖子在公告一小时内就出现了,原因就在这里。

Claude Code、OpenCode 和大多数工具说的都是 OpenAI 兼容的 HTTP,所以一个 key 挂一个 base URL,就能让它们共用同一份账单和同一套故障切换。ofox 充值立减 15%,活动至 2026-08-31,同一个 endpoint 后面挂着约 130 个模型,GLM 5.2 也在里面。本次快照时 5.3 还没上,上了之后要改的就是上面那段代码。

GLM 5.3 和 GLM 5.2 到底差在哪?

差在后训练,以及三件你需要动手应对的事:思考关不掉了、权重还下不到、Terminal Bench 3.0 从 4.6 变成了 28.3。

GLM 5.3GLM 5.2
基座模型相同相同
上下文 / 最大输出1M / 128K1M / 128K
权重发布后约两周已公开
关闭思考不支持支持
思考档位low / high / max,默认 max档位之外还有 disabled
Terminal Bench 3.028.34.6
公布 token 单价尚无$1.40 / $4.40
计量 API即将上线已可用
聚合平台上架

这个月就要下载权重、要有明码单价、要按量计费,或者需要为短请求关掉思考省钱,那就继续用 GLM 5.2。手上的活是长程 agent 编程、而且已经在订阅 Coding Plan,那 GLM 5.3 值得换,差距明显的也只有这一块。

参考信息来源

常见问题

GLM 5.3 的独立 API 现在能用了吗?
还不能。Z.ai 模型页顶部挂着「The GLM-5.3 API is coming soon」,智谱中文文档写的是「模型 API 将会尽快上线」,两边都没给日期。目前唯一的官方入口是 GLM Coding Plan,订阅用户已经全量可用。
GLM 5.3 最大能输出多少 token?
128K,上下文窗口 1M,这两个数字写在 Z.ai 模型页上。智谱自己跑 benchmark 时用的上限还更低一些:Terminal Bench 3.0 和 PostTrainBench 是 128K,Agents' Last Exam 只有 64K。将来真正提供服务的那个 endpoint 可能还会有自己的上限。
GLM 5.3 能配 Claude Code 用吗?
可以。Z.ai 把 Claude Code、Cline、OpenCode 列为 GLM Coding Plan 支持的编程工具,它自己跑分用的也是 Claude Code 2.1.207。注意别再传 thinking 关闭,改用 reasoning_effort,5.3 已经不接受关思考了。
GLM 5.3 和 Kimi K3 谁更强?
按智谱自己那张表:Terminal Bench 3.0 是 28.3 对 17.4、AutomationBench 是 48.2 对 46.7,GLM 5.3 赢;Toolathlon 76.5 对 73.0、SWE-Marathon 48.1 对 42.5,Kimi K3 赢。这些数字全部由 Z.ai 跑出,当成厂商声明看,别当第三方结论。
GLM 5.3 换基座了吗?
没有。Z.ai 明说 GLM 5.3 用的是和 GLM 5.2 完全相同的基座模型,所有提升都来自后训练。发布博文开头第一句就是「Scaling post-training is all we did for GLM-5.3」。
GLM 5.3 有免费额度吗?
没有免费档。目前只能通过按积分计费的 GLM Coding Plan 或 ZCode 用。非高峰时段调用只消耗标准积分的一半,高峰是工作日 14:00–18:00(UTC+8),这是眼下唯一能拿到的折扣。
哪里能下载 GLM 5.3 权重?
暂时哪里都下不到。HuggingFace 上 zai-org/GLM-5.3 这个仓库已经建好但没公开,通过 API 访问返回 401,而 GLM 5.2 返回 200。Z.ai 说安全评估和加固做完之后放权重,大约在发布后两周。