GLM 5.3 の実力と使い方:ベンチマーク、API提供状況、重み公開の時期(2026)

GLM 5.3 の単体APIが開きました。入力 $1.4 / 出力 $4.4 で GLM 5.2 と同額、OpenRouter や各ゲートウェイにも掲載済み。

暖色のスタジオ台に置かれた同じ形のスレートグレーの石板が2つ。右側の1つには琥珀色に光るスイッチとケーブルが付いており、その奥の影には施錠されたままの輸送用木箱が控えている

GLM 5.3 は 2026年8月14日のリリース時点で従量APIがありませんでしたが、5日後にその穴は埋まりました。単体APIは開いており、入力 $1.4 / 出力 $4.4 と GLM 5.2 と同額、OpenRouter やサードパーティのゲートウェイにも載っています。 残っているのは重みだけです。モデルは GLM 5.2 のベースをそのまま使っており、性能向上はすべてポストトレーニングによるものです。

リリース:     2026-08-14(Z.ai リリースノート)
ベースモデル: GLM 5.2 と同一、向上はすべてポストトレーニング
仕様:         1M コンテキスト、最大出力 128K(Z.ai モデルページ)
価格:         入力 $1.4 / キャッシュ入力 $0.26 / 出力 $4.4、GLM 5.2 と同額
オープン重み: 未公開のまま、HuggingFace は 401
コーディング: Terminal Bench 3.0 が 4.6 から 28.3、オープンソース SOTA
破壊的変更:   thinking.type "disabled" 廃止、reasoning_effort は low/high/max
単体API:      公開済み、api.z.ai、3つのプロトコル
その他の窓口: OpenRouter、各種ゲートウェイ、GLM Coding Plan、ZCode
スナップショット: 2026-08-19

GLM 5.3 とは?

新しいモデルファミリーではなく、GLM 5.2 のポストトレーニング版です。 Z.ai はGLM-5.3 リリースノートの第1段落でそう述べています。モデルは「GLM-5.2 と同じベースモデルを使用」しており、「すべての向上はポストトレーニングから生まれた」とのことです。

  • ベースの重みは z-ai/glm-5.2 と同一で、その上に1か月分の追加 RL を積んでいる
  • 学習に使ったのは合成された長期タスク環境で、熟練エンジニアでも数日かかる規模のものも含まれる
  • 狙いはエージェント型のコーディング。ターミナル操作、リポジトリ規模の作業、多段のツール呼び出し
  • リリースノートにはセキュリティ研究に関する長い節もありますが、本記事の範囲外です。関心があれば原文をどうぞ

r/LocalLLaMA のリリーススレッドは数時間で800票を超え、賛成率は 0.99。上位の返信が食いついていたのは一点で、743B クラスのモデルがはるかに大きい相手と渡り合っている、という話でした。ただしこのパラメータ数はコミュニティの推算であって公表仕様ではないため、事実としては扱いません。

GLM 5.3 はいつリリースされた?

2026年8月14日で、同日中に GLM Coding Plan の全サブスクライバーへ届きました。

ロールアウトの進み方はそろっていないので、探しに行く前にこの表を見てください。

提供面2026-08-14 時点2026-08-19 時点
Z.ai リリースノート公開済み変更なし
GLM Coding Plan / ZCode全サブスクライバーに提供中提供中
Z.ai ドキュメントのモデルページ未公開公開済み、1Mコンテキスト・128K出力
単体モデルAPI「近日公開」、日付なし公開済み、api.z.ai の3プロトコル
Z.ai の価格表GLM 5.2 止まりGLM-5.3 の行、$1.4 / $0.26 / $4.4
OpenRouter のカタログエントリなしz-ai/glm-5.3、コンテキスト 1,048,576
ofox を含む各ゲートウェイ未掲載z-ai/glm-5.3 掲載済み
HuggingFace の重み非公開依然として 401

5日で、購読者限定から重み以外は全面提供まで進みました。これは Z.ai のリリースの定型で、順序を覚えておく価値があります。プランが最初にモデルを受け取り、従量APIが数日遅れて続き、重みが最後に出ます。

GLM 5.3 はオープンソース?

まだです。Z.ai は「安全性評価とハードニングが完了したら」、リリースからおよそ2週間後に重みを公開すると約束しています。

これは鵜呑みにせず実際に確認しました。HuggingFace のリポジトリ zai-org/GLM-5.3 はすでに存在し、API では 401 が返ります。一方 zai-org/GLM-5.2 は 200 です。404 ではなく 401 ということは、リポジトリが作成済みでゲートされている状態であり、存在しないわけではありません。漠然とした意向というより日程の決まった公開に近い挙動です。リリース5日目の8月19日に再確認しても 401 のままで、2週間という説明どおりなら8月末あたりになります。

待ち時間の目安になる前例があります。Simon Willison は 2026年6月17日にこう書いています。「中国の AI ラボ Z.ai は6月13日に GLM-5.2 をコーディングプランの購読者へ提供し、その翌日(6月16日)に MIT ライセンスで完全なオープン重みを公開した。」前回は3日、今回の告知は2週間です。ライセンスも注視する価値があります。5.2 は MIT でしたが、5.3 が何になるかを Z.ai はまだ述べていません。

今すぐ実際にダウンロードできる重みが必要なら、選択肢は GLM 5.2 のままです。GLM 5.2 ローカル実行ガイドで GGUF 量子化の各段階に必要なリソースを、セルフホストのハードウェアとコストで vLLM の実測値を扱っています。5.3 は 5.2 とベースを共有するため、メモリフットプリントも配信形態もほぼそのまま引き継げるはずです。ポストトレーニングのみのリリースで唯一ありがたいのがこの点で、キャパシティ計画をやり直さずに済みます。

GLM 5.3 の料金は?

入力 $1.40、キャッシュ入力 $0.26、出力 $4.40(100万トークンあたり)。GLM 5.2 とまったく同じです。 開発者ドキュメントの価格表に GLM-5.3 の行が載り、5.2 とも 5.1 とも項目ごとに一致しています。

項目レート
入力$1.40 / 100万トークン
キャッシュ入力$0.26 / 100万トークン
キャッシュ保存無料、期間限定と表記
出力$4.40 / 100万トークン
GLM Coding Planポイント枠、入力・キャッシュ入力・出力を個別に計上
オフピーク割引標準ポイントの50%
ピーク時間帯平日 14:00〜18:00(UTC+8)

同額でのアップグレードは、価格の問いが自分で答えを出してくれる珍しいケースです。重みか thinking のオフが要るのでなければ、5.2 に留まるコスト上の理由はありません。しかも据え置きの単価は一点を隠しています。Z.ai 自身の数値では GLM 5.3 のほうがトークン効率が高いので、同じ作業なら請求は横ばいではなく下がるはずです。

実際に効くのはキャッシュの行です。$1.40 に対して $0.26 なので、繰り返すプレフィックスはコールドリードの19%で済み、キャンペーン中はキャッシュ書き込みが無料です。OpenRouter も $1.4 / $4.4、コンテキスト 1,048,576 と同じ条件で、サードパーティ経路が一次価格をそのまま通していることがわかります。エンドポイント表、移行順序、reasoning_effort 各段階の実測コストは GLM 5.3 API の料金とエンドポイントにまとめてあります。

GLM 5.3 のコンテキストウィンドウは?

1Mトークン、最大出力は文書化された128Kです。 Z.ai の GLM-5.3 モデルページが両方を掲載しており、智譜の中国語ドキュメントも同じ組み合わせを載せています。

ただし Z.ai 自身の評価はその上限いっぱいで走らせたわけではありません。モデルが実際にどこまで負荷をかけられたかを知るうえで有用な情報です。

ベンチマーク使用コンテキスト最大出力
Terminal Bench 3.0400K128K
Terminal Bench 2.1記載なし65,536
DeepSWE v1.1400K記載なし
Agents’ Last Exam (CLI)1M64K
SWE-Marathon、PostTrainBench1M128K
NL2Repo1M64K
HLE with tools300,000、コンテキスト管理戦略あり163,840

100万をフルに使うつもりだったなら、この差は見ておく価値があります。1M はモデルが受け付ける値であり、400K は Z.ai が自社の看板コーディングスイートに選んだ値です。最終的に 5.3 を配信するエンドポイントが独自にもっと低い上限を設ける可能性もあるので、実務ではプロバイダー側の数字を優先してください。

GLM 5.3 のコーディング性能はどれだけ上がった?

新しいエージェント系ベンチマークでは大きく、飽和した古いベンチマークではわずかです。 以下の数値はすべて Z.ai によるものです。Terminal Bench、SWE-Marathon、Agents’ Last Exam は Claude Code 2.1.207 ハーネスを reasoning effort 最大で使用し、DeepSWE は mini-swe-agent を使用しています。

ベンチマークGLM 5.3GLM 5.2Kimi K3Opus 4.8GPT-5.6 Sol
Terminal Bench 3.028.34.617.421.134.6
Terminal Bench 2.188.281.088.385.088.8
DeepSWE v1.166.946.267.558.072.7
SWE-Marathon v1.142.519.448.148.842.5
Agents’ Last Exam (CLI)28.523.827.625.728.6
GDPval-AA v217691508168215881730

重い仕事をしているのは Terminal Bench 3.0 の行です。4.6 から 28.3 へ、GLM 5.2 が事実上勝負にならなかったスイートでの跳ね上がりでした。全モデルが85から89の間にひしめく Terminal Bench 2.1 では、同じアップグレードが7ポイント分にしかならず、順位は一つも動きません。新しいベンチマークには変化を映す余地があり、古いものにはありません。

Z.ai が前面に出しているのはスコアではありません。High 設定の GLM 5.3 は自社 Code Bench で 31.4%、1タスクあたり約50Kの出力トークンを使います。Claude Opus 4.8 は 29.5% で120Kです。

自分で検証する価値があるのはこの主張です。実際に支払うのはトークン数だからです。Z.ai は Max 設定で約75Kトークンの 34.5% も報告しており、GLM 5.2 の 96Kトークンで 23.4% からの伸びとしています。この非公開ベンチマークでは Claude Fable 5 が 39.5% で依然トップ、Terminal Bench 3.0 の首位も GPT-5.6 Sol のままなので、正確な表現は「SOTA」ではなく「オープンソース SOTA」です。

表全体についてもう一点。これは非公開ベンチマークと、ベンダー自身が走らせた公開ベンチマークの組み合わせです。ここに載っている Kimi K3 と Claude Opus 4.8 の数値は、各ベンダーではなく Z.ai が測定したものです。

GLM 5.3 に移行するとコード変更は必要?

thinking を無効にしていたなら必要です。thinking.type: "disabled" は廃止され、Z.ai はリクエストがそのまま失敗すると述べています。

新しい取り決めは次のとおりです。

  • thinking.type は enabled のみ受け付ける
  • reasoning_effort は low、high、max を受け付け、既定値は max
  • コーディング用途では Z.ai が max を推奨
  • 移行の順序が重要。先に enabled と reasoning_effort: "low" を設定し、そのあとモデルIDを差し替える
{
  "model": "glm-5.3",
  "thinking": { "type": "enabled" },
  "reasoning_effort": "max"
}

disabled を失うコストは見積もりを誤りやすいので、2026年8月14日に GLM 5.2 を OpenAI 互換エンドポイント経由で実測しました。「Reply with the single word: ok」という最小のプロンプト1本、各構成につき3回です。

リクエスト構成出力トークン(3回)
既定(thinking 有効)144, 138, 90
reasoning_effort: "low"69, 86, 122
reasoning_effort: "max"101, 120, 102
thinking.type: "disabled"2, 2, 2

これほど短いプロンプトでは、thinking モード間のばらつきが low と max の差を飲み込んでしまうため、この3行から順序を読み取らないでください。意味があるのは最後の行です。thinking を切った場合は毎回2トークンで返答し、最も安い thinking 有効の設定でも69から122を消費しました。GLM 5.3 では、その最後の行が存在しません。

この表は GLM 5.2 のもので、そこから導かれる自明に見えた結論は外れました。2026年8月19日に GLM 5.3 で直接計測したところ、1語で答える分類プロンプトは reasoning_effort: "low" で出力トークンの中央値が 3(10回)、max では 105 でした。5.3 の下限は70トークンではなく、かつての disabled とほぼ同じ水準です。厄介なのは既定値が max であることで、パラメータを明示せずに移植すると105トークン版になります。この種のトラフィックの計算は GLM 5.2 と GPT-5.5 のコスト比較にまとめてあります。

GLM 5.3 が対応している機能は?

テキスト入出力に加えて、思考モード、ストリーミング、Function Calling、コンテキストキャッシュ、構造化出力です。 現在の Z.ai モデルページが挙げているのはこの5つです。

機能状況
入出力モダリティテキストのみ
思考モードlow、high、max。無効化は不可
ストリーミング出力対応
Function Calling対応
コンテキストキャッシュ対応
構造化出力対応、JSON を含む
MCP機能一覧から記載が消えている

MCP の行だけは動きがありました。8月15日のモデルページには機能一覧に MCP のリンクがありましたが、8月19日にはありません。削除の告知はないので、MCP 対応は「なくなった」ではなく「未確認」として扱い、自分のツールで試してから設計に組み込んでください。

それ以外は GLM 5.2 と比べて新しいものはなく、ポストトレーニングのみのリリースという説明と整合します。ビジョン、画像、音声は GLM-5V と GLM-Image の別ラインに残ります。

GLM 5.3 を使うには?

選択肢は4つ。Z.ai の従量API、GLM Coding Plan、ZCode、そして z-ai/glm-5.3 を掲載しているアグリゲーターです。

経路得られるもの制約
Z.ai モデルAPI$1.4 / $4.4 の従量課金、3プロトコルCoding Plan 購読歴のあるアカウントは1プロトコルに限定(後述)
GLM Coding Planポイント枠、オフピーク50%オフ購読制で従量課金ではない
ZCodeGoal モード、98%以上のキャッシュヒット率、2026-08-31 までの1.5倍枠Z.ai 自社クライアント
Claude Code / Cline / OpenCode既存ツールのまま新モデル従量キーではなくプラン枠を消費
アグリゲーターとゲートウェイ1つのキーで複数モデルモデルIDは各社で異なる。OpenRouter と ofox はいずれも z-ai/glm-5.3

実際のエンドポイントはリリース当日に予告されたものと違います。モデルページの現在の記載は、OpenAI Chat Completion プロトコルが https://api.z.ai/api/coding/paas/v4、OpenAI Response プロトコルが https://api.z.ai/api/v1、Anthropic Message プロトコルが https://api.z.ai/api/anthropic です。リリース当日の注記にあった open.bigmodel.cn/api/paas/v4 は最終形ではないので、そのまま写さないでください。さらに厄介なことに、同じページの Quick Start サンプルは /coding のない https://api.z.ai/api/paas/v4/chat/completions を叩いています。1つのページで記載が割れているので、片方が 404 を返したらキーを疑う前にもう片方を試してください。

見落としやすい制約がもう1つあります。GLM Coding Plan を購読したことのあるアカウントは、期限切れのものも含めて、現在モデルAPIへは OpenAI Chat Completion プロトコルからしかアクセスできません。

アグリゲーター経由なら、変更は2行です。

from openai import OpenAI

client = OpenAI(api_key="YOUR_KEY", base_url="https://api.ofox.ai/v1")

r = client.chat.completions.create(
    model="z-ai/glm-5.3",
    messages=[{"role": "user", "content": "Refactor this module and run the tests."}],
    reasoning_effort="low",   # 5.3 に "disabled" という選択肢はない
)
print(r.usage)

モデルIDの接頭辞は zai ではなく z-ai です。次のエラーが返る原因として一番多いのがここです。

{"error":{"message":"Model 'zai/glm-5.3' not found","type":"model_not_found","code":404}}

z-ai/glm-5.2 は同じエンドポイント・同じキーで応答するので、両者の切り替えは文字列1つの変更で済みます。キー設定の手順は GLM 5.2 API 接続ガイドで最初から通しています。

昨日出たばかりのモデルに、コーディングエージェントを向けるには?

エンドポイントを自分で設定できるツールなら、文字列を1つ変えるだけです。 ローンチ週の景色は毎回同じです。購読型プロダクトが初日にモデルを受け取り、従量APIは数日遅れ、ドキュメントページは告知の1日後、そして手元のツールはどれもモデル一覧をハードコードしています。GLM 5.3 は 2026年8月14日から8月19日にかけてこの流れをひと通り走り切り、重みだけが列の最後に残っています。

自分で制御できるのは、新モデルの配管をやり直すコストだけです。base_url とモデル文字列を指定できるツールなら、ローンチは1行の編集で済みます。固定のドロップダウンを持つツールでは、そのリリースサイクルを待つしかありません。告知の1時間後に r/opencodeCLI のスレッドが立ったのは、まさにこの理由です。

Claude Code、OpenCode をはじめ大半のツールは OpenAI 互換の HTTP を話すので、1つのベースURLの後ろに1つのキーを置けば、課金もフェイルオーバーもまとめて共通化できます。ofox では、その単一エンドポイントの後ろに約130モデルがあり、z-ai/glm-5.3 と z-ai/glm-5.2 はどちらも掲載済みです。両者の行き来は上のコードブロックだけで済み、それ以外は何も変わりません。

GLM 5.3 と GLM 5.2 は何が変わった?

変わったのはポストトレーニングと、対応が必要な3点です。thinking をオフにできない、重みがまだ落とせない、そして Terminal Bench 3.0 が 4.6 から 28.3 になった。

GLM 5.3GLM 5.2
ベースモデル同一同一
コンテキスト / 最大出力1M / 128K1M / 128K
公表トークン単価$1.40 / $0.26 / $4.40$1.40 / $0.26 / $4.40
従量API提供中提供中
アグリゲーター掲載あり、z-ai/glm-5.3あり、z-ai/glm-5.2
重み未公開公開済み、MIT
thinking オフ非対応対応
effort レベルlow / high / max、既定 maxeffort に加えて disabled
Terminal Bench 3.028.34.6

価格が同額で決着した以上、GLM 5.2 に留まる理由として本当に残るのは1つ、ダウンロードできる重みが要る場合です。もう1つの候補である「高頻度の短いリクエストのために thinking.type: "disabled" を残す」は、実測するとほぼ消えます。5.3 の low は分類プロンプトに出力トークン中央値3で答えました。それ以外はすべて 5.3 を指しており、キーもエンドポイントもリクエストの形も変わらないので GLM 5.2 API 接続ガイドはそのまま使えます。

参考情報源

よくある質問

GLM 5.3 の単体APIはもう使えますか?
使えます。Z.ai の価格表に GLM-5.3 の行が載り、入力 $1.4、キャッシュ入力 $0.26、出力 $4.4 と GLM 5.2 と同額です。OpenRouter や ofox を含むゲートウェイにも z-ai/glm-5.3 として掲載されています。GLM Coding Plan はポイント制の別経路として引き続き存在します。
GLM 5.3 の最大出力トークン数は?
128K、コンテキストウィンドウは1Mです。いずれも Z.ai のモデルページに明記されています。Z.ai 自身のベンチマーク実行はそれ以下に収まっており、Terminal Bench 3.0 と PostTrainBench が128K、Agents' Last Exam は64Kでした。実際に配信するエンドポイント側がさらに低い上限を設ける可能性もあります。
GLM 5.3 を Claude Code で使えますか?
使えます。Z.ai は GLM Coding Plan の対応ツールとして Claude Code、Cline、OpenCode を挙げており、自社のベンチマークも Claude Code 2.1.207 のハーネスで実行しています。thinking を無効にする指定はもう通らないので、reasoning_effort で調整してください。
GLM 5.3 と Kimi K3 はどちらが強い?
Z.ai の表では Terminal Bench 3.0 が 28.3 対 17.4、AutomationBench が 48.2 対 46.7 で GLM 5.3 が勝ち、Toolathlon 76.5 対 73.0、SWE-Marathon 48.1 対 42.5 では Kimi K3 が上です。これらの数値はすべて Z.ai がベンダーとして自ら測定したものなので、独立した検証結果ではなく主張として読んでください。
GLM 5.3 はベースモデルが変わった?
変わっていません。Z.ai は GLM 5.3 が GLM 5.2 と同じベースモデルを使い、すべての向上はポストトレーニングによるものだと明言しています。リリースノートの冒頭は「Scaling post-training is all we did for GLM-5.3.」という一文で始まります。
GLM 5.3 に無料枠はありますか?
無料枠はありません。従量課金は入力 $1.4 / 出力 $4.4(100万トークンあたり)です。安くする手段は2つで、キャッシュ入力の $0.26(キャッシュ書き込みは期間限定で無料)と、GLM Coding Plan のオフピーク割引です。平日 14:00〜18:00(UTC+8)のピークを外した呼び出しは標準ポイントの半分しか消費しません。
GLM 5.3 の重みはどこからダウンロードできますか?
今のところどこからも入手できません。リリースから5日経った時点でも HuggingFace の zai-org/GLM-5.3 は API 経由で 401 を返します(GLM 5.2 は 200)。Z.ai は安全性評価とハードニングが終わり次第、公開からおよそ2週間後に重みを出すとしており、8月末あたりが目安になります。