Claude Code 报 429 限流怎么办?成因 + 6 种解决方法(2026)

用 API key 跑 Claude Code 报 429?多半是触了每分钟的 RPM/ITPM/OTPM 上限。教你读 retry-after、加退避重试、用缓存压低 ITPM,附按 Tier 分档的 6 个修法。

claude-codetroubleshooting

Claude Code 用量消耗太快?成因排查 + 7 招省 token(2026)

付费套餐刚到中午就提示用量超限?多半是默认跑 Opus、子代理并行烧 token、MCP 吃掉三分之一上下文。教你用 /usage 和 /context 定位元凶,给出 7 招。

claude-codecost-optimization

Slack 配置 Claude Tag:4 步上手、ambient 模式、8 月 3 日迁移截止(2026)

Claude Tag 是 Slack 里跑 Opus 4.8 的共享 @Claude 队友。4 步上手、ambient 模式、管理员权限,以及 2026-08-03 从 Claude in Slack 迁移的截止时间。

claudetutorial

在本地跑 GLM 5.2(2026):2-bit 塞进 256GB Mac,或一台 4090 主机

本地跑 GLM 5.2(753B):2-bit 量化能塞进 256GB Mac Studio,4-bit 要 512GB,速度 ~3-9 tok/s。附 llama.cpp、LM Studio 和 4090 主机的 GGUF 量化档选型。

glmopen-weights

一个 API 路由 GLM-5.2、DeepSeek V4、MiniMax M3 和 Kimi K2.6(2026)

一把 ofox key 路由 4 个模型:blended 单价从 $0.19/M(V4 Flash)到 $2.40/M(GLM-5.2),差 12.86x。1M context、V4 cache 免费。

model-comparisoncost-optimization

GLM-5.2 vs GPT-5.5 成本实算:每天 1 万/10 万/100 万次请求的账单差距(2026)

GLM-5.2 与 GPT-5.5 的 blended 单价是 $2.40 对 $13.33,差 5.56 倍。算清不同请求量下的账单、cache 的影响,以及换一个字符串就能 A/B 的做法。

glmopenai

2026 自托管 GLM 5.2 实战:硬件选型、vLLM 部署与成本对照

在 8x H200 上跑 GLM 5.2 FP8、4x H100 跑 Q4 GGUF、Mac Studio 跑 2-bit。硬件账、云 GPU 时租、Z.ai 月付三方对照,附 4 个 day-one 推理引擎。

glmopen-weights

Codex 周限额一天清零:5 种应对方案与按量计费 API 配置(2026)

Codex 周限额一天从 96% 掉到 0%(2026 年 5 月 17 日事件)?5 种解法:储蓄式重置(6 月 12 日上线)、邀请返利、API 直连、预付封顶、降配。

codexopenai

Codex 周限额耗尽怎么办:7 种修复方案、限额机制和替代 API(2026)

Codex 的重置时间是服务端下发的 resetsAt 时间戳,不是时钟规则。本文给出自己读出这个数的方法、兑换 reset credit 的机制,以及 7 种把活继续干下去的解法。

codex-clirate-limits

ofox 上配置 DeepSeek V3.2 提示词缓存:10 分钟接入,账单直降 80%(2026)

DeepSeek V3.2 缓存读 $0.06/M、未命中 $0.29/M(便宜 4.8 倍),输出 $0.43/M,128K 上下文。在 ofox 上 10 分钟完成接入,靠稳定前缀让团队账单立省 80%。

deepseekapi-access