Qwen 3.8 Max 价格、上下文与接入方式(2026)

Qwen 3.8 Max 于 2026-08-03 正式发布:$2/$6 每百万 token,1M 上下文,131K 输出上限,开源权重下周放出。ofox 已上架 bailian/qwen3.8-max。

Qwen 3.8 Max 价格、上下文与接入方式(2026)

Qwen 3.8 Max 发布了。 阿里在 2026 年 8 月 3 日正式推出,距离预览版两周。这一版之后,所有数字都不再是传闻。

  • 发布时间:2026-08-03(预览版 2026-07-19 公布)
  • 价格:QwenCloud 上每百万输入 $2.00、输出 $6.00
  • 上下文:1M 窗口(最大输入 991K,最大输出 131K)
  • 规模:2.4 万亿参数,激活 950 亿
  • 开源权重:宣布下周放出,license 和确切日期都没给
  • 今天能用的路径:QwenCloud API、Qwen Studio、QwenWork
  • ofox 上架情况:已上架 bailian/qwen3.8-max,OpenAI 与 Anthropic 双协议

一只放在基座上的大木箱,箱盖被掀开几厘米,橙色的光从缝里透出来,由米色和炭灰色卡纸分层剪贴而成

摘要

  • 新旗舰比上一代便宜:$2/$6 对 Qwen 3.7 Max 的 $2.50/$7.50。
  • 最大输出翻倍到 131K token,1M 上下文窗口保持不变。
  • 阿里将首次开源 Max 级别模型的权重,同批还有 Qwen 3.8-27B,时间是「下周」(已宣布,未定日期)。
  • 官方 benchmark 表里,它在多数 agent 类项目上领先 Claude Opus 4.8,在 SWE-bench Pro 和 HLE 上落后 Fable 5。这是一张厂商自测表。
  • 表里没有 Kimi K3 这一列,而那恰好是多数人最想看的对比。
  • ofox 已经上架,模型 ID bailian/qwen3.8-max,OpenAI 与 Anthropic 两种协议都能调,所以不用等阿里开 Claude 形状的端点就能塞进 Claude Code。

Qwen 3.8 Max 是什么?

Qwen 3.8 Max 是阿里的闭源顶配模型,2.4 万亿参数的多模态系统,每 token 激活 950 亿参数。 它建在 Qwen 3.5 架构上而不是一套全新架构,阿里给它的定位是长周期自主工作,而不是单轮对话。

输入输出:

支持情况
输入模态文本、图片、视频(QwenCloud);ofox 上是文本和图片,未列视频
输出模态文本
API 能力Function calling、结构化输出、上下文缓存、前缀续写
速率限制(QwenCloud)2M tokens/分钟,15K 请求/分钟

发布博客的重心压在多天自主执行上。头号案例是一次无人值守的编码运行,在一个公开仓库里 16 天左右产出了 265 个 commit、127 个 PR 和 151 个 issue。这套能力能不能迁移到你自己的代码库,恰恰是发布博客回答不了的那件事。

Qwen 3.8 Max 什么时候发布的?

2026 年 8 月 3 日。 预览版在前,两个日期在报道里经常被混为一谈:

  • 2026-07-19:Qwen3.8-Max-Preview 在上海 WAIC 公布。只能通过阿里的 Token Plan 订阅、Qoder 和 QoderWork 访问。没有按量付费 API,没有 model card,没有 benchmark 表。
  • 2026-08-03:正式可用。QwenCloud API 开放,价格公布,完整 benchmark 表公布,开源权重时间宣布。

日期落在这两者之间的报道,其「未公布价格」「没有 benchmark」的说法现在都已过期,也包括那些引用「预览期按标价 10% 计费」的内容——那个折扣只适用于 Token Plan 预览窗口。

Qwen 3.8 Max 开源吗?

今天还没有。阿里说权重下周放,也就是 2026 年 8 月 10 日那一周。

实际宣布的内容:

  • Qwen 3.8 Max 的权重会放出,措辞是首次有 Qwen-Max 级别的模型开放权重
  • Qwen 3.8-27B 在同一批开放权重,这个才是多数人真跑得起来的那个。
  • 没有指明 license。没有确切日期。开源版本也没有 model card 或激活参数拆解。

在权重真正落地前,有三件事别当定论。厂商口中的「下周」是计划不是发货日。对商用来说 license 比时间更要紧——Qwen 的开源版本历来用 Apache 2.0(Qwen3-235B-A22B 在 Hugging Face 上现在仍标着 apache-2.0),但那是先例,不是对 Max 级别发布的承诺。再有,2.4T 总参数、950 亿激活的模型不是工作站自部署的量级,27B 才是硬件账算得过来的那个。

Qwen 3.8 Max 多少钱?

QwenCloud 上每百万输入 token $2.00、每百万输出 token $6.00(2026-08-03 快照)。 新旗舰比它替代的那一代便宜 20%。

Qwen 3.8 Max(QwenCloud)Qwen 3.7 Max(百炼新加坡)
输入 / 每百万$2.00$2.50
输出 / 每百万$6.00$7.50
隐式缓存读 / 每百万$0.25未单独列出
显式缓存写 / 每百万$2.50未单独列出
显式缓存读 / 每百万$0.17未单独列出

这张表有两处要说明。缓存那几行来自不同的价目表,不能直接横向比:ofox 的 Qwen 3.7 Max 页面标的是缓存读 $0.50/M、缓存写 $3.125/M,那是网关的报价而不是阿里的。另外核实当天百炼新加坡价目表上 3.7 Max 挂着限时五折,所以实际差距可能比标价对标价看起来更小。

这张表两边的价格都会动。要拿它建成本模型之前,先自己拉一次当前值。

上下文窗口和最大输出是多少?

总共 1M token,拆成最大输入 991K、最大输出 131K,另有单独的 262K 推理上限。

  • 上下文窗口:1M
  • 最大输入:991K
  • 最大输出:131K
  • 最大推理 token:262K

输出上限才是真正的变化。ofox 上 Qwen 3.7 Max 在同样的 1M 窗口下最大输出只有 64K,3.8 Max 把单次能吐出的量翻了一倍。这对阿里瞄准的那类负载很关键:一个能在 262K 推理 token 里做规划、却只有 64K 用来写产出物的模型,是一个会被截断的模型。

官方 benchmark 怎么说?

阿里在发布时给出了完整对比表,结果是互有胜负而不是横扫。 下面每个数字都是厂商自测。

节选几行,Qwen 3.8 Max 对第一梯队:

BenchmarkQwen 3.8 MaxOpus 4.8Fable 5GPT-5.6 Sol (max)Qwen 3.7 Max
Terminal Bench 2.186.684.684.688.874.5
SWE-bench Pro67.769.280.064.660.6
PaperBench93.080.388.890.564.8
GPQA Diamond92.692.092.694.192.4
HLE43.645.753.347.241.4
IFBench82.862.263.572.779.1
OSWorld-Verified86.183.485.083.273.3
MMMU-Pro82.375.681.283.079.0

按惯例打个折看。竞品的 Terminal Bench 分数是从 Artificial Analysis 和 OpenAI 自己的帖子里引来的,不是 Qwen 重跑的;SWE-bench Pro 那一行用的是 Claude Code harness、temp 1.0、top_p 0.95、256K 上下文,这套配置是 Qwen 自己选的。表里还有几行是 Qwen 自家的 benchmark(QwenSWEBench、QwenQoderBench、QwenReactBench),被测的正是与之同名的那个模型。

这张表的缺口比表里任何一个数字都响:没有 Kimi K3 这一列。 Moonshot 的开源权重旗舰在 Qwen 3.8 预览前几天才发布,也是大家问 Qwen 3.8 Max 时最常拿来比的那个。阿里选择对标的是三个西方闭源模型加上自家上一代。

怎么接入 Qwen 3.8 Max?

今天走 QwenCloud。 官方路径有三条,另有一条被广泛报道的第四条需要自己核:

  • QwenCloud API。模型 ID qwen3.8-max,开发者路径。key 在 home.qwencloud.com/api-keys 申请。
  • Qwen Studiochat.qwen.ai,对话界面。
  • QwenWork。面向非开发者的职场 agent 平台。
  • 阿里云百炼。SCMP 在 8 月 3 日报道全球 API 已开放。但核实当天百炼的英文模型列表和价目页仍然只到 qwen3.7-max,说明目录页滞后于公告,尽管底层端点是同一个。

最后这条值得展开,因为品牌名把它藏住了。QwenCloud 自己的开发者文档调用的 OpenAI 兼容端点是 https://dashscope-intl.aliyuncs.com/compatible-mode/v1,key 从 DASHSCOPE_API_KEY 读——和百炼用的是同一个 DashScope 国际站主机。QwenCloud 是建在那套基础设施上的前端,不是另一套 API。

调用是 OpenAI 形状的:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)

resp = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{"role": "user", "content": "总结这个仓库的测试策略。"}],
    max_tokens=4096,
)
print(resp.choices[0].message.content)

阿里没提供的那条路:Anthropic 协议

Qwen 官方只有 OpenAI 形状的 API,所以 Claude Code 调不了 qwen3.8-max Claude Code 说的是 Anthropic Messages 协议,而且不会退让。网关在发布当天就把这个缺口补上了。

bailian/qwen3.8-max 在发布同一天上架 ofox。2026-08-03 一次目录调用返回 123 个模型,新 ID 已在其中,模型页标的是输入 $2/M、输出 $6/M、缓存读 $0.25/M、缓存写 $2.50/M,上下文长度 1,131,072、单次补全上限 131,072。四条价格与 QwenCloud 官方标价一致。

有一点值得点出来,因为它差点把我们坑了。目录里的 supported_endpoints 字段只列了 /v1/chat/completions/v1/responses,读起来像是 Anthropic 这条路不通。实际是通的:2026-08-03 一次真实的 Messages 调用返回了格式完整的响应,stop_reason: end_turn在按这个字段做规划之前,先发一个真请求。

两行 shell 就能把它塞进 Claude Code:

export ANTHROPIC_BASE_URL=https://api.ofox.io/anthropic
export ANTHROPIC_MODEL=bailian/qwen3.8-max

或者沿用上面那段 Python,改两个参数:

client = OpenAI(
    api_key=os.getenv("OFOX_API_KEY"),
    base_url="https://api.ofox.io/v1",
)
resp = client.chat.completions.create(model="bailian/qwen3.8-max", ...)

两条路怎么选:

你要的是直接对接 QwenCloud走网关
最低的单价是,这就是标价这里与标价一致,但要逐个模型核
Qwen 独有新功能的第零日访问滞后,取决于网关多久跟上
Claude Code 等 Anthropic 协议工具今天做不到可以
一把 key 打通 Qwen、Claude、GPT、Gemini不行可以
某家限流时的自动故障转移自己搭内置

诚实的代价:网关多了一跳你控制不了的链路,而且它的价目表可能滞后于厂商的中途调价。看模型页,别看营销页——这句话对我们自己同样适用。

Qwen 3.8 Max 对比 Qwen 3.7 Max

更便宜、输出上限翻倍、agent 类 benchmark 大幅提升。

Qwen 3.8 MaxQwen 3.7 Max
发布时间2026-08-032026-05-19
参数2.4T(激活 95B)未公布
上下文 / 最大输出1M / 131K1M / 64K(ofox 标注)
输入 / 输出(每百万)$2.00 / $6.00$2.50 / $7.50
Terminal Bench 2.186.674.5
SWE-bench Pro67.760.6
ofox 上架是,bailian/qwen3.8-max是,bailian/qwen3.7-max

没有特别理由就选 3.8 Max。它更便宜、单次能写的量翻倍,而且两者用同一把 key 就能调,所以迁移只是换一个 model ID,不是重做一次接入。只有两种情况留在 3.7 Max:你为了可复现性锁了版本,或者你的评测集是按它校准的。价格差是 20% 不是一个数量级,光靠成本推不动这次迁移。想看更便宜的同系列,可以读 3.7 Plus 与 3.7 Max 的实测对比

这次发布重新抛出的跨厂商问题,可以看 Kimi K3 对比 GPT-5.5 与 Opus 4.8(开源权重那一侧)和 Kimi K3 接入指南。两者今天都在 ofox 上,K3 是 moonshotai/kimi-k3,这个是 bailian/qwen3.8-max,所以把它们放在一起比只是换个 model ID,不是一次采购决策。

常见问题

Qwen 3.8 Max 什么时候上市的? 2026 年 8 月 3 日,正式可用版本,价格和 benchmark 一并公布。预览版在 2026 年 7 月 19 日公布,仅限阿里的 Token Plan、Qoder 和 QoderWork。

Qwen 3.8 Max 免费吗? 不免费。QwenCloud 上按 token 计费,$2/$6 每百万。7 月的预览期据报道对 Token Plan 订阅用户按标价 10% 计费,那个窗口已经结束。

能下载 Qwen 3.8 Max 的权重吗? 还不能。阿里宣布开源权重在 2026 年 8 月 10 日那一周放出,没有 license 也没有确切日期。Qwen 3.8-27B 在同一批宣布里,是现实中真正能自部署的那个目标。

Qwen 3.8 Max 支持视觉吗? 图片支持,视频要打个问号。QwenCloud 模型页列的输入模态是文本、图片、视频,阿里的多模态表报告 MMMU-Pro 82.3、OSWorld-Verified 86.1。通过 ofox,2026-08-03 发出的一张图片被正确描述,prompt token 从 60 升到 90,说明图片输入是通的。但视频不在 ofox 的目录条目里,别默认它可用。

Qwen 3.8 Max 能配 Claude Code 用吗? 直接对接 QwenCloud 不行,因为 Claude Code 说的是 Anthropic Messages 协议而 QwenCloud 是 OpenAI 形状的。通过同时支持两种协议的网关,发布当天就能用,2026-08-03 已实测:把 ANTHROPIC_BASE_URL 指向 https://api.ofox.io/anthropic,设置 ANTHROPIC_MODEL=bailian/qwen3.8-max

Qwen 3.8 Max 和 Qwen 3.8-27B 有什么区别? Max 是 2.4T 的闭源旗舰,现在通过 API 可用。27B 是小得多的模型,在下周的开源权重批次里宣布。两者同代不同量级。

Qwen 3.8 Max 比 Kimi K3 强吗? 阿里没有公布这个对比,它的 benchmark 表里没有 K3 那一列。两者在可获得性上也不对等:K3 今天已有开源权重和广泛的网关支持,3.8 Max 还没有。

本次核实的来源

常见问题

Qwen 3.8 Max 什么时候发布的?
2026 年 8 月 3 日。阿里 Qwen 团队当天发布了《Qwen3.8-Max: A New Bar for Coding and Cowork》并同时开放了 QwenCloud 的 API。此前有一个预览版:Qwen3.8-Max-Preview 于 2026 年 7 月 19 日公布,只能通过阿里的 Token Plan 订阅、Qoder 和 QoderWork 访问。8 月 3 日这次是正式可用(GA),不是第一次露面。
Qwen 3.8 Max 开源吗?
还没有,但阿里说会开。发布博客写明这是 Qwen 首次开源 Max 级别模型的权重,时间是「下周」,也就是 2026 年 8 月 10 日那一周。Qwen3.8-27B 会在同一批放出。截至 8 月 3 日核实,阿里没有公布 license、确切日期,也没有任何一个的 model card,所以这个时间点属于「已宣布」而不是「已确认」。
Qwen 3.8 Max 多少钱?
QwenCloud 上是每百万输入 token $2.00、每百万输出 token $6.00(2026-08-03 快照)。缓存单独计价:隐式缓存读取 $0.25/M,显式缓存写入 $2.50/M,显式缓存读取 $0.17/M。这比上一代便宜:Qwen 3.7 Max 在阿里云百炼新加坡价目表上是输入 $2.50、输出 $7.50,新旗舰两边各降 20%。
Qwen 3.8 Max 的上下文窗口有多大?
总共 1M token,QwenCloud 模型页把它拆成最大输入 991K、最大输出 131K,另有单独的 262K 推理 token 上限。131K 这个输出上限才是重点:ofox 上 Qwen 3.7 Max 的最大输出只有 64K,新模型在同样 1M 窗口下把单次能写出的量翻了一倍。
怎么接入 Qwen 3.8 Max?
截至 2026-08-03 有三条官方路径:QwenCloud API、chat.qwen.ai 的 Qwen Studio 对话界面,以及面向非开发者的 QwenWork。API 是 OpenAI 兼容的,QwenCloud 的开发者文档指向 https://dashscope-intl.aliyuncs.com/compatible-mode/v1,用 DASHSCOPE_API_KEY,和阿里云百炼是同一个 DashScope 国际站主机。核实当天百炼的英文模型列表和价目页仍然只到 qwen3.7-max,说明目录页滞后于发布。
ofox 上架 Qwen 3.8 Max 了吗?
上了,模型 ID 是 bailian/qwen3.8-max,发布当天就在架。2026-08-03 实调 GET /v1/models 返回 123 个模型,新条目已在其中。ofox 模型页标的是输入 $2/M、输出 $6/M、缓存读 $0.25/M、缓存写 $2.50/M,上下文长度 1,131,072、单次补全上限 131,072,四条价格与 QwenCloud 官方标价完全一致。当天实测 OpenAI 协议和 Anthropic 协议都能通。和 Claude、GPT、Gemini 用同一把 key。
Qwen 3.8 Max 有多少参数?
总参数 2.4 万亿,每个 token 激活 950 亿,基于 Qwen 3.5 架构。激活量才是影响推理成本和速度的那个数:它意味着每个 token 只走过大约 4% 的总权重。这两个数字都是阿里在 8 月 3 日发布博客里给的,7 月预览时只公开了 2.4T 这个总数。
Qwen 3.8 Max 比 Claude Opus 4.8 或 GPT-5.6 强吗?
看任务,而且下面每个数字都出自阿里自己的表。Qwen 3.8 Max 在 PaperBench(93.0)、IFBench(82.8)、OSWorld-Verified(86.1)上领先;在 Terminal Bench 2.1(86.6,GPT-5.6 Sol max 是 88.8)、SWE-bench Pro(67.7,Fable 5 是 80.0)、HLE(43.6,Fable 5 是 53.3)上落后。厂商自测表的评测框架是自己挑的,把这些当成待核实的发布声明,不是已经定论的排名。