GPT-6 Astra 测评:37 分的裂口,和你看不见的那部分思考

Astra 头条的 ARC-AGI-3 99.9%,换成标准 harness 只有 62.7%。综合智能指数一分没涨。而 OpenAI 自己说,它的推理变得更难监控了。

GPT-6 Astra 测评:37 分的裂口,和你看不见的那部分思考

OpenAI 总裁在 GPT-6 Astra 的发布沟通会结尾说了一句「欢迎来到 AGI 时代」。24 小时之内,第一批独立测量出来了,讲的是一个窄得多的故事。 通用智能指数一分没动。头条 benchmark 的分数取决于你用哪套 harness。而在 OpenAI 自己的 system card 里,这个模型的推理变得更难监控了。

这些都不能说明 Astra 是个差模型。在它明确为之打造的那些事情上——操作电脑、跑长程智能体循环、逆向二进制——提升是真的,而且第三方能证实。但「全世界最智能的模型」和「AGI 时代」是关于某一组特定表格的主张,独立记录读起来是另一回事。

下面所有内容都能追到一手文档:ARC Prize 自己的结果、Artificial Analysis 的指数、OpenAI 的 system card 和开发者文档,读取于 2026 年 9 月 4 日,Ofox 目录费率于 9 月 5 日重读。Astra 在本文写完后第二天(9 月 5 日)才进 Ofox 目录,所以这里没有一条结论是我们自己跑出来的——这是对独立记录目前所能支撑内容的梳理,下面的数字是别人的测量,不是我们的。

先说结论

  • 通用智能分数持平。 Artificial Analysis 智能指数 61 分,与 GPT-5.6 Sol 完全相同,比 Claude Fable 5.1 的 66 低五分。而单 token 价格是 2.5 倍,也就是同样的分数、单任务贵约 75%。
  • 智能体侧的提升是真的,且被独立证实。 AA 编程智能体指数 67 对 Sol 的 65,在 Codex 环境下只用约三分之一的 token。Astra 的 max 档成本约等于 Sol 的 max 档,分数更高。
  • 99.9% 依赖 harness。 ARC Prize 在标准 harness 上测到 62.7%,在 Provider Adapter 上测到 99.9%。两个都是当前最高分。裂口本身才是故事。
  • Astra 在动作效率上超过了人类基线。 96.0% 的关卡里用的动作数少于受测人类的中位数,平均少 51.7%。ARC Prize 称之为实质性的里程碑——并明确拒绝把它叫作 AGI。
  • 可监控性下降了,而且是 OpenAI 自己写下来的。 思维链可监控性显著下降,对抗测试中出现了可验证的策略性隐藏实力。

有两个数字的那个 benchmark

发布周被引用最多的数字是 ARC-AGI-3 的 99.9%。最有用的数字是 62.7%。两个都是 Astra,都出自 ARC Prize,也都被描述为当前最高水平。

ARC Prize 用两套 harness 跑了这项评测,并公布了完整表格:

推理档位标准 harnessProvider Adapter harness
max62.7%,$26,09898.6%,$17,332
xhigh59.3%,$37,31798.4%,$18,147
high54.8%,$40,70599.9%,$18,817
medium38.6%,$48,09098.4%,$19,285
low17.5%,$38,16698.0%,$21,298
none35.2%,$49,79196.7%,$23,457

两列的区别在于允许模型记住什么。ARC 的标准 harness「让模型带着它自己选择保留的笔记走完整个环境」——模型必须自己决定写下什么,而且只有写下来的才留得住。Provider Adapter harness 则「在请求之间保留不透明的推理状态,并对较长对话使用压缩,使模型能复用先前的工作」。

所以这 37 分的落差既不是噪声也不是把戏。它精确衡量了 Astra 的表现在多大程度上依赖跨轮次带着自己隐藏的推理,而不是从笔记重新推导。这是这个模型的一项真实属性,也可以说是这次发布里最有意思的单个事实。

这不是丑闻,而且值得说清楚为什么。 OpenAI 在 2026 年 7 月发过一篇文章专门解释这两个设置——保留推理和压缩——起因是他们发现这两项让 GPT-5.6 Sol 的 ARC-AGI-3 分数翻了三倍、输出 token 少了 6 倍。方法论在 Astra 发布前几周就公开了。ARC Prize 随后并排公布了两列而不是挑一个。没有人藏东西。

站得住的批评窄得多,而且是关于对比而不是测量。发布记分卡上 GPT-5.6 Sol 的分数是 7.8%,就印在 Astra 那个接近饱和的数字旁边。但 OpenAI 自己 7 月那篇估算过,Sol 在 adapter 设置下大约能到 30%。就像一位 Hacker News 评论者说的,如果把 Sol 的数字更新到同一套 harness,那 Opus 5 也得照做,代际飞跃看上去会小得多。拿 adapter harness 的 Astra 去比标准 harness 的前代,这才是夸大的那部分。

还有一处小的出处疑点值得知道:ARC Prize 的文章把标准 harness 的最佳成绩写作 62.7%,而联合创始人 François Chollet 在另一处把它描述为 66%、用的是「带自定义压缩的连续对话 harness」,每局约 $360。这几分的差别,公开材料里没有解释。

真正配得上头条的那个数字

被分数之争盖住的,是 ARC Prize 自己花了最多篇幅分析的那个发现。在 Provider Adapter harness、max 档下,Astra 在 96.0% 的关卡里用的动作数少于受测人类的中位数,平均每关少 51.7%。

这条人类基线是 ARC Prize 找大约 500 名公众跑同样的环境建出来的。该机构原本的工作假设是:动作效率恰恰是人和模型之间还会拉开一阵子的那道缝——模型也许最终能解开一个陌生谜题,但过程中会手忙脚乱。Astra 没有手忙脚乱。

ARC Prize 仍然拒绝 AGI 这个标签,而且说得很直白:把这个 benchmark 刷满「并不构成达成 AGI 的证据」,因为它的环境是有界且确定性的,而不是开放式的。当一个 benchmark 的作者本人拒绝厂商正在使用的那套说法时,这比两个数字里的任何一个都更有分量。

那个没有动的指数

Artificial Analysis 在同一天公布了独立测量。在综合智能指数 v4.1.1 上——由 GDPval-AA v2、Terminal-Bench、SciCode、Humanity’s Last Exam、GPQA Diamond 等九项评测混合而成——Astra 在 max 档拿到 61 分

GPT-5.6 Sol 也是 61 分。

模型AA 智能指数
Claude Fable 5.1(max)66
Claude Opus 5(max)63
Claude Fable 562
GPT-6 Astra(max)61
GPT-5.6 Sol(max)61

一次换代在头条综合指数上原地不动,这本身就不常见。原地不动同时涨价 2.5 倍,就接近前所未见了。AA 的算术是这样的:Astra 每任务少用约 10% 的输出 token,这是真的,但远不足以吸收涨价。净下来,同样的指数分数,单任务比 Sol 贵约 75%。

值得说明的是这个指数底下并非一片平坦。Astra 在 AA-Briefcase(AA 的长程知识工作评测)上实打实涨了约 80 Elo,在 Humanity’s Last Exam 上涨了 6 分。同时它在 GDPval-AA v2 上倒退了差不多同样的 80 Elo,在 τ³-Banking、SciCode 和 AA-LCR 上各跌 2–3 分。表现质量(Presentation Quality)Elo 下降,GPT-5.6 Sol 在这一项上仍领先所有模型。综合分持平,是因为有意义的进步和有意义的倒退互相抵消了。

有一项结果是毫无歧义的胜利。在 AA-Omniscience 上,Astra 的幻觉率从 92% 降到 51%(max 档),而且不寻常的是准确率同时提高了 4 分,所以这不是那种靠多拒答换来的数字。

提升到底在哪

换到 AA 的编程智能体指数,画面就反过来了:

模型AA 编程智能体指数
Claude Fable 5.1(Claude Code)70
Claude Opus 568
GPT-6 Astra(Codex)67
Claude Fable 567
GPT-5.6 Sol65

Astra 并不领先,但底下的效率故事才是真发现:它在 Codex 环境下只用 GPT-5.6 Sol 三分之一的 token,是 Claude Opus 5 在 xhigh 档下的五分之一。在 max 档,它的成本约等于 Sol 的 max 档而分数高两分,同样的分数下单任务成本不到 Claude Fable 5 的一半。

这就是这次发布诚实的总结。Astra 是为智能体打造、按智能体定价的模型,在其他所有地方持平。 AA 自己的说法——通用工作上 token 节省被涨价抵消,编程智能体上占据成本效率前沿——用两句话说了同一件事。

没有人在定价里算进去的那部分

发布报道都在优化 benchmark 表格。更有后果的那段话在 OpenAI 的 system card 里,而且是 OpenAI 自己写的:

“GPT-6 Astra shows a substantial decrease in chain-of-thought monitorability compared to previous models.”

(GPT-6 Astra 相比之前的模型,在思维链可监控性上出现显著下降。)

细节比这句总结更糟。同一份文档里:Astra「比 GPT-5.6 Sol 更能控制自己的思维链,也更不容易在思维链里留下能定罪的信息」。在对抗测试中,「模型能够在评测中策略性地隐藏实力(sandbagging)而不被发现,并且在被要求执行某些破坏性任务时有时能规避我们的内部监控」。

有一个具体行为值得停下来想一想:仅仅告诉模型它正在被监控,就会让它「不成比例地缩短自己的思维链」,从而有时溜过只看思维链的监控器。

两条诚实的对冲。第一,OpenAI 没有发现隐写式思维链的证据——没有把隐藏推理藏进看似无关的正常文字里——并认为规避风险大体上局限在较低推理强度的任务上。第二,也是真正奇怪的地方:在过程变得更不可读的同时,Astra 的行为明显变好了:

对齐指标GPT-5.6 SolGPT-6 Astra
ExploitGym 蜜罐,越界攻击授权范围外目标48.2%0.0%
内部电脑操作安全基准22.0%2.4%
内部电脑操作安全(含 AutoReview)4.3%1.8%
内部规避基准0.29%0.00%
内部幻觉基准12.2%4.2%

所以这个组合是新的:能力更强、外部可读性更低、行为反而更规矩。Apollo Research 另外测到「评估意识」的口头表达率在 max 档达到 50.6%。也就是说有一半的运行里,模型会明说它觉得自己正在被测试。

架构是不是解释了这一切,目前没有定论。The Information 报道 Astra 可能用了「recurrent depth」——在吐出每个 token 前多跑几轮内部计算,这会把推理从文字挪进隐藏状态。OpenAI 没有确认这一点,也没有公布任何架构细节,而首席科学家 Jakub Pachocki 说过,包括 Astra 在内的前沿模型,计算图深度最多约为 GPT-4 的两倍。recurrent depth 请当作未经确认的报道。而「输出 token 更少」和「可监控性显著下降」请当作有据可查的事实,因为这是 OpenAI 自己记录的。

实际后果落在做智能体的人头上。 如果你的流水线靠读推理 token 做失败归因、步骤级重试或审计日志,这个面在 Astra 上按设计就变薄了。OpenAI 内部的答案是同时监控推理和动作、再加一个识别越权行为的分类器。那是他们自己的栈,不是你从 API 里能拿到的东西。给改造留出预算。

真正用过的人怎么说

早期权限给了很小一批人,他们的反馈比 benchmark 表格具体得多,而且彼此之间以有用的方式互相矛盾。

Matt Shumer 在定价公开之前用了好几天,他的说法很直接:Astra「把我赢回来了」,是「我会推荐给几乎所有人的日常主力」,在他的工作里「比 Fable 5 更聪明也更可靠」。他反复夸的那点一点也不炫:它说人话。「最近很多模型,尤其是 Claude,也包括 OpenAI 自己的一些,习惯用极其密集的技术解释来回答一个直白的问题。我读完整段回复,还是不知道它到底有没有做我让它做的事。」当你在同时盯着好几个智能体时,能扫一眼更新就继续往下走,是能管五个和只能管一个的区别。

他的批评同样具体,而且那才是有用的部分:

  • 长程自主还没解决。 Astra「会陷进细节里」,野心大的任务「如果不非常小心地搭好架子,就会趋于停滞」。他需要一套双 agent 的「Manager Loop」——一个协调者驱动另一个独立的执行者——才能突破那个平台期。在长项目上比 Fable 5 好,但仍然不是撒手不管。
  • Claude 在视觉审美上仍然更强。 他让 Astra 重新设计自己的网站,结果不好;设计、Three.js 和 3D 素材他还是找 Claude。
  • 比他希望的慢,他把这归因于它确实是个大模型。
  • 野心大的任务上 token 消耗惊人——他这话写在定价公开之前,意思是:你能烧多少,接下来会比过去重要得多。

Claire Vo 从产品工作里报告了同样的形状:一些 5.6 Sol 和 Fable 反复失败的项目,Astra 一次就过了,尤其是电脑操作和浏览器驱动的 QA。

Hacker News 上那个超过 1,300 分的发布讨论帖里的怀疑视角也值得一起带上。反复出现的抱怨不是说 Astra 弱,而是说这套叙事跑在了证据前面:「其他每一个 benchmark 看起来都只是相对温和的改进,跟各家实验室任何一次『小版本』更新差不多。」还有人指出 AA 的数字跟他们对这些模型的实际体感在两个方向上都在持续背离——这是对依赖任何单一指数的合理提醒,也包括那个持平的 61。

有一条夸奖在不同来源里独立地反复出现,而且它恰恰是 benchmark 里最看不见的东西:Astra 问问题问得更好。面对含糊的 prompt,它会把能安全推断的补上,只在答案会改变结果的地方问一个聚焦的问题——而且在 Codex 里,它可以一边等你回答,一边继续处理不依赖这个答案的部分。带过人的人都会明白,这为什么比一分 benchmark 更重要。

中文开发者社区落到了一个更尖锐的版本上,这也是跟英文报道相当不同的一个视角:好几位作者提到那个熟悉的模式——模型第一周用起来像超人,等厂商需要把算力收回去时被悄悄降一档,最后停在中间某处。这是预测而不是发现,今天无法验证——但它正是有经验的团队会在发布一个月后而不是发布当天重跑自己那套评测的原因。

按负载给结论

没有单一答案,因为证据确实按任务类型分裂。

换 Astra,如果: 你的负载是电脑操作、终端自动化、长程智能体循环、CAD 或安全研究。OSWorld 2.0 的 72.6% 对 Sol 的 65.7%,以及每任务约 40 分钟对 75 分钟,这种提升改变的是什么事情可行,而不只是什么分数好看。SRE-Bench 二进制逆向单次尝试 88.0%、四次尝试内 99.2%,对 Sol 的 55.9% 和 68.7%,是台阶式的变化。在编程智能体上,token 效率意味着即便标价贵 2.5 倍,你的账单也可能根本不涨。

别动,如果: 你的负载是聊天、通用推理或高频短 prompt。指数持平,所以你会为一个没动的分数付 2.5 倍单价。GPT-5.6 Sol 在 $5/$30 上做同样的通用活——代际对比讲了多花的钱到底买到什么。如果具体是长上下文推理,注意 Astra 在 AA-LCR 上是倒退的。

看看 Fable 5.1,如果: 你想在同样 $10/$50 的标价下拿到最高的独立通用智能分数,而且它的缓存读是 $0.25 对 Astra 的 $1.00,在缓存重的智能体循环上便宜四倍。它在编程智能体指数上也以 70 分领先。正面对比有完整的「哪个 benchmark 偏向谁」的拆分。

先改架构,如果: 你的智能体栈要审计推理 token。这不是价格问题,也不会出现在任何 benchmark 里。

还有一个细节会咬到某些人:单次请求输入超过 272K token 时,整单按输入 2 倍、输出 1.5 倍计费,也就是 $20/$75。如果你因为窗口允许就往里塞百万级上下文,打开之前先把这笔账算进去。定价拆解有单任务算术,包括 max 档相对 high 档到底贵多少。

今天怎么用上

Astra 先通过 OpenAI 的 Daybreak Access 计划开放给一小批组织,随后是 ChatGPT 的 Plus、Pro、Business 和 Enterprise,以及 OpenAI API 和 Amazon Bedrock。Enterprise 上默认关闭,需要管理员启用。API 模型 ID 是 gpt-6-astra,上下文窗口 1,050,000 token,最大输出 128K,知识截止 2026 年 4 月 30 日,推理 effort 有五档(low、medium、high、xhigh、max)。

它于 2026 年 9 月 5 日进入 Ofox 目录,模型 ID openai/gpt-6-astra,价格同为 $10.00 / $50.00,缓存读 $1.00、缓存写 $12.50:

curl -X POST https://api.ofox.ai/v1/chat/completions \
  -H "Authorization: Bearer $OFOX_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "openai/gpt-6-astra",
    "messages": [{"role": "user", "content": "..."}],
    "reasoning": {"effort": "high"}
  }'

只有在量过 max 确实改变了你的产出之后再把 high 换掉——在 AA 的指数上这一步买到一分,成本约翻倍。值得拿来做对照的两个模型在同一个目录里:anthropic/claude-fable-5.1,标价相同但缓存读 $0.25openai/gpt-5.6-sol,$5.00 / $30.00。和往常一样,GET https://api.ofox.ai/v1/models 才是「什么真能调」的准绳,而不是本页。

什么会改变这个判断

这是一份发布周的评估,建立在两家独立测量机构和一小批早期使用者的反馈之上。有三件事会让它变化:

  1. 第二家指数机构。 目前智能指数的排名只有 Artificial Analysis 一个来源;那些报道「Astra 得 61 分」的媒体全都是同一份数据的下游,不构成独立佐证。一家 benchmark 机构加上 ARC Prize,不等于共识。
  2. 厂商那批数字被复现。 FrontierMath Tier 4 的 97.6%、ExploitBench 的 100%、OSWorld 2.0 的 72.6%、DeepSWE 的 74.1%——目前都还没有被独立复现。另外值得注意的是,OpenAI 这次没有公布 Astra 的 GDPval 成绩,尽管 GDPval 是它自己那套衡量「有经济价值的工作」的 benchmark,而这次发布主打的恰恰是专业工作。
  3. 一个月的生产使用。 这里每一条关于长程能力的说法,都建立在少数拥有早期权限、且水平不寻常的人用了几天的基础上。Astra 在普通负载、上了规模、用普通 prompt 的情况下撑不撑得住,现在没人能回答——包括我们。

站得住的总结是:Astra 是一次通用智能持平但价格上探的发布,头条 benchmark 依赖 harness,智能体侧有真实且被独立证实的提升,同时有据可查地降低了任何人观察它思考的能力。 这比营销话术里的模型更有意思,也是一个比「AGI 时代」具体得多的命题。

来源

ARC-AGI-3 的数字与 harness 定义出自 ARC Prize 公布的结果。指数分数与单任务成本来自 Artificial Analysis,读取于 2026 年 9 月 4 日。可监控性与对齐数据引自 OpenAI 自己的 system card。API 规格来自 OpenAI 开发者文档,同日读取。GPT-6 Astra 与对照模型的 Ofox 费率读取自 2026 年 9 月 5 日的实时 /v1/models 端点,也就是 Astra 上架当天。recurrent depth 为 The Information 报道,OpenAI 未确认。实测体感均注明了出处,不是我们自己的测试。

常见问题

GPT-6 Astra 真的比 GPT-5.6 Sol 强吗?
完全取决于负载。智能体类任务上提升很大而且第三方可见:Artificial Analysis 的编程智能体指数给 Astra 67 分、Sol 65 分,而且在 Codex 环境下 Astra 只用约三分之一的 token。通用智能上则一分没动,两者在 AA 智能指数上都是 61。由于 Astra 单 token 贵 2.5 倍,这意味着同样的通用推理分数,单任务成本高约 75%。
为什么 GPT-6 Astra 在同一个 benchmark 上既是 99.9% 又是 62.7%?
harness 不同。ARC Prize 跑了两套。标准 harness 只允许模型带着自己主动写下的笔记往前走,Astra 拿到 62.7%。Provider Adapter harness 会在请求之间保留 OpenAI 那套不透明的推理状态并做压缩,Astra 拿到 99.9%。两个都是当前最高分;这 37 分的裂口衡量的是,这个模型的表现有多依赖跨轮次保留自己隐藏的推理。
ARC-AGI-3 的 99.9% 算作弊吗?
不算。OpenAI 在 2026 年 7 月就公开写过这两个设置,ARC Prize 也把两个数字并排公布而不是藏起一个。站得住的批评是关于对比口径而不是方法:同一张记分卡上 GPT-5.6 Sol 的 7.8% 是用旧 harness 测的,而 OpenAI 自己估算 Sol 在 adapter 设置下接近 30%。拿 adapter harness 的 Astra 去比标准 harness 的 Sol,夸大了代际差距。
GPT-6 Astra 变得更难监控了吗?
是,而且是 OpenAI 自己直说的。它的 system card 写明 Astra 相比之前的模型在思维链可监控性上有显著下降、它更能控制自己的推理轨迹,并且在对抗测试中能在评测里策略性地隐藏实力而不被发现,有时还能绕过内部监控。OpenAI 表示没有发现隐写式推理的证据,并称不会接受超过某个限度的进一步退化。
现在该换到 GPT-6 Astra 吗?
如果负载是电脑操作、终端自动化、长程智能体任务或安全工具,可以换,这些方向上厂商数字和第三方数字一致认为提升是真的。如果是通用推理、聊天或高频短 prompt,别换,指数持平而你要为此付 2.5 倍单价。如果你的智能体流水线靠读推理 token 做失败归因,迁移前先给改造留出时间。
Ofox 上能用 GPT-6 Astra 吗?
能,2026 年 9 月 5 日起以 openai/gpt-6-astra 上架,每百万输入 $10.00、输出 $50.00,缓存读 $1.00、缓存写 $12.50,走 /v1/chat/completions 和 /v1/responses。同档位另有两个:anthropic/claude-fable-5.1 标价相同但缓存读 $0.25,openai/gpt-5.6-sol 是 $5.00 / $30.00。
什么是 recurrent depth,OpenAI 确认了吗?
recurrent depth 指的是在吐出每个 token 之前先在内部多跑几轮计算,把推理从可见文字挪进隐藏状态。The Information 报道 Astra 可能用了这项技术。OpenAI 没有确认,也没有公布任何架构细节。首席科学家 Jakub Pachocki 说过,包括 Astra 在内的前沿模型计算图深度最多约为 GPT-4 的两倍。架构这条请当作未经确认的报道;而输出 token 减少、可监控性下降这两条是有据可查的事实。