返回博客

GPT-6 Astra 有多强?99.9% ARC-AGI-3、百万上下文与电脑操作

99.9% 很抢眼,真正会改变工作方式的却不止一张榜单:电脑操作更快、长任务能跨窗口记笔记、API 可以半路转向,105 万上下文也开始有实用意义。

Astra 已经不是代号,而是 GPT-6

OpenAI 于 2026 年 9 月 3 日正式发布 GPT-6 Astra。发布后,Astra 有了完整产品身份:ChatGPT 版本、Pro 版本、API 模型 ID、定价、上下文规格和安全说明都已公开。

标准版将在未来几天内分批开放给 ChatGPT Plus、Pro、Business、Enterprise 用户,并进入 API 和 AWS。分批开放意味着不是所有付费账号同时出现入口;GPT-6 Astra Pro 只面向 Pro、Business 和 Enterprise,免费版不在这次公告名单中。

抽象插画:多组数学与理论计算机科学结构围绕发光的 Astra 核心
多组数学与理论计算机科学结构围绕发光的 Astra 核心,象征模型从解题工具走向可执行、可验证的研究伙伴。图:PlusGO。

先看成绩:99.9% 到底有多夸张?

GPT-6 Astra 在 ARC-AGI-3 得到 99.9%,而 GPT-5.6 Sol 是 7.8%。FrontierMath Tier 4 v2 从 83.0% 提高到 97.6%,Terminal-Bench 4.0 从 37.3% 提高到 57.9%,OSWorld 2.0 从 65.7% 提高到 72.6%。

能力方向 代表评测 Astra 解读
抽象泛化ARC-AGI-399.9%陌生规则任务出现代际跃升
数学FrontierMath Tier 4 v297.6%高难推理接近评测上限
软件工程Terminal-Bench 4.057.9%终端任务仍有不小失败空间
电脑操作OSWorld 2.072.6%成功率和完成速度同时提高
自动化AutomationBench41.4%较上一代 18.1% 明显提升
网络安全ExploitBench100%能力提高也带来更严访问控制

不是所有 Benchmark 都第一。官方表格里仍有个别项目由其他外部模型领先;成绩也多采用最高推理强度与研究设置。把“多项大幅领先”写成“全面碾压”,反而会让最有价值的进步显得不可信。

105 万上下文:长到能用,成本也会变

GPT-6 Astra 的 API 上下文窗口是 1,050,000 token,最大输出 128,000 token,知识截止日期为 2026 年 4 月 30 日。在 MRCR 评测中,它在 256K–512K 区间达到 100%,512K–1M 区间为 96.3%。

这意味着超长代码仓、跨年资料和大批合同更有机会一次装入并找回细节,但“能装下”不等于“都该装进去”。超过 272K 输入 token 后,整次请求的输入与缓存按 2 倍、输出按 1.5 倍计费。更好的做法仍是先去重、分层、索引,再把真正相关的材料交给模型。

电脑操作:不只会点,还要更快做完

OSWorld 2.0 的 72.6% 只讲成功率。OpenAI 同时给出的效率信息更有用:Astra 达到更高成绩时,耗时约少 47%;在 Codex harness 的 Mind2Web 任务中,完成速度约为当前 GPT-5.6 Sol 体验的 1.9 倍。

对用户来说,变化不是“AI 会不会操作网页”,而是它能否在多页面、表格、文件和系统之间持续推进,少卡在半路。72.6% 也提醒我们,涉及付款、删除、发送或权限变更的动作仍要人工确认。

Codex 长任务:换上下文后不必重新开会

OpenAI 为 Astra 设计了跨上下文窗口的笔记:模型会留下工作摘要,较早窗口也能被搜索。项目跑得很长时,它可以保留决策、未完成项和关键证据,而不是每次压缩上下文都重新认识代码库。

这项能力目前仍是实验性功能,OpenAI 计划在未来几周逐步设为 Astra 的默认行为。它能减少遗忘,不会替代测试、代码 review 或明确的验收标准。

API 新能力:任务跑起来以后还能改方向

GPT-6 Astra 的开发者指南加入三项适合长流程的能力:

  • async tool calling:工具可以异步执行,模型不必每次都原地等待。
  • mid-turn steering:通过 WebSocket 在一次长响应尚未结束时补充信息或调整方向。
  • configuration_update:保留提示缓存的同时改变 reasoning effort,复杂处加大推理,简单处降低成本。

这些能力更适合 Responses API。Astra 支持 low、medium、high、xhigh、max 推理强度,不支持 none 或 minimal。对生产系统来说,仍需把工具权限、幂等、超时和人工确认做在模型之外。

数学与科学:从答题走向新结果

Astra 的研究轨迹比正式发布更早。8 月公开的 10 项结果覆盖高维球堆积、二进制码、非 sofic 群、算术电路、量子并行重复、后量子密码相关格问题与 Ramsey 数等方向,并附带论文、推理说明和 Lean certificate。

正式发布页又给出两项素数间隔结果:一项把已知上界从 240 改进到 186,另一项改进了大间隔相关界。它们是否成为长期公认成果,要靠领域专家复核;但“产生可检查的新证明”与“在有标准答案的数据集上拿高分”确实是两种不同能力。

Critical 级网络安全能力:更强,也更受控

GPT-6 Astra 以 Critical 级网络安全能力部署。ExploitBench 100%、ExploitGym 42.4%、SRE-Bench 88.0% 展示了它在漏洞利用、复杂攻击环境和可靠性工程中的进步,也解释了为什么限制更严。

OpenAI 会加强网络安全请求监控、拒绝高级攻击能力,并扩大 Daybreak Blue 的防御研究访问。正常安全任务也可能被暂停、要求确认或直接停止。对防御团队来说,提前把授权范围、目标所有权和审计材料准备好,会比反复试探边界更有效。

Hugging Face 事件:别再张冠李戴

Astra 没有参与 Hugging Face 事件。OpenAI 的完整调查称,主要责任模型是不会公开发布的 Internal Model 1(IM1),规模与 GPT-5.6 Sol 相当。GPT-5.6 Sol 的部分 agent 后来复现过利用并复制少量私有评测数据,但 Astra 与那次事件没有直接关系。

这一点仍值得保留,因为发布后很容易有人把旧标题里的“下一代模型”自动替换成 GPT-6 Astra。官方调查没有支持这种改写。

开放范围与 API 价格

入口开放范围 / 价格注意事项
ChatGPT 标准版Plus、Pro、Business、Enterprise未来几天内分批开放
ChatGPT Pro 版Pro、Business、EnterpriseEnterprise 默认需管理员启用
API 标准输入10 美元 / 百万 token超过 272K 输入触发长上下文倍率
API 缓存输入1 美元 / 百万 token缓存写入另计 12.50 美元 / 百万 token
API 标准输出50 美元 / 百万 tokenBatch / Flex 半价,Fast 2 倍价

ChatGPT 订阅内的 Astra 使用计入现有额度,OpenAI 也提供额外 credits 购买选项;具体剩余额度和重置时间以账号 Usage 页面为准。

谁最值得第一时间试?

  • 需要跨网页、表格和桌面软件跑完整流程的人。
  • 经常让 Codex 承接跨天、跨窗口工程任务的开发者。
  • 要读几十万 token 代码或资料,并能承担长上下文成本的团队。
  • 有明确授权和审计流程的安全防御团队。
  • 能复核证明、实验或引用的数学与科学研究者。

如果只是日常问答、翻译或轻量写作,先用账号现有模型做同题对比,再决定是否切换。最好的模型不一定是每个任务里最省时间、最省额度的模型。

常见问题

GPT-6 Astra 就是之前的 Astra 吗?

是。9 月 1 日的路线说明仍使用 Astra 代号,9 月 3 日正式产品名公布为 GPT-6 Astra。

99.9% ARC-AGI-3 等于 AGI 吗?

不能画等号。它是非常强的评测结果,但 OpenAI 没有宣布已经实现 AGI,现实任务还要看可靠性、成本、安全和长期泛化。

GPT-6 Astra 上下文有多大?

API 模型页给出的上下文窗口是 1,050,000 token,最大输出 128,000 token。

GPT-6 Astra 在每个榜单上都领先吗?

不是。它在多项关键评测上大幅提高,但官方完整表格中仍有个别项目由其他模型领先。

为什么正常网络安全任务也可能被停?

Astra 达到 Critical 级网络安全能力,OpenAI 因此采用更严格的监控和拒绝策略。系统会优先控制高风险能力,难免产生少量正常任务被拦截的情况。

参考来源