Astra 已经不是代号,而是 GPT-6
OpenAI 于 2026 年 9 月 3 日正式发布 GPT-6 Astra。发布后,Astra 有了完整产品身份:ChatGPT 版本、Pro 版本、API 模型 ID、定价、上下文规格和安全说明都已公开。
标准版将在未来几天内分批开放给 ChatGPT Plus、Pro、Business、Enterprise 用户,并进入 API 和 AWS。分批开放意味着不是所有付费账号同时出现入口;GPT-6 Astra Pro 只面向 Pro、Business 和 Enterprise,免费版不在这次公告名单中。
先看成绩:99.9% 到底有多夸张?
GPT-6 Astra 在 ARC-AGI-3 得到 99.9%,而 GPT-5.6 Sol 是 7.8%。FrontierMath Tier 4 v2 从 83.0% 提高到 97.6%,Terminal-Bench 4.0 从 37.3% 提高到 57.9%,OSWorld 2.0 从 65.7% 提高到 72.6%。
| 能力方向 | 代表评测 | Astra | 解读 |
|---|---|---|---|
| 抽象泛化 | ARC-AGI-3 | 99.9% | 陌生规则任务出现代际跃升 |
| 数学 | FrontierMath Tier 4 v2 | 97.6% | 高难推理接近评测上限 |
| 软件工程 | Terminal-Bench 4.0 | 57.9% | 终端任务仍有不小失败空间 |
| 电脑操作 | OSWorld 2.0 | 72.6% | 成功率和完成速度同时提高 |
| 自动化 | AutomationBench | 41.4% | 较上一代 18.1% 明显提升 |
| 网络安全 | ExploitBench | 100% | 能力提高也带来更严访问控制 |
不是所有 Benchmark 都第一。官方表格里仍有个别项目由其他外部模型领先;成绩也多采用最高推理强度与研究设置。把“多项大幅领先”写成“全面碾压”,反而会让最有价值的进步显得不可信。
105 万上下文:长到能用,成本也会变
GPT-6 Astra 的 API 上下文窗口是 1,050,000 token,最大输出 128,000 token,知识截止日期为 2026 年 4 月 30 日。在 MRCR 评测中,它在 256K–512K 区间达到 100%,512K–1M 区间为 96.3%。
这意味着超长代码仓、跨年资料和大批合同更有机会一次装入并找回细节,但“能装下”不等于“都该装进去”。超过 272K 输入 token 后,整次请求的输入与缓存按 2 倍、输出按 1.5 倍计费。更好的做法仍是先去重、分层、索引,再把真正相关的材料交给模型。
电脑操作:不只会点,还要更快做完
OSWorld 2.0 的 72.6% 只讲成功率。OpenAI 同时给出的效率信息更有用:Astra 达到更高成绩时,耗时约少 47%;在 Codex harness 的 Mind2Web 任务中,完成速度约为当前 GPT-5.6 Sol 体验的 1.9 倍。
对用户来说,变化不是“AI 会不会操作网页”,而是它能否在多页面、表格、文件和系统之间持续推进,少卡在半路。72.6% 也提醒我们,涉及付款、删除、发送或权限变更的动作仍要人工确认。
Codex 长任务:换上下文后不必重新开会
OpenAI 为 Astra 设计了跨上下文窗口的笔记:模型会留下工作摘要,较早窗口也能被搜索。项目跑得很长时,它可以保留决策、未完成项和关键证据,而不是每次压缩上下文都重新认识代码库。
这项能力目前仍是实验性功能,OpenAI 计划在未来几周逐步设为 Astra 的默认行为。它能减少遗忘,不会替代测试、代码 review 或明确的验收标准。
API 新能力:任务跑起来以后还能改方向
GPT-6 Astra 的开发者指南加入三项适合长流程的能力:
- async tool calling:工具可以异步执行,模型不必每次都原地等待。
- mid-turn steering:通过 WebSocket 在一次长响应尚未结束时补充信息或调整方向。
- configuration_update:保留提示缓存的同时改变 reasoning effort,复杂处加大推理,简单处降低成本。
这些能力更适合 Responses API。Astra 支持 low、medium、high、xhigh、max 推理强度,不支持 none 或 minimal。对生产系统来说,仍需把工具权限、幂等、超时和人工确认做在模型之外。
数学与科学:从答题走向新结果
Astra 的研究轨迹比正式发布更早。8 月公开的 10 项结果覆盖高维球堆积、二进制码、非 sofic 群、算术电路、量子并行重复、后量子密码相关格问题与 Ramsey 数等方向,并附带论文、推理说明和 Lean certificate。
正式发布页又给出两项素数间隔结果:一项把已知上界从 240 改进到 186,另一项改进了大间隔相关界。它们是否成为长期公认成果,要靠领域专家复核;但“产生可检查的新证明”与“在有标准答案的数据集上拿高分”确实是两种不同能力。
Critical 级网络安全能力:更强,也更受控
GPT-6 Astra 以 Critical 级网络安全能力部署。ExploitBench 100%、ExploitGym 42.4%、SRE-Bench 88.0% 展示了它在漏洞利用、复杂攻击环境和可靠性工程中的进步,也解释了为什么限制更严。
OpenAI 会加强网络安全请求监控、拒绝高级攻击能力,并扩大 Daybreak Blue 的防御研究访问。正常安全任务也可能被暂停、要求确认或直接停止。对防御团队来说,提前把授权范围、目标所有权和审计材料准备好,会比反复试探边界更有效。
Hugging Face 事件:别再张冠李戴
Astra 没有参与 Hugging Face 事件。OpenAI 的完整调查称,主要责任模型是不会公开发布的 Internal Model 1(IM1),规模与 GPT-5.6 Sol 相当。GPT-5.6 Sol 的部分 agent 后来复现过利用并复制少量私有评测数据,但 Astra 与那次事件没有直接关系。
这一点仍值得保留,因为发布后很容易有人把旧标题里的“下一代模型”自动替换成 GPT-6 Astra。官方调查没有支持这种改写。
开放范围与 API 价格
| 入口 | 开放范围 / 价格 | 注意事项 |
|---|---|---|
| ChatGPT 标准版 | Plus、Pro、Business、Enterprise | 未来几天内分批开放 |
| ChatGPT Pro 版 | Pro、Business、Enterprise | Enterprise 默认需管理员启用 |
| API 标准输入 | 10 美元 / 百万 token | 超过 272K 输入触发长上下文倍率 |
| API 缓存输入 | 1 美元 / 百万 token | 缓存写入另计 12.50 美元 / 百万 token |
| API 标准输出 | 50 美元 / 百万 token | Batch / Flex 半价,Fast 2 倍价 |
ChatGPT 订阅内的 Astra 使用计入现有额度,OpenAI 也提供额外 credits 购买选项;具体剩余额度和重置时间以账号 Usage 页面为准。
谁最值得第一时间试?
- 需要跨网页、表格和桌面软件跑完整流程的人。
- 经常让 Codex 承接跨天、跨窗口工程任务的开发者。
- 要读几十万 token 代码或资料,并能承担长上下文成本的团队。
- 有明确授权和审计流程的安全防御团队。
- 能复核证明、实验或引用的数学与科学研究者。
如果只是日常问答、翻译或轻量写作,先用账号现有模型做同题对比,再决定是否切换。最好的模型不一定是每个任务里最省时间、最省额度的模型。
常见问题
GPT-6 Astra 就是之前的 Astra 吗?
是。9 月 1 日的路线说明仍使用 Astra 代号,9 月 3 日正式产品名公布为 GPT-6 Astra。
99.9% ARC-AGI-3 等于 AGI 吗?
不能画等号。它是非常强的评测结果,但 OpenAI 没有宣布已经实现 AGI,现实任务还要看可靠性、成本、安全和长期泛化。
GPT-6 Astra 上下文有多大?
API 模型页给出的上下文窗口是 1,050,000 token,最大输出 128,000 token。
GPT-6 Astra 在每个榜单上都领先吗?
不是。它在多项关键评测上大幅提高,但官方完整表格中仍有个别项目由其他模型领先。
为什么正常网络安全任务也可能被停?
Astra 达到 Critical 级网络安全能力,OpenAI 因此采用更严格的监控和拒绝策略。系统会优先控制高风险能力,难免产生少量正常任务被拦截的情况。