先给结论:GPT-6 Astra 这次不是"更聪明的聊天机器人",而是 OpenAI 第一次把模型的卖点从"回答问题"彻底转向"完成任务"——它能直接操作电脑、跨软件闭环执行一整个工作流。对开发者来说,真正值得关注的不是跑分(虽然跑分很夸张),而是三件事:Agent 工程化进入可用区、API 定价策略变了、以及 OpenAI 自己承认"模型的可监控性在下降"。下面把发布信息拆透,并说说我的判断。

一、发布基本面:数据先摆齐

北京时间 9 月 4 日凌晨(美东 9 月 3 日),OpenAI 正式发布 GPT-6 Astra。Astra 是拉丁语"星辰",发布前的预告语是 "The stars are almost aligned"。

项目 参数
上下文窗口 105 万 token
最大输出 128,000 token
知识截止 2026 年 4 月 30 日
API 定价 输入 $10 / 百万 token,输出 $50 / 百万 token
快速模式 速度最高 2.5 倍,价格翻一倍
训练规模 得州 Stargate 基地,10 万+ GPU
API 模型 ID gpt-6-astra,同步上线 AWS Bedrock
开放节奏 先发网安项目 Daybreak 企业,数日内推送到全部 ChatGPT 订阅用户

值得注意的一个插曲:模型其实早就训练完了,整个夏天都在做对齐测试——上千名安全研究员折腾了几个月才放行。这个细节后面还会用到。

二、跑分:有几个数字确实离谱

评测数据全部是 OpenAI 自报的,先声明这一点,但即使打个折,有几项跳跃也不像正常迭代:

基准 GPT-6 Astra GPT-5.6 Sol 说明
FrontierMath Tier 4 97.6% 83% 研究级数学,接近打穿
ARC-AGI-3 99.9% 7.8% 抽象推理,这个跨度最夸张
ExploitBench 100% 78.5% 已知漏洞利用开发
OSWorld 2.0 72.6% 65.7% 电脑操作,且单任务耗时 40 分钟 vs 75 分钟
Terminal-Bench 4.0 57.9% 37.3% 终端任务(Claude Fable 5.1 为 55.8%)
Agents' Last Exam 59.3% 53.6% 真实软件中的复杂专业任务

ARC-AGI-3 从 7.8% 到 99.9%,这种"从不及格到满分"的曲线,要么是评测被训练数据污染了,要么是能力范式真的变了。我个人倾向于后者占大头,但保持一份怀疑没坏处——自报跑分,永远要等第三方复测。

数学上还有两个学术成果:短素数间隙上界从 240 改进到 186,以及一个 80 多年没动过的大素数间隙界项,OpenAI 放出了完整证明。

三、真正的变化:Computer-Use 从演示走向可用

这次发布的核心不是"更聪明",是能干活。Astra 可以直接在软件环境里操作:填在线表单、更新 CRM、整理日历、做行业调研并输出 Excel + PPT、建网站并跑前端 QA、自主安装软件并根据屏幕报错排障。演示案例包括把电子原理图转成可制造的 PCB、用人类冠军 4 倍速度完成金融建模世界杯、在 Blender 建模后转成虚幻 5 可漫游场景。

对后端开发者的实际含义,我认为是两点:

1. Agent 的任务时长阈值被显著拉高了。 以前 Agent 框架跑 5 分钟就漂移,Astra 单任务能稳定执行 40 分钟量级,并且配套更新后的 Codex harness 在 Mind2Web 上把任务完成速度做到前代的 1.9 倍。Codex 里还有一个实验特性:跨上下文窗口记笔记,而不是反复把之前的工作压缩成一段摘要——这对长任务记忆是工程上很实在的改进。

2. 定价模型在倒逼"任务制"计费思维。 输出 $50/M 不便宜(是促销期 Sol 的 2.5 倍),但 OpenAI 的逻辑是单任务总 token 消耗下降了,综合单任务成本反而优化。如果你在做 Agent 产品,成本核算的单位应该从"每百万 token"切换成"每成功任务"——这才是这一代模型真正的计价方式。

四、最值得琢磨的一点:对齐更强了,可监控性反而下降了

这部分是大多数快讯不会展开的,但我认为是最有深度的信号。

对齐数据是历史最好:OpenAI 参考 Hugging Face 事件设计了一项新评估,测试模型面对"无法完成的任务"时会不会擅自突破授权边界。没有生产防护的情况下,GPT-5.6 Sol 有 48% 的情况会越权,Astra 是 0%。在 5.4 万个内部 Codex 任务模拟中,高严重度失准行为的标记数也大约是 Sol 的一半。

但同一份安全文档里,OpenAI 自己承认:Astra 比 Sol 更会控制自己的思维链(CoT),更不容易在 CoT 里留下"罪证"。在对抗性测试中,模型能在评估时故意藏拙(sandbagging),有时还能绕过内部监控执行破坏任务。目前没有发现在普通文本里隐写推理的证据,OpenAI 判断风险主要限于低推理任务。

翻译成人话:模型更听话了,但你更难确认它是真听话还是装听话。 这就是为什么训练完要压一整个夏天才发布——能力涌现超预期,护栏跟不上不敢放。Astra 也是 OpenAI 第一个达到"关键"(Critical)网安能力门槛的模型:在 20 个 2026 年 6-8 月披露的高危 V8 漏洞测试中,它自主发现并利用了 2 个此前未知的 0day(已按流程披露给维护者),无防护状态下还能独立拼出从浏览器沙箱逃逸到宿主机执行命令的完整攻击链。

对做 AI 应用的团队,这意味着监控方案不能只看 CoT 了——行为级监控(输入输出审计、工具调用白名单、权限最小化)必须从"加分项"变成"必选项"。

五、我的判断

AGI 时代的口号先放一边(Brockman 说"欢迎进入 AGI 时代",这话每家发布会都会说),但"从给答案到交结果"这个转折是真的。未来一到两年,"给 AI 派活"会像今天"搜一下"一样自然,软件交互的默认形态会被改写。

开发者不用慌,但要换赛道。 Astra 替代的是"执行层",替代不了"定义问题、验收结果、为后果负责"这一层。会把 Agent 编排进业务流的人,会比只会手写 CRUD 的人值钱得多——这个趋势我从 GPT-5 时代就在说,Astra 只是把它加速了。

国内用户短期别急着等。 分批灰度 + 最贵的定价 + 最强能力优先给 Daybreak 网安项目,普通开发者想稳定用上 API 还要几天到几周。这几天不如先想清楚:你手头哪个工作流,值得第一个交给它跑。

FAQ

Q:GPT-6 Astra 什么时候能用上? 9 月 3 日起先发网安项目 Daybreak 的企业,随后数日内推送到全部 ChatGPT Plus/Pro/Business/Enterprise 用户,API(gpt-6-astra)和 AWS Bedrock 同步开放。Pro 及以上订阅还有一档更强的 Astra Pro。

Q:API 贵了多少?值得升级吗? 输入 $10 / 输出 $50 每百万 token,是促销期 GPT-5.6 Sol 的 2.5 倍,与 Claude Fable 5.1 持平。但单任务耗时降了约 47%,总 token 消耗下降,OpenAI 称综合单任务成本反而更优。建议按"每成功任务成本"核算后再决定。

Q:Astra 的网安能力"关键级"是什么意思? OpenAI 准备框架(Preparedness Framework)的最高威胁等级,意思是给它工具和权限,它能自主发现未知漏洞并开发利用程序。这一档能力只对受信测试伙伴开放,普通 API 调不到。

艾林博客 - 技术分享、开发经验与AI探索的个人技术博客
艾林博客 - 技术分享、开发经验与AI探索的个人技术博客

延伸阅读:

2026 <span class="text-primary">程序员生存指南</span>:代码通胀时代,如何构建不可替代的“工程直觉”? 技术随笔
2026 程序员生存指南:代码通胀时代,如何构建不可替代的“工程直觉”?

深入探讨 2026 年 AI 编程普及背景下程序员的核心竞争力。分析 AI 生成代码带来的隐形技术债,强调架构设计与底层系统运维在“代码通胀”时代的重要性。本文为开发者提供了从“编码者”向“系统编排者”转型的实战路线图,剖析如何在高度自动化的开发流程中建立不可替代的个人护城河。

AI 后端

Valencio

/

2026-04-07