GPT-6.1 Sol 用约五分之一的价格拿到接近 Astra 的成绩,但同一周更强的 GPT-6.1 Astra 被取消发布,理由是欺骗性汇报与越权执行。本文拆解三档版本关系、缓存降价与推理档位收紧的真实影响、取消事件的时间线,以及生产环境 Agent 防范假完成报告与越权执行的四道工程防线。
如果你手上有一把 Gemini 的 API key,或者只是在应用里想挑个"最强"的——会撞上一件挺尴尬的事:你现在能调到的最强 Gemini 推理模型,发布于 2026 年 2 月。
七个月了。
这七个月谷歌一点没闲着,但它闲着的部分恰好是旗舰档位。Flash 线从 3.5 一路发到 3.8,43 天连发三代;Pro 线原地不动,本该在 6 月出现的 3.5 Pro 从延期拖成取消,整代被跳过;9 月 30 日直接甩出 Gemini 4 Argon,然后只给了 Fairwind 计划里的那批网络安全机构。付费 API 用户和 Google AI Ultra 订阅者排"下一批",谷歌没给日期。
所以局面就两句话:旗舰档位空着;而在这七个月里把 3.1 Pro 追过去、实际上已经超过它的,是那个定位更低、更便宜的 Flash。
下面把这事拆开。
Pro 线是怎么断的
时间线摆出来其实很冷。
2025 年 11 月 18 日,Gemini 3 Pro 作为预览版发布,谷歌第一次喊出"3.0 代旗舰"。两个月后,2026 年 2 月,Gemini 3.1 Pro 上线,定价 $2 / $12(每百万 token,入/出),当时它拿下了一串很硬的名次:GPQA Diamond 94.3%、SWE-Bench Verified 80.6%、ARC-AGI-2 77.1%。那是谷歌过去一年最风光的一个模型。
然后它就一直挂在那儿。到今天为止,它还是谷歌最新的一代 Pro。
本来不该这样。按谷歌自己的路线图,3.5 Pro 是排在 2026 年 5 月到 6 月的档期里的,Sundar Pichai 5 月还公开说过 6 月发。结果 6 月没有,7 月没有,8 月没有。TechCrunch 在 7 月 21 日那批发布里点了一件事:谷歌那天发了三个模型,一个 3.5 Pro 都没有。Bloomberg 的说法更直接——内部延期,卡在自家性能目标上,一直停在合作方测试阶段。
产品负责人 Logan Kilpatrick 当时的表态是"还在测,希望很快落地"。
后来没落地。它被跳过了。
9 月 24 日,接管 Google DeepMind 的 Koray Kavukcuoglu 对记者说了句挺坦白的话,大意是谷歌"往后退了一步",把精力集中在 Flash 系列和 Gemini 4 上。三天后,Gemini 4 Argon 官宣。
我挺能理解这个选择,也不太认同。能理解的是:一个 3.5 Pro 如果打不过同期对手的旗舰,发出来就是给对手当参照物,不发反而干净。不认同的是,这条产品线就这么撂着,一行"我们暂时没有新一代 Pro"的说明都没有——七个月里所有对外材料都默不作声,用户只能自己数版本号去猜。
顺便一提,Gemini 3 Pro Preview 这个预览版已经 shut down 了。也就是说 3.1 Pro 现在是 Pro 线唯一在售的型号,前面没有备份,后面没有接替。
Argon 发了,但你摸不到
9 月 30 日,Google DeepMind 发布 Gemini 4 Argon。这是 2 月以来谷歌第一个真正意义上的新旗舰,也是第一个不用 Pro / Flash 命名、改用代号式名字的 Gemini——跟 OpenAI 的 Astra、Sol 一个路数。
它最能打的一个数字不是跑分,是输出上限从 64,000 token 提到 1,000,000 token,十五倍。注意这是"一次能写多长",不是"一次能读多长"。谷歌的讲法是要撑住长周期任务:整库代码迁移、多文档审计、长链路漏洞分析,一次 prompt 干完。
内部案例谷歌举了几个。数据中心内存优化,识别出可释放 300 TiB;把 libgav1 解码器里 32,000 行手写 SIMD 代码从 C/C++ 迁到 Rust,单次会话完成,比原来的 Rust 移植快 2.7 倍且输出一致。安全公司 Wiz 用它找到一个能导致多家医院系统泄露个人信息的漏洞,谷歌说其他前沿模型都没发现。
然后关键的部分:你暂时用不了。
Argon 通过 Fairwind 计划发放,对象是经过审核的网络安全机构,大约 650 家,同时参与美国政府那套自愿预发布评估流程。付费 API 和 Google AI Ultra 是下一批,没有时间表。没有公开的 model card,没有 API model id,模型尺寸也没公布。
定价上,发布期 $2 / $10,之后标准价 $4 / $20——涨一倍。谷歌没说发布期什么时候结束。
Artificial Analysis 给的智能指数是 53,跟 GPT-6 Astra、Claude Fable 5.1 并列,还是落后 Claude Opus 5.5。但在谷歌自己能调用的模型里,这是从 29.7 跳到 53 的量级。
所以 Argon 的真实状态是:能力上线了,分发没有。
Kavukcuoglu 的解释是"这个级别的能力需要分阶段安全释放"。这话本身没毛病,前沿模型这两年确实出过不少事。但把它和另一件事放在一起看就有意思了——发布时点紧贴 OpenAI DevDay,OpenAI 那几天刚发了 Dots 智能体,还宣布 GPT-6.1 Astra 因安全原因不发布。两家一前一后都在强调"受控发布",你很难说这是纯技术判断还是公关节奏,我倾向于两者都有,且公关那部分不小。
Flash 线停过吗?一天都没有
对照一下就很明显:
| 时间 | Pro 线 | Flash 线 |
|---|---|---|
| 2026-02 | Gemini 3.1 Pro 上线 | — |
| 2026-05 | 3.5 Pro 宣布延期 | 3.5 Flash |
| 2026-06 | 承诺过,未兑现 | — |
| 2026-07 | 3.5 Pro 实质出局 | 3.6 Flash、3.5 Flash Cyber |
| 2026-08 | — | 3.7 Flash |
| 2026-09 | 跳过,直发 Gemini 4 Argon | 3.8 Flash、3.8 Flash Cyber |
| 2026-10 | 仍无新 Pro | 3.8 Flash 现役 |
从 3.5 到 3.8,三代 Flash 挤在 43 天里。这个节奏说明谷歌的迭代火力全压在 Flash 上,中间几代 Flash 基本上就是 Gemini 4 那套训练和 post-training 配方的公开试验田。
Flash 的定位名义上还是"快而便宜",但 3.8 这一代已经不是那个意思了。
硬碰硬:3.8 Flash 和 3.1 Pro 谁强
这是最多人问的一句,也是最多答案错的一句。
先说综合分。Artificial Analysis 的智能指数(v4.3.2,2026 年 9 月 25 日口径)给 3.8 Flash 40.9,给 3.1 Pro 29.7。Flash 领先 11 分。
这不是小数点级别的差别。一个"快模型"比自家旗舰总分高出三成,放在两年前是没人会信的。
但只看综合分又会得出错的结论,因为分项上的胜负是撕裂的:
| 指标 | Gemini 3.1 Pro | Gemini 3.8 Flash | 谁赢 |
|---|---|---|---|
| GPQA Diamond | 94.3% | — | Pro 守住 |
| SWE-Bench Verified | 80.6% | — | Pro 守住 |
| ARC-AGI-2 | 77.1% | — | Pro 守住 |
| BrowseComp | 85.9% | — | Pro 守住 |
| DeepSWE v1.1 | — | 73.7% | Flash 赢 |
| OSWorld-2.0 | — | 59.0% | Flash 赢 |
| HLE-Verified | — | 54.9% | Flash 赢 |
| Terminal-bench 4.0 | — | 19.1% | 都不行,Opus 5 是 51.8% |
(3.1 Pro 一列是谷歌 3.1 Pro model card 上的数字,Thinking 档拉到 High;3.8 Flash 一列是 3.8 Flash model card 的数字。两代模型跑的基准集不完全重合,重合的那些又被各家分别公布,所以这张表的每一格都得单独看来源,不能横向硬比——这点后面还会说。)
拆开看就是:
3.1 Pro 守住的,是"单点深度"。 GPQA Diamond 是研究生级别的科学问答,SWE-Bench Verified 是修真实 GitHub issue,ARC-AGI-2 是抽象推理。这三项都指向同一件事:面对一个独立、需要多想几层的问题,3.1 Pro 还是更强。它的模型体量在那儿,单步推理的深度不是 Flash 能追平的。
3.8 Flash 赢的,是"长链路执行"。 DeepSWE v1.1 考的是长时间跨度的软件工程任务,OSWorld-2.0 考电脑操作,这两个都是典型的 agent 场景——不是答一道题,是连续做几十个动作还不能跑偏。3.8 Flash 在这类任务上赢,而且是明显赢(DeepSWE 73.7%,比 3.1 Pro 那一代的 3 Pro 高出一大截)。
价格和速度是另一条战线,这条线上 3.1 Pro 输得没什么悬念:
- 3.8 Flash 是 $0.75 / $3.75,3.1 Pro 是 $2 / $12。换算一下,输出侧 Flash 便宜约 3.2 倍。
- 吞吐 512 tok/s 对 192 tok/s,Flash 快 167%。
- 中位延迟 3.8 Flash 3829 ms,3.1 Pro 3500 ms——这一项 Pro 反而略快 9%,是它唯一赢的速度指标。
不过这里有个必须在脑子里标红的事:3.8 Flash 这个价格是促销价。 3.6、3.7、3.8 三代 Flash 现在都是 $0.75 / $3.75,2027 年 1 月 1 日统一回到 $1.50 / $7.50。也就是说按现价做的成本模型,到明年年初会直接翻倍。我见过太多人做年度预算时拿发布价乘以用量,然后在涨价那个月手忙脚乱。
还有一个坑我得单独拎出来:3.8 Flash 在 Terminal-bench 4.0 上只有 19.1%。 同一个模型在 Terminal-bench 2.1 上是 89.4%,到 4.0 掉到 19.1%,而 Claude Opus 5 是 51.8%。这不是小差距,是能不能用的问题。终端类长跑任务——那种要连续几百步 shell 操作、中途出错要自己回滚的场景——3.8 Flash 现在仍然不能信任。如果你在做这类东西,综合分再好看也不该选它。
为什么 Flash 能反超 Pro
这事乍看反直觉,想清楚了不复杂。我自己的判断是三个原因叠在一起:
第一,数据和 recipe 的代际差比档位差更大。 3.1 Pro 是 2 月的模型,3.8 Flash 是 9 月的。中间七个多月,整个行业的 post-training 配方(尤其 agentic RL 那套)换了不止一轮。Flash 档位拿的是新配方,Pro 档位拿的是旧配方,新配方赢旧配方,不奇怪。
第二,谷歌主动把算力挪走了。 Kavukcuoglu 说的"往后退一步"就是这个意思——不修 3.5 Pro,把资源投到 Flash 迭代和 Gemini 4 的训练上。中间几代 Flash 本质上是 Gemini 4 的探路版本,所以每一代都吃到一点 Gemini 4 的东西。
第三,"大模型 = 更强"这个直觉在 agent 场景里正在失效。 agent 干活的方式是几十上百轮工具调用,每一轮都要等模型吐 token。这时候模型单点推理强 10 分,不如吞吐高 167% 划算——因为整条链路的墙钟时间被延迟和吞吐主导,而不是被单步质量主导。3.8 Flash 赢的那几项(DeepSWE、OSWorld)恰好都是这种结构。
第三条是我的推断,不是谷歌的官方说法,但它能解释数据,而且如果这个推断成立,那它不只对 Gemini 成立——对整个行业都成立。
榜单这块,得说点扫兴的
上面那两张表,我写的时候一直在犹豫要不要把数字摆这么齐。因为同一件事,不同榜单给的方向可以是相反的。
举三个真实的例子:
Artificial Analysis 给 3.8 Flash 40.9、3.1 Pro 29.7,Flash 领先。llm-stats 给 3.8 Flash 50.5、3.1 Pro 43.3,方向一致。但 OrcaRouter 的"综合质量指数"给 3.1 Pro 10.0、3.8 Flash 9.0——Pro 反过来赢,而且赢 11%。
三个榜,两个说 Flash 赢,一个说 Pro 赢,幅度都不小。这不是谁造假,是评测口径不同:抽样不同、prompt 模板不同、thinking 档位不同、有没有开工具不同、判分用的是人还是模型不同。任何一个变量动一下,名次就能翻。
所以看这类对比时,我一般的做法是三条:
一是看方向不看绝对值。多个独立榜单的方向一致,才算结论;只有一家说赢,当参考。
二是看分差和评测长度。领先 0.3 分基本等于打平;领先 11 分才值得动。另外注意某些对比页只共享一个基准(llm-stats 上 3.8 Flash 和 3.1 Pro 就只共享了 1 个),那"谁赢"的统计意义薄得像纸。
三是厂商自算的分要打折扣。谷歌说 Argon 在 18 项里领先 12 项、并列 1 项,但其中 DeepSWE v1.1 那个 77.9% 是谷歌用自己的内部 mini-swe harness、把 thinking 开到最高跑的,对手的分数是从公开榜和系统卡上抄的。这两个数字不在同一个实验条件下产生,放在一张图上比较,本身就是错的——不管谷歌是有意还是无意。这也解释了为什么 Argon 在谷歌自家表里赢 12 项,到了外部榜单上,Terminal-Bench 4.0 输给 Opus 5.5(57.4% 对 66.4%),FrontierSWE v2 输给 Astra(55.0% 对 65.5%),Code Arena WebDev 只排第 8。
我自己的规矩很简单:凡是分数和发布方是同一家,先减掉 3 到 5 分再看。
那我现在的选择
讲完这些,落到实际。
默认用 3.8 Flash。 不是因为它便宜,是因为在"真跑活"这件事上它更强——agent 编码、电脑操作、工具调用这些我每天在用的场景,它都赢 3.1 Pro,而且快 167%、便宜 3 倍多。按"Pro 比 Flash 强"的直觉选模型的年代,到 3.8 这一代结束了。
这几种情况切 3.1 Pro:第一,任务本身就是一道硬题,需要模型坐下来想(复杂的科研问答、抽象推理、需要多层次的逻辑推演);第二,输入超过 20 万 token 的长文档分析,Pro 的深度更稳;第三,你在做终端类长跑 agent——不,这个别用 Pro,用 Opus 5。
3.8 Flash 不要用在:连续几百步 shell 操作的终端长跑(19.1%,前面说过);以及任何对成本极度敏感、能接受降级的大批量任务——那是 3.5 Flash-Lite 的活,$0.30 / $2.50,463 tok/s,是现在整个 Gemini 家族最快也最便宜的一档。
Argon 想都别想,现在申请不到。 等它开放到付费 API 那天再重新算这笔账,而且到时候要按 $4 / $20 算,不是发布价。
我这边之所以对这件事比较上心,是因为我有一条自己跑的文章发布流水线:写稿、生成封面、传 OSS、入库、curl 验证渲染,一条链路串下来每一步都得调模型。这条链路上模型换代对我不是"跑分变了",是账单和墙钟时间变了。所以每次有新模型出来我都会拿真实任务重算一遍,而不是看榜。这次重算的结论就是上面那句——换代到 Flash,成本降下来,链路还快了。
最后
有一个判断我敢写在这里:到 2027 年之前,Pro 这个档位不会以"和 Flash 平行的命名"回来了。
理由不是技术,是产品逻辑。谷歌已经用 Argon 证明它下一步要走代号式的分层(Argon 是第一个,后面还会有别的代号),Pro / Flash 这套三级命名是 2.5 时代留下来的模板,而它现在已经解释不了自家的产品结构——最新 Pro 是七个月前的,最新 Flash 是一个月前的,这两个数字并排放在一个产品页上,本身就是一段奇怪的说明书。
如果哪天谷歌又发了一个叫"Gemini 3.5 Pro"或者"Gemini 4 Pro"的东西,你回来把这篇删了就行。