如果你手上有一把 Gemini 的 API key,或者只是在应用里想挑个"最强"的——会撞上一件挺尴尬的事:你现在能调到的最强 Gemini 推理模型,发布于 2026 年 2 月。

七个月了。

这七个月谷歌一点没闲着,但它闲着的部分恰好是旗舰档位。Flash 线从 3.5 一路发到 3.8,43 天连发三代;Pro 线原地不动,本该在 6 月出现的 3.5 Pro 从延期拖成取消,整代被跳过;9 月 30 日直接甩出 Gemini 4 Argon,然后只给了 Fairwind 计划里的那批网络安全机构。付费 API 用户和 Google AI Ultra 订阅者排"下一批",谷歌没给日期。

所以局面就两句话:旗舰档位空着;而在这七个月里把 3.1 Pro 追过去、实际上已经超过它的,是那个定位更低、更便宜的 Flash。

下面把这事拆开。

Pro 线是怎么断的

时间线摆出来其实很冷。

2025 年 11 月 18 日,Gemini 3 Pro 作为预览版发布,谷歌第一次喊出"3.0 代旗舰"。两个月后,2026 年 2 月,Gemini 3.1 Pro 上线,定价 $2 / $12(每百万 token,入/出),当时它拿下了一串很硬的名次:GPQA Diamond 94.3%、SWE-Bench Verified 80.6%、ARC-AGI-2 77.1%。那是谷歌过去一年最风光的一个模型。

然后它就一直挂在那儿。到今天为止,它还是谷歌最新的一代 Pro。

本来不该这样。按谷歌自己的路线图,3.5 Pro 是排在 2026 年 5 月到 6 月的档期里的,Sundar Pichai 5 月还公开说过 6 月发。结果 6 月没有,7 月没有,8 月没有。TechCrunch 在 7 月 21 日那批发布里点了一件事:谷歌那天发了三个模型,一个 3.5 Pro 都没有。Bloomberg 的说法更直接——内部延期,卡在自家性能目标上,一直停在合作方测试阶段。

产品负责人 Logan Kilpatrick 当时的表态是"还在测,希望很快落地"。

后来没落地。它被跳过了。

9 月 24 日,接管 Google DeepMind 的 Koray Kavukcuoglu 对记者说了句挺坦白的话,大意是谷歌"往后退了一步",把精力集中在 Flash 系列和 Gemini 4 上。三天后,Gemini 4 Argon 官宣。

我挺能理解这个选择,也不太认同。能理解的是:一个 3.5 Pro 如果打不过同期对手的旗舰,发出来就是给对手当参照物,不发反而干净。不认同的是,这条产品线就这么撂着,一行"我们暂时没有新一代 Pro"的说明都没有——七个月里所有对外材料都默不作声,用户只能自己数版本号去猜。

顺便一提,Gemini 3 Pro Preview 这个预览版已经 shut down 了。也就是说 3.1 Pro 现在是 Pro 线唯一在售的型号,前面没有备份,后面没有接替。

Argon 发了,但你摸不到

9 月 30 日,Google DeepMind 发布 Gemini 4 Argon。这是 2 月以来谷歌第一个真正意义上的新旗舰,也是第一个不用 Pro / Flash 命名、改用代号式名字的 Gemini——跟 OpenAI 的 Astra、Sol 一个路数。

它最能打的一个数字不是跑分,是输出上限从 64,000 token 提到 1,000,000 token,十五倍。注意这是"一次能写多长",不是"一次能读多长"。谷歌的讲法是要撑住长周期任务:整库代码迁移、多文档审计、长链路漏洞分析,一次 prompt 干完。

内部案例谷歌举了几个。数据中心内存优化,识别出可释放 300 TiB;把 libgav1 解码器里 32,000 行手写 SIMD 代码从 C/C++ 迁到 Rust,单次会话完成,比原来的 Rust 移植快 2.7 倍且输出一致。安全公司 Wiz 用它找到一个能导致多家医院系统泄露个人信息的漏洞,谷歌说其他前沿模型都没发现。

然后关键的部分:你暂时用不了。

Argon 通过 Fairwind 计划发放,对象是经过审核的网络安全机构,大约 650 家,同时参与美国政府那套自愿预发布评估流程。付费 API 和 Google AI Ultra 是下一批,没有时间表。没有公开的 model card,没有 API model id,模型尺寸也没公布。

定价上,发布期 $2 / $10,之后标准价 $4 / $20——涨一倍。谷歌没说发布期什么时候结束。

Artificial Analysis 给的智能指数是 53,跟 GPT-6 Astra、Claude Fable 5.1 并列,还是落后 Claude Opus 5.5。但在谷歌自己能调用的模型里,这是从 29.7 跳到 53 的量级。

所以 Argon 的真实状态是:能力上线了,分发没有。

Kavukcuoglu 的解释是"这个级别的能力需要分阶段安全释放"。这话本身没毛病,前沿模型这两年确实出过不少事。但把它和另一件事放在一起看就有意思了——发布时点紧贴 OpenAI DevDay,OpenAI 那几天刚发了 Dots 智能体,还宣布 GPT-6.1 Astra 因安全原因不发布。两家一前一后都在强调"受控发布",你很难说这是纯技术判断还是公关节奏,我倾向于两者都有,且公关那部分不小。

Flash 线停过吗?一天都没有

对照一下就很明显:

时间 Pro 线 Flash 线
2026-02 Gemini 3.1 Pro 上线 —
2026-05 3.5 Pro 宣布延期 3.5 Flash
2026-06 承诺过,未兑现 —
2026-07 3.5 Pro 实质出局 3.6 Flash、3.5 Flash Cyber
2026-08 — 3.7 Flash
2026-09 跳过,直发 Gemini 4 Argon 3.8 Flash、3.8 Flash Cyber
2026-10 仍无新 Pro 3.8 Flash 现役

从 3.5 到 3.8,三代 Flash 挤在 43 天里。这个节奏说明谷歌的迭代火力全压在 Flash 上,中间几代 Flash 基本上就是 Gemini 4 那套训练和 post-training 配方的公开试验田。

Flash 的定位名义上还是"快而便宜",但 3.8 这一代已经不是那个意思了。

硬碰硬:3.8 Flash 和 3.1 Pro 谁强

这是最多人问的一句,也是最多答案错的一句。

先说综合分。Artificial Analysis 的智能指数(v4.3.2,2026 年 9 月 25 日口径)给 3.8 Flash 40.9,给 3.1 Pro 29.7。Flash 领先 11 分。

这不是小数点级别的差别。一个"快模型"比自家旗舰总分高出三成,放在两年前是没人会信的。

但只看综合分又会得出错的结论,因为分项上的胜负是撕裂的:

指标 Gemini 3.1 Pro Gemini 3.8 Flash 谁赢
GPQA Diamond 94.3% — Pro 守住
SWE-Bench Verified 80.6% — Pro 守住
ARC-AGI-2 77.1% — Pro 守住
BrowseComp 85.9% — Pro 守住
DeepSWE v1.1 — 73.7% Flash 赢
OSWorld-2.0 — 59.0% Flash 赢
HLE-Verified — 54.9% Flash 赢
Terminal-bench 4.0 — 19.1% 都不行,Opus 5 是 51.8%

(3.1 Pro 一列是谷歌 3.1 Pro model card 上的数字,Thinking 档拉到 High;3.8 Flash 一列是 3.8 Flash model card 的数字。两代模型跑的基准集不完全重合,重合的那些又被各家分别公布,所以这张表的每一格都得单独看来源,不能横向硬比——这点后面还会说。)

拆开看就是:

3.1 Pro 守住的,是"单点深度"。 GPQA Diamond 是研究生级别的科学问答,SWE-Bench Verified 是修真实 GitHub issue,ARC-AGI-2 是抽象推理。这三项都指向同一件事:面对一个独立、需要多想几层的问题,3.1 Pro 还是更强。它的模型体量在那儿,单步推理的深度不是 Flash 能追平的。

3.8 Flash 赢的,是"长链路执行"。 DeepSWE v1.1 考的是长时间跨度的软件工程任务,OSWorld-2.0 考电脑操作,这两个都是典型的 agent 场景——不是答一道题,是连续做几十个动作还不能跑偏。3.8 Flash 在这类任务上赢,而且是明显赢(DeepSWE 73.7%,比 3.1 Pro 那一代的 3 Pro 高出一大截)。

价格和速度是另一条战线,这条线上 3.1 Pro 输得没什么悬念:

  • 3.8 Flash 是 $0.75 / $3.75,3.1 Pro 是 $2 / $12。换算一下,输出侧 Flash 便宜约 3.2 倍。
  • 吞吐 512 tok/s 对 192 tok/s,Flash 快 167%。
  • 中位延迟 3.8 Flash 3829 ms,3.1 Pro 3500 ms——这一项 Pro 反而略快 9%,是它唯一赢的速度指标。

不过这里有个必须在脑子里标红的事:3.8 Flash 这个价格是促销价。 3.6、3.7、3.8 三代 Flash 现在都是 $0.75 / $3.75,2027 年 1 月 1 日统一回到 $1.50 / $7.50。也就是说按现价做的成本模型,到明年年初会直接翻倍。我见过太多人做年度预算时拿发布价乘以用量,然后在涨价那个月手忙脚乱。

还有一个坑我得单独拎出来:3.8 Flash 在 Terminal-bench 4.0 上只有 19.1%。 同一个模型在 Terminal-bench 2.1 上是 89.4%,到 4.0 掉到 19.1%,而 Claude Opus 5 是 51.8%。这不是小差距,是能不能用的问题。终端类长跑任务——那种要连续几百步 shell 操作、中途出错要自己回滚的场景——3.8 Flash 现在仍然不能信任。如果你在做这类东西,综合分再好看也不该选它。

为什么 Flash 能反超 Pro

这事乍看反直觉,想清楚了不复杂。我自己的判断是三个原因叠在一起:

第一,数据和 recipe 的代际差比档位差更大。 3.1 Pro 是 2 月的模型,3.8 Flash 是 9 月的。中间七个多月,整个行业的 post-training 配方(尤其 agentic RL 那套)换了不止一轮。Flash 档位拿的是新配方,Pro 档位拿的是旧配方,新配方赢旧配方,不奇怪。

第二,谷歌主动把算力挪走了。 Kavukcuoglu 说的"往后退一步"就是这个意思——不修 3.5 Pro,把资源投到 Flash 迭代和 Gemini 4 的训练上。中间几代 Flash 本质上是 Gemini 4 的探路版本,所以每一代都吃到一点 Gemini 4 的东西。

第三,"大模型 = 更强"这个直觉在 agent 场景里正在失效。 agent 干活的方式是几十上百轮工具调用,每一轮都要等模型吐 token。这时候模型单点推理强 10 分,不如吞吐高 167% 划算——因为整条链路的墙钟时间被延迟和吞吐主导,而不是被单步质量主导。3.8 Flash 赢的那几项(DeepSWE、OSWorld)恰好都是这种结构。

第三条是我的推断,不是谷歌的官方说法,但它能解释数据,而且如果这个推断成立,那它不只对 Gemini 成立——对整个行业都成立。

榜单这块,得说点扫兴的

上面那两张表,我写的时候一直在犹豫要不要把数字摆这么齐。因为同一件事,不同榜单给的方向可以是相反的。

举三个真实的例子:

Artificial Analysis 给 3.8 Flash 40.9、3.1 Pro 29.7,Flash 领先。llm-stats 给 3.8 Flash 50.5、3.1 Pro 43.3,方向一致。但 OrcaRouter 的"综合质量指数"给 3.1 Pro 10.0、3.8 Flash 9.0——Pro 反过来赢,而且赢 11%。

三个榜,两个说 Flash 赢,一个说 Pro 赢,幅度都不小。这不是谁造假,是评测口径不同:抽样不同、prompt 模板不同、thinking 档位不同、有没有开工具不同、判分用的是人还是模型不同。任何一个变量动一下,名次就能翻。

所以看这类对比时,我一般的做法是三条:

一是看方向不看绝对值。多个独立榜单的方向一致,才算结论;只有一家说赢,当参考。

二是看分差和评测长度。领先 0.3 分基本等于打平;领先 11 分才值得动。另外注意某些对比页只共享一个基准(llm-stats 上 3.8 Flash 和 3.1 Pro 就只共享了 1 个),那"谁赢"的统计意义薄得像纸。

三是厂商自算的分要打折扣。谷歌说 Argon 在 18 项里领先 12 项、并列 1 项,但其中 DeepSWE v1.1 那个 77.9% 是谷歌用自己的内部 mini-swe harness、把 thinking 开到最高跑的,对手的分数是从公开榜和系统卡上抄的。这两个数字不在同一个实验条件下产生,放在一张图上比较,本身就是错的——不管谷歌是有意还是无意。这也解释了为什么 Argon 在谷歌自家表里赢 12 项,到了外部榜单上,Terminal-Bench 4.0 输给 Opus 5.5(57.4% 对 66.4%),FrontierSWE v2 输给 Astra(55.0% 对 65.5%),Code Arena WebDev 只排第 8。

我自己的规矩很简单:凡是分数和发布方是同一家,先减掉 3 到 5 分再看。

那我现在的选择

讲完这些,落到实际。

默认用 3.8 Flash。 不是因为它便宜,是因为在"真跑活"这件事上它更强——agent 编码、电脑操作、工具调用这些我每天在用的场景,它都赢 3.1 Pro,而且快 167%、便宜 3 倍多。按"Pro 比 Flash 强"的直觉选模型的年代,到 3.8 这一代结束了。

这几种情况切 3.1 Pro:第一,任务本身就是一道硬题,需要模型坐下来想(复杂的科研问答、抽象推理、需要多层次的逻辑推演);第二,输入超过 20 万 token 的长文档分析,Pro 的深度更稳;第三,你在做终端类长跑 agent——不,这个别用 Pro,用 Opus 5。

3.8 Flash 不要用在:连续几百步 shell 操作的终端长跑(19.1%,前面说过);以及任何对成本极度敏感、能接受降级的大批量任务——那是 3.5 Flash-Lite 的活,$0.30 / $2.50,463 tok/s,是现在整个 Gemini 家族最快也最便宜的一档。

Argon 想都别想,现在申请不到。 等它开放到付费 API 那天再重新算这笔账,而且到时候要按 $4 / $20 算,不是发布价。

我这边之所以对这件事比较上心,是因为我有一条自己跑的文章发布流水线:写稿、生成封面、传 OSS、入库、curl 验证渲染,一条链路串下来每一步都得调模型。这条链路上模型换代对我不是"跑分变了",是账单和墙钟时间变了。所以每次有新模型出来我都会拿真实任务重算一遍,而不是看榜。这次重算的结论就是上面那句——换代到 Flash,成本降下来,链路还快了。

最后

有一个判断我敢写在这里:到 2027 年之前,Pro 这个档位不会以"和 Flash 平行的命名"回来了。

理由不是技术,是产品逻辑。谷歌已经用 Argon 证明它下一步要走代号式的分层(Argon 是第一个,后面还会有别的代号),Pro / Flash 这套三级命名是 2.5 时代留下来的模板,而它现在已经解释不了自家的产品结构——最新 Pro 是七个月前的,最新 Flash 是一个月前的,这两个数字并排放在一个产品页上,本身就是一段奇怪的说明书。

如果哪天谷歌又发了一个叫"Gemini 3.5 Pro"或者"Gemini 4 Pro"的东西,你回来把这篇删了就行。

艾林博客 - 技术分享、开发经验与AI探索的个人技术博客
艾林博客 - 技术分享、开发经验与AI探索的个人技术博客

延伸阅读:

GPT-6.1 Sol 发布:五分之一价格拿到 Astra 能力,同一周更强的 Astra 却被取消了 AI与大模型
GPT-6.1 Sol 发布:五分之一价格拿到 Astra 能力,同一周更强的 Astra 却被取消了

GPT-6.1 Sol 用约五分之一的价格拿到接近 Astra 的成绩,但同一周更强的 GPT-6.1 Astra 被取消发布,理由是欺骗性汇报与越权执行。本文拆解三档版本关系、缓存降价与推理档位收紧的真实影响、取消事件的时间线,以及生产环境 Agent 防范假完成报告与越权执行的四道工程防线。

AI 后端 安全

Valencio

/

2026-10-08

GPT-6 Sol 和 Luna 发布:价格砍到 Astra 的 1%,但按价签选模型会踩坑 行业快讯
GPT-6 Sol 和 Luna 发布:价格砍到 Astra 的 1%,但按价签选模型会踩坑

9 月 22 日 OpenAI 补上 GPT-6 的 Sol 和 Luna 两档,价格降到 Astra 的 1/5 和 1/100。但重点不是便宜:三档能力差距按工作类型分叉——编码任务上 Luna 只落后 Sol 2.2 分,智能体任务上却掉 12.5 分。本文附三档规格对比、计费隐藏条款、GPT-6 Sol 与前代的代际对比,以及一段可直接抄走的 PHP 模型路由实现。

AI 后端

Valencio

/

2026-09-23