Google 今天更新了 Gemini Flash 系列,一口气推出三个新型号,外加两个预告。

重头戏是 Gemini 3.6 Flash。Google 管它叫"主力马",主攻编程、知识工作和多模态。相比 3.5 Flash,输出 token 量减少了 17%(按 Artificial Analysis 的统计),DeepSWE 基准上甚至砍掉了 65% 的冗余输出。性能提升也不含糊:DeepSWE 从 37% 跳到了 49%,MLE Bench 从 49.7% 涨到 63.9%。价格反而降了——输入 $1.50/百万 token,输出 $7.50/百万 token。电脑操作能力这次做成了内置的客户端工具,通过 Gemini API 和 Gemini Enterprise 可以直接调。

第二个是 Gemini 3.5 Flash-Lite,定位很清楚:给高吞吐、低延迟的 agent 工作流准备的。速度到了 350 token/秒,输入只要 $0.30/百万 token,输出 $2.50/百万 token。这个价位比很多开源模型的推理成本还低。Terminal-Bench 2.1 从 3.1 Flash-Lite 的 31% 跳到了 54%,提升接近翻倍。SWE-Bench Pro 跑到了 54.2%,超过了上一代 3 Flash 的 49.6%。

第三个型号有点特殊。Gemini 3.5 Flash Cyber,在 3.5 Flash 基础上微调,专做漏洞发现和修复。但它不公开发布——只通过 CodeMender 平台提供给政府和可信合作伙伴,目前是受限试点。多个 Cyber agent 协同工作、合并出一份综合报告,在 CyberGym 基准上达到了前沿水平。

两个预告也值得注意。Gemini 3.5 Pro 正在与合作伙伴测试中,"准备好了就发"。Gemini 4 的预训练已经启动,Google 称之为"最野心勃勃的一次训练"。
这一波发布节奏明显在提速。从 Flash 到 Flash-Lite 到 Cyber,Google 正在把同一个基础架构往三个完全不同的方向拉伸——更聪明、更便宜、更专精。而 Gemini 4 的开训意味着下一代基座已经在路上了。
参考来源: