9 月 2 日,谷歌同时发布了两款模型:Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber。前者继续干编程、智能体这类常规活,后者专门负责发现和修复软件漏洞,而且不放进普通 API,只通过一个叫 Fairwind 的受控计划,给审核通过的机构使用。这是谷歌六周内第三次更新 Flash 系列。大模型卷完"写代码",开始卷"找代码毛病"了。

技术本质:同一个底座,两种安全边界

从公开信息看,两个版本共享基础能力,差异在用途和安全设置。普通版 3.8 Flash 定位是面向编程和智能体的主力工作模型,支持文本、图片、音频、视频、PDF 输入,上下文约 100 万 token,单次最多输出约 6.5 万 token,带代码执行、函数调用、文件搜索、搜索增强和结构化输出等工具能力。价格延续 3.7 Flash:输入每百万 token 0.75 美元、输出 3.75 美元,据报道该价格执行到 2026 年底,2027 年起上调。

长任务能力是这次宣传的重点。在长周期软件工程测试 DeepSWE v1.1 上,按谷歌公布的口径,3.8 Flash 拿到 73.7%,接近 Claude Opus 5 的 74.0%,高于 GPT-5.6 Sol 的 72.7%。但同一张表也显示它并非全面领先:在更接近真实终端操作的 Terminal-bench 4.0 上只有 19.1%,而 Claude Opus 5 是 51.8%、GPT-5.6 Sol 是 37.3%。跑分这事,看哪张表差别很大。

Cyber 版则是完全围绕安全场景做的:发现漏洞、分析代码风险、生成修复补丁。谷歌公布的测试里,Cyber 版在 CyberGym 基准的 C/C++ 漏洞发现任务上 Pass@1 是 86.2%,上一代 3.5 Flash Cyber 是 77.5%;在覆盖 20 种编程语言的内部测试中,发现漏洞的成功率据报道超过 70%。外部补丁测试 CWE-Bench 上首次修复通过率 47.2%,和头部模型 Fable 5 的 47.8% 很接近,但单次成本更低。另有报道称,Chrome 安全团队实测它生成的正确修复补丁数量是此前最好商业模型的 2.6 倍,谷歌云漏洞研究团队用它在两小时内发现了一个关键漏洞——以往人类专家找这类漏洞通常要几个月。

这些数字基本是厂商口径,参考就好,但方向是明确的。

变了什么,没变什么

变的是发放方式:模型开始按风险分级。以前的安全限制主要在对话内容层面,谁都能调 API。而 Cyber 版这种能自主挖洞、写补丁的能力是典型的双用途技术,防守方能用来提前排雷,攻击方也能拿去找可利用的缺陷。所以谷歌把它放进 Fairwind 计划做受控访问:优先考虑政府和安全主管机构、医疗能源通信金融等关键基础设施运营方、影响大量下游用户的核心平台,以及做防御性评估的安全研究机构;获准机构要做身份认证、抗钓鱼多因素认证和访问控制,且不得转售共享。这套安排说明,大模型安全治理正在从"内容拒绝"转向"准入 + 审计":谁能用、模型能连什么工具、操作有没有留痕,成了新的安全机制。

没变的是老问题依然存在。谷歌模型卡自己承认,3.8 Flash 的多语言安全自动评估指标相比 3.7 Flash 回退了 5.4 个百分点(官方解释是误报居多,但值得观察);模型卡还提示高推理强度下响应可能变慢、token 消耗上升。也就是说"Flash"并不保证每种任务都快和便宜,该算的账还得算。

对普通开发者意味着什么

对我们这种实际干活的人来说,最直接的变化有两层。

第一层,便宜的长任务模型把 agent 类应用的成本门槛又压低了一截。按官方单价粗算:

# 估算一次长任务(输入50万token + 输出2万token)的裸成本,单价取官方公布值
input_price_per_m = 0.75   # 美元/百万token,输入
output_price_per_m = 3.75  # 美元/百万token,输出
cost = 0.5 * input_price_per_m + 0.02 * output_price_per_m
print(f"单次裸成本约 ${cost:.2f}")  # 单次裸成本约 $0.45

注意这没算推理等级上调和高强度工具调用带来的增量消耗。做 agent 的同学建议按"任务完成率 × 单任务实际成本"算总账,别只盯单价。

第二层,Cyber 版虽然普通开发者拿不到,但"AI 辅助挖漏洞"这个能力方向基本确定会向下渗透,变成通用安全工具能力。做安全、运维或者维护开源项目的,可以提前关注这类能力的落地节奏。想自己练,从"静态扫描工具 + 大模型辅助代码审查"的本地组合开始最省钱。另外提醒一句:挖洞能力是双刃剑,团队里引入这类工具,权限和审计流程最好先立起来——工具越强,管理越得跟上。

这周大模型发布密度很高,谷歌这次双版本、分级开放的打法能不能被验证有效,还得看 Fairwind 计划里跑出来的实际效果。你怎么看,评论区聊聊。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐