发布日期:2026年8月14日
数据来源:Google DeepMind公开信息整理
关键词:Gemini 3.7 Flash、Google AI、AI Agent、代码生成、大模型API

2026年8月13日,Google DeepMind正式推出Gemini 3.7 Flash。

作为Gemini Flash系列的新版本,3.7 Flash并没有采用单纯扩大模型规模的路线,而是将优化重点放在实际任务执行能力上,包括代码开发、多步骤Agent任务以及专业知识处理。

此次更新距离上一代Gemini 3.6 Flash发布仅约三周,更新节奏明显加快。

从公开测试数据来看,Gemini 3.7 Flash在编程和自动化任务方面取得较大提升:

  • FrontierCode 1.1测试达到43.6%;
  • DeepSWE v1.1达到65.3%;
  • AutomationBench提升至30.4%。

其中FrontierCode 1.1成绩超过Claude Sonnet 5和GPT-5.6 Terra,显示Google正在进一步强化Flash系列在开发者场景中的竞争力。


一、Gemini 3.7 Flash核心变化:从聊天模型向任务执行模型发展

过去,Flash系列模型主要强调:

  • 响应速度;
  • 较低调用成本;
  • 日常AI任务处理能力。

而Gemini 3.7 Flash的升级方向更加偏向Agent应用。

此次主要提升集中在三个方面:

1. 编程能力增强

对于开发者而言,模型是否能够完成真实工程任务,比简单生成代码更加重要。

Gemini 3.7 Flash重点优化:

  • 代码理解;
  • Debug分析;
  • Web应用生成;
  • 前端页面还原;
  • 项目级代码修改。

模型目标从“回答代码问题”逐渐转向“辅助完成开发流程”。


2. Agent任务执行能力提升

AI Agent需要持续执行多个步骤。

例如:

分析需求 → 制定方案 → 调用工具 → 修改文件 → 验证结果。

在这一过程中,模型容易出现:

  • 步骤遗漏;
  • 工具调用失败;
  • 无限循环。

Gemini 3.7 Flash针对这些问题进行了优化,提高了多步骤任务执行稳定性。


3. 专业知识处理能力改善

除了代码领域,Gemini 3.7 Flash在知识型任务中也有所提升。

例如Harvey LAB-AA专业知识测试:

Gemini 3.7 Flash:

90.7%

超过:

  • Claude Sonnet 5:90.1%
  • GPT-5.6 Terra:85.2%

这说明Flash系列正在从轻量级问答模型向综合任务助手方向发展。


二、基准测试表现:编程和自动化任务优势明显

Google公布的测试数据主要覆盖:

  • 编程能力;
  • 软件工程Agent;
  • 自动化执行;
  • 长流程任务。

Gemini 3.6 → Gemini 3.7升级变化

测试项目 Gemini 3.6 Flash Gemini 3.7 Flash 提升
FrontierCode 1.1 34.4% 43.6% +9.2个百分点
DeepSWE v1.1 49.0% 65.3% +16.3个百分点
WebDev Arena 1538 1588 +50
AutomationBench 17.0% 30.4% +13.4个百分点

可以看到,软件开发相关能力提升最明显。

尤其DeepSWE v1.1,从49.0提升至65.3%,说明模型对于工程任务理解能力增强。


三、与主流模型对比:不同模型侧重点不同

目前AI编程模型竞争已经从单纯比较代码生成能力,转向比较完整Agent能力。

部分公开数据:

测试项目 Gemini 3.7 Flash Claude Sonnet 5 GPT-5.6 Terra
FrontierCode 1.1 43.6% 42.7% 41.3%
DeepSWE v1.1 65.3% 53.8% 69.6%
AutomationBench 30.4% 10.7% 23.6%
Terminal-Bench 2.1 85.8% - 87.4%

从结果来看:

Gemini 3.7 Flash:

  • 编程生成能力突出;
  • 自动化任务表现领先;
  • Web开发场景优势明显。

GPT-5.6 Terra:

  • 软件工程复杂任务仍保持较强优势。

Claude Sonnet 5:

  • 在部分代码任务中表现稳定。

不同模型并不存在绝对替代关系,需要根据实际应用场景选择。


四、模型规格:1M上下文与thinking模式

Gemini 3.7 Flash延续了大上下文能力。

公开信息显示:

上下文窗口:

1M tokens

最大输出:

64K tokens

同时新增三档推理模式:

  • low;
  • medium;
  • high。

不同模式对应不同任务。

low模式

适合:

  • 简单问答;
  • 内容整理;
  • 数据格式转换。

优势:

响应速度快,资源消耗低。


medium模式

适合:

  • 代码分析;
  • Agent任务;
  • 多步骤处理。

属于日常开发推荐模式。


high模式

适合:

  • 复杂算法;
  • 系统设计;
  • 深度推理任务。

但调用成本和时间也会增加。


五、API接口变化:Interactions API成为新的推荐方式

Gemini 3.7 Flash同步推出新的Interactions API。

相比传统Chat Completions模式,新接口更加适配Agent应用。

主要变化包括:

1. 推理控制方式调整

过去:

通过temperature、top_p等参数调整。

现在:

通过thinking_level控制:

  • low;
  • medium;
  • high。

2. 多轮任务管理优化

传统方式需要客户端维护完整消息记录。

新方式支持通过interaction ID管理上下文。

对于长期运行的Agent任务,这种设计更加方便。


3. 更适合工具调用场景

Interactions API更加接近:

  • 自动执行;
  • 工具调用;
  • 长流程任务。

这也是Google向Agent生态发展的信号。


六、Gemini 3.7 Flash与DeepSeek V4 Pro对比

2026年8月,多款国产与海外模型同步升级。

Gemini 3.7 Flash和DeepSeek V4 Pro都是当前开发者关注的模型。

简单比较:

维度 Gemini 3.7 Flash DeepSeek V4 Pro
上下文 1M tokens 1M tokens
最大输出 64K tokens 384K tokens
DeepSWE 65.3% 62.7%
特点 Agent生态、代码能力 长输出、成本优势

如果关注:

  • Google生态;
  • 多模态能力;
  • Agent工具链;

Gemini 3.7 Flash具有优势。

如果关注:

  • 长文本输出;
  • API成本;
  • 国产模型生态;

DeepSeek V4 Pro也是一个选择。


七、API统一管理成为多模型使用趋势

随着模型数量增加,开发团队面临的问题也逐渐变化。

以前:

选择一个模型即可。

现在:

一个项目可能同时需要:

  • 编程模型;
  • 推理模型;
  • 多模态模型。

因此,统一API管理方式开始受到关注。

例如4SAPI这类模型接口聚合平台,可以帮助开发者通过统一入口调用不同模型。

这种方式主要价值在于:

  • 减少多个平台切换成本;
  • 统一管理API接口;
  • 根据任务选择不同模型。

近期DeepSeek系列模型价格调整,也让部分开发者重新评估模型调用成本。

通过API聚合方式,可以根据实际需求灵活选择模型,在性能、稳定性和成本之间寻找更合适的组合。


八、Gemini 3.7 Flash适合哪些使用场景?

从目前公开能力来看,比较适合:

1. AI编程辅助

例如:

  • 代码生成;
  • Bug分析;
  • 项目理解;
  • 自动化开发。

2. 企业Agent应用

例如:

  • 自动处理业务流程;
  • 文档分析;
  • 数据整理;
  • 工具调用。

3. 多模态应用

Gemini系列长期布局多模态能力。

3.7 Flash支持文本、图片、视频、音频等输入形式,适合构建综合型AI应用。


九、开发者使用时需要注意的问题

虽然Gemini 3.7 Flash能力提升明显,但实际应用仍需要考虑工程因素。

1. 接口迁移

如果原项目使用旧版接口,需要注意:

  • 参数变化;
  • SDK更新;
  • 调用方式调整。

2. 成本控制

Agent任务通常比普通聊天消耗更多Token。

需要关注:

  • 请求频率;
  • 上下文长度;
  • 推理模式选择。

3. 权限管理

如果用于代码Agent,需要控制:

  • 文件访问权限;
  • 工具执行权限;
  • 数据安全范围。

总结

Gemini 3.7 Flash的发布,体现了Google对于AI Agent方向的进一步投入。

此次升级重点不在模型规模,而在真实任务完成能力。

从公开测试来看:

  • FrontierCode 1.1达到43.6%;
  • DeepSWE v1.1达到65.3%;
  • AutomationBench提升明显。

同时,Interactions API的推出,也代表Google正在围绕Agent重新设计模型调用方式。

未来开发者选择大模型时,除了关注单项能力,还需要综合考虑:

  • 模型性能;
  • API成本;
  • 工程接入难度;
  • 长期维护成本。

Gemini 3.7 Flash、DeepSeek V4 Pro以及其他主流模型之间的竞争,也将推动AI开发生态进一步成熟。

本文内容整理截至2026年8月14日,模型价格、接口能力及官方政策请以Google AI开发平台后续公告为准。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐