跳转到主要内容
Beehive
导航
Home 前沿动态 最后修订:2026.08.13 · 12 min

Gemini 3.7 Flash:时隔三周再迭代,编程与 Agent 能力追平旗舰,价格砍半

谷歌发布 Gemini 3.7 Flash,专为编程和 Agent 任务优化。DeepSWE v1.1 得分从 49% 飙升至 65.3%,FrontierCode 从 34.4% 提升至 43.6%,价格仅为上一代一半(输入 $0.75/M,输出 $3.75/M)。距上代 3.6 Flash 仅三周,成为谷歌 Flash 系列最强 Coding 主力模型。

前沿动态

8 月 13 日,谷歌正式发布 Gemini 3.7 Flash。距离 3.6 Flash 发布仅过去三周——这不是例行迭代,是 Flash 产品线从"便宜好用"向"跻身旗舰"的实质性跨越。

新模型专为编程和 Agent 工作流打造。在 Artificial Analysis 的 Intelligence Index 中,3.7 Flash(high) 取得 56 分,与 GPT-5.6 Terra(max)、Grok 4.5(high)、Claude Sonnet 5(max) 处于同一区间。Flash 已经不再是"平价替代品"。

三周一更,价格减半,性能追平旗舰。谷歌正在用 Flash 产品线重新定义"性价比"的含义。

性能跃升:从追赶者到并跑者

基准 3.6 Flash 3.7 Flash 提升
DeepSWE v1.1 49.0% 65.3% +16.3pp
FrontierCode 1.1 Main 34.4% 43.6% +9.2pp
WebDev Arena Elo 1538 1588 +50
GDP.pdf 22.0% 34.0% +12.0pp
AutomationBench 17.0% 30.4% +13.4pp

几个关键数据点:FrontierCode 43.6% 已略高于 Claude Sonnet 5 的 42.7% 和 GPT-5.6 Terra 的 41.3%;WebDev Arena 1588 Elo 超过 Claude Sonnet 5 的 1541 和 GPT-5.6 Terra 的 1523。Flash 已经在部分编程和网页开发测试中和旗舰模型坐到了同一张桌子。

但全面反超远未实现:DeepSWE 65.3% 仍低于 GPT-5.6 Terra 的 69.6%,Terminal-bench 85.8% 逊于后者的 87.4%。Flash 的天花板在快速提高,但天花板仍在。

Agent 能力:从对话到工作流

3.7 Flash 的核心升级不仅在代码,更在 Agent 工作流:

  • 多步骤规划:能进行更深入的"思考"链,在工具调用中展现更严谨的逻辑
  • 障碍处理:遇到失败时能自动调整策略,而非简单重试
  • 意图澄清:必要时主动询问,而非基于错误假设继续执行
  • 指令遵循:以更高的忠实度遵循复杂指令,减少人工监督

这些改进直接减少了工程工作流中的重试成本。谷歌的目标很明确:让 Flash 能独立跑完整个 Agent 流程,而非每几步就需要人工干预。

定价策略:年内五折,试探市场弹性

项目 3.6 Flash 原价 3.7 Flash 尝鲜价 2027 恢复价
输入 $1.50/M $0.75/M $1.50/M
输出 $7.50/M $3.75/M $7.50/M

截至 2026 年底的五折定价,是谷歌对市场弹性的一次试探。如果开发者因为价格迁移到 Flash 完成日常编程任务,谷歌就能用更低的算力成本维持更高的开发者黏性。反之,如果 3.7 Flash 的能力足以让开发者放弃 Pro 旗舰,那谷歌的"旗舰溢价"策略就需要重新评估。

对比 DeepSeek V4 Flash 的免费策略和 Claude Sonnet 5 的 $10/$50 定价,3.7 Flash 的 $0.75/$3.75 在中间地带找到了自己的位置——比免费模型有谷歌生态的信任背书,比旗舰模型有 5-10 倍的价格优势。

平台接入:从开发者工具到普通用户

3.7 Flash 已同步登陆多个平台:

平台 接入方式
Gemini App (Spark) 需 AI Pro 或 Ultra 订阅
Google Antigravity CLI 与 IDE 工具链
AI Studio 免费 API 接入
Android Studio 代码辅助
Gemini Enterprise 企业级 Agent 平台
Google 搜索 AI Mode 发布次日接入

最值得关注的是 Gemini Spark 的底座切换——从 3.6 Flash 切换到 3.7 Flash。这意味着数百万普通用户无需额外操作,就能体验到编程和 Agent 能力的实质性提升。Spark 用户可以用自然语言跨 Gmail、Google 日历、Google 文档执行多步骤任务。

竞品定位:Flash 的中年危机

2026 年 8 月的编程模型赛道已极度拥挤:

模型 输入价格 DeepSWE 特点
Gemini 3.7 Flash $0.75/M 65.3% 谷歌生态 + 快速迭代
GPT-5.6 Terra ~$20/M 69.6% 综合能力最强
Claude Sonnet 5 $10/M ~60% 稳定可靠
DeepSeek V4 Flash 免费 54.4% 开源 + 零成本

3.7 Flash 的生存空间在于:谷歌生态的无缝集成 + 远高于开源模型的信任背书 + 仅为闭源旗舰 1/10 到 1/20 的价格。但 DeepSeek V4 Flash 的免费策略和 Claude Sonnet 5 的可靠性口碑,让 Flash 的"性价比高"定位不再无懈可击。

深层意义:Flash 产品线的三个月进化曲线

如果把时间线拉长,Flash 的进化速度更加惊人:

时间 版本 DeepSWE WebDev Elo
2026.05 3.5 Flash 37.0% 1506
2026.07 3.6 Flash 49.0% 1538
2026.08 3.7 Flash 65.3% 1588

三个月内 DeepSWE 从 37% 涨到 65.3%,WebDev Elo 从 1506 涨到 1588。这不是渐进式改进,是每三周一次的能力跃升。谷歌将这种速度归功于开发者反馈和算法改进的快速循环——开发者发现问题 → 团队快速迭代 → 三周后新版本上线。

Gemini 3.7 Flash 的意义不在于它现在在排行榜上的位置,而在于它证明了:在 AI 模型竞争中,"快速迭代 + 激定价"的组合拳,能让一个"平价产品线"在短短三个月内逼近旗舰水平。Flash 不再是 Pro 的廉价替代品——它正在成为谷歌 AI 生态的主力。

Beehive · 蜂巢

ORIGINAL

采用 CC BY 4.0 许可协议 · 转载请注明出处

前沿动态
文章链接已复制到剪贴板