
谷歌周四发布了 Gemini 3.7 Flash,距 Gemini 3.6 Flash 发布仅三周,而 3.6 Flash 又是在七月紧随 3.5 Flash 推出的。谷歌称,新模型是其面向编程和智能体最强大的主力模型,基于开发者反馈和算法改进打造,而非彻底的架构重构。
最显著的改进集中在软件工程领域。在 DeepSWE v1.1 上,这一衡量模型解决真实世界编程问题能力的长时程基准测试中,3.7 Flash 得分 65.3%,而 3.6 Flash 为 49.0%,提升了超过 16 个百分点。在评估生产代码质量的 FrontierCode 1.1 Main 上,得分从 34.4% 提高到 43.6%。谷歌将这一进步归因于更强的调试与问题解决能力、更高的首次通过准确率,以及更有条理的多步规划。
知识工作表现也有所提升。该模型在衡量真实世界业务流程的基准测试 AutomationBench 上的得分几乎翻倍,从 17.0% 升至 30.4%;在覆盖金融、法律和生物科学材料的复杂文档处理测试 GDP.pdf 上,得分从 22.0% 升至 34.0%。在网页开发方面,其 WebDev Arena Elo 评分从 1538 升至 1588。谷歌表示,该模型用更少的提示词就能生成功能更完整的布局和应用,并能依据参考截图、图片或设计系统遵循设计要求。
定价同样引人注目。谷歌推出优惠价格,每百万输入 token 0.75 美元、每百万输出 token 3.75 美元,持续到今年年底,相当于 3.6 Flash 首发价格的一半;标准价格每百万 1.50 美元和 7.50 美元将于一月起生效。这使得该模型在发布时的单位 token 价格低于其前代。
可用渠道涵盖 Gemini API 和 AI Studio、Android Studio、面向智能体优先工作流的 Google Antigravity,以及 Gemini Enterprise Agent Platform 和 Gemini 应用。谷歌在 I/O 大会上推出的个人智能体 Gemini 应用 Spark 套餐,面向超过 160 个国家的 AI Pro 和 Ultra 订阅用户,自周四起开放新模型使用权限。谷歌还提到,新模型在 Google Workspace 中的工具使用能力有所提升,多步任务的准确率也更高。
该模型搭载了更新的前沿安全防护措施,旨在防范 CBRN(化学、生物、放射、核)和网络攻击领域的滥用,这与 DeepMind 的生物韧性(bioresilience)方法和其网络安全项目相一致。谷歌发布了包含详细信息的模型卡。
婷 翻译
Sources: Introducing Gemini 3.7 Flash: our most intelligent workhorse model (Google, Aug 13, 2026); Gemini 3.7 Flash launches three weeks after last model, live in Spark (9to5Google, Aug 13, 2026); Google unveils Gemini 3.7 Flash AI model for coding and agent workflows (Reuters, Aug 13, 2026); Google announces Gemini 3.7 Flash just three weeks after previous release (Ars Technica, Aug 13, 2026)

