谷歌发布Gemini 3.7 Flash:聚焦编程与智能体,首发价五折
谷歌推出Gemini 3.7 Flash,专攻编程、智能体工作流与知识型任务,API价格临时腰斩;其在FrontierCode、DeepSWE及AutomationBench等基准中显著提升,但未全面超越竞品;企业需验证其在真实工作流中降低重试与人工监督的实际效果。

谷歌正在 推出Gemini 3.7 Flash,这是其主力AI模型的新版本,此次升级以编程、智能体(agentic)工作流和知识型工作为核心,同时暂时将API价格下调一半。
此次发布距离 Gemini 3.6 Flash的发布仅过去三周,这一异常短的迭代周期被谷歌归因于开发者反馈与算法改进。
对于企业开发者而言,更关键的故事或许是这些智能提升与更低推理成本的结合:截至2026年底, Gemini 3.7 Flash的输入令牌价格为每百万0.75美元,输出令牌价格为每百万3.75美元。

谷歌Gemini 3.7 Flash定价图表。图片来源:谷歌
自2027年1月1日起,定价将上调至每百万输入令牌1.50美元、每百万输出令牌7.50美元。这意味着当前折扣为临时性措施,但可为企业部署高吞吐量编程及业务智能体提供数月时间,以评估谷歌所宣称的重试次数减少与人工监督需求降低是否能切实转化为更低的总体运营成本。
此次发布还凸显了谷歌在Flash系列模型上的快速迭代节奏,而其下一代旗舰Pro模型却仍缺席。路透社报道称,谷歌在周四的公告中并未提供Gemini 3.5 Pro的发布日期,尽管该模型此前曾被描述为正处于合作伙伴测试阶段。Axios同样指出,3.7 Flash的发布早于预期中的Pro版本。
为期三周、聚焦任务完成的升级
谷歌将Gemini 3.7 Flash描述为其“迄今最智能的编程与智能体主力模型”。该公司表示,该模型在遭遇障碍时具备更强的适应能力,在必要时能更清晰地澄清用户意图,并以更高保真度遵循指令。
这些改进的意义远超基准测试分数。在企业级编程智能体中,一个做出更少非必要修改、能从错误中恢复、并更可靠执行多步骤计划的模型,可减少完成某项任务所需的人工干预次数。同一原理亦适用于跨文档与应用程序运行的业务智能体——其中一次错误的工具调用或对指令的误解读,都可能使原本有用的工作流中途失败。
谷歌称3.7 Flash“思考更为审慎”,在多步骤规划与工具调用上投入更多努力。其既定目标是实现更严谨的执行过程,减少重试次数与人工监督需求。
这代表了相较于Gemini 3.6 Flash的一项有趣演进。谷歌开发者文档将3.6版描述为相比早期模型减少了推理步骤、对话轮次与工具调用次数,同时力求限制执行循环失控(execution-loop spiraling)。而在3.7版中,重点转向在规划阶段投入充分努力,同时提升执行质量——这或许比单纯最小化智能体所采取的步骤数量更具实用价值。
谷歌DeepMind在随发布附带的一篇博文中表示,3.7 Flash在调试与问题解决方面表现提升,能以更少提示生成功能更强的网页布局与应用,并在真实世界业务工作流中提升了推理能力与准确性。
编程能力提升显著,但并非普遍适用
谷歌的基准测试显示,该模型在多项软件工程测试中实现了显著的代际提升。
在衡量生产代码质量的FrontierCode 1.1 Main测试中,Gemini 3.7 Flash得分为43.6%,高于Gemini 3.6 Flash的34.4%。该得分也略高于谷歌报告的Claude Sonnet 5的42.7%以及GPT-5.6 Terra的41.3%。
在长期视野软件工程评估DeepSWE v1.1中,3.7 Flash达到65.3%,而其前代版本为49.0%。在谷歌的对比表格中,GPT-5.6 Terra仍以69.6%领先。
网页开发领域亦呈现另一项显著提升。Gemini 3.7 Flash在Code Arena上的Elo评分为1588,高于3.6 Flash的1538、Claude Sonnet 5的1541以及GPT-5.6 Terra的1523。谷歌表示,新模型能在更少提示下生成功能更强的布局与功能完备的应用程序,同时更紧密地遵循参考截图、图像与设计系统。
更广泛的基准测试表结果则更为参差,这对正针对特定工作负载而非寻求单一“最佳”模型的企业评估者而言至关重要。
Gemini 3.7 Flash在Terminal-bench 2.1上得分为85.8%,低于GPT-5.6 Terra的87.4%。在谷歌的对比中,Terra在Terminal-bench 3.0与OSWorld-2.0上亦保持领先。Claude Sonnet 5在“智能体最终考试”(Agent's Last Exam)多模态桌面与操作系统任务中以33.3%的通过率领先,而Gemini 3.7 Flash为26.3%。
换言之,谷歌自身的结果并未显示3.7 Flash在所有场景下均能取代更高价的竞品。相反,这些结果表明该模型在编程与智能体工作负载方面已变得明显更具竞争力,同时处于更低的价格层级。
企业工作流或将成为更重要的检验标准
这些提升已延伸至软件开发之外。

Gemini 3.7基准对比完整图表。图片来源:谷歌
在谷歌描述为衡量企业工作流自动化的AutomationBench测试中,Gemini 3.7 Flash得分为30.4%,较3.6 Flash的17.0%大幅上升。谷歌的表格中列出Claude Sonnet 5为10.7%,GPT-5.6 Terra为23.6%。
该模型在复杂PDF理解评估GDP.PDF上亦达34.0%,高于3.6 Flash的22.0%、Claude Sonnet 5的28.0%以及GPT-5.6 Terra的24.7%。
这种组合对企业智能体具有相关性,因为许多实际部署不仅需要生成文本或代码。智能体可能需解读长篇报告、识别相关信息、决定调用哪个工具、更新另一系统,并为人工审核者生成文档。整个链条的可靠性可能比孤立推理基准测试中的性能更为重要。
谷歌正通过Gemini Spark将这一论点付诸实践。Google AI Pro与Ultra订阅用户可在Spark(该公司个人AI智能体)中使用3.7 Flash。谷歌表示,此次升级提升了Spark在Google Workspace应用中的知识型工作能力与工具使用能力,包括整合文件、草拟邮件及更新状态文档等工作流。
对企业客户而言,3.7 Flash亦可通过Gemini Enterprise Agent Platform与Gemini Enterprise应用获取。
价格已成为模型竞争的一部分
Gemini 3.7 Flash的首发定价是一项引人注目的举措,旨在将该模型嵌入企业工作流。
截至12月31日,开发者需支付每百万输入令牌0.75美元、每百万输出令牌3.75美元。上下文缓存(context caching)在首发期间为每百万令牌0.075美元。谷歌表示,标准价格将于2027年1月1日起翻倍,即输入令牌升至每百万1.50美元、输出令牌升至每百万7.50美元,上下文缓存则升至每百万0.15美元。
作为对比,Gemini 3.6 Flash的标准API定价为每百万输入令牌1.50美元、每百万输出令牌7.50美元。谷歌的基准测试表中列出Claude Sonnet 5分别为2美元与10美元,GPT-5.6 Terra则为2美元与12美元。
自主智能体的经济性问题变得更加突出,因为单个用户请求可能触发一长串模型调用、推理 token 以及工具交互。一款每 token 成本更低但需要大幅增加重试次数的模型,最终未必更便宜。
相反,谷歌较低的入门级 token 定价组合其宣称的首次通过准确率提升,若这些优势能延续至生产环境,则可能实质性改变高吞吐量编程或文档处理智能体的运行成本。
这正是企业团队最终必须测试的关键指标:不是孤立地看每百万 token 的价格,而是每次成功完成任务的成本。
谷歌的 AI 重组提升了 Gemini 的竞争 stakes(赌注)。
Gemini 3.7 Flash 的发布正值一场更广泛的辩论之中——即谷歌是否正在 AI 前沿阵地失守。该公司迄今尚未发布 Gemini 3.5 Pro,尽管其曾在五月表示该旗舰模型将于次月推出。
到了七月,谷歌表示该模型仍处于合作伙伴测试阶段,并称将在准备就绪后全面开放;周四的公告并未提供进一步的时间表。因此,谷歌最新发布的通用型 Pro 模型仍是 Gemini 3.1 Pro,该模型于二月发布。
路透社七月报道称,Gemini 3.5 Pro 错过了其原定目标 ,因其未能达到内部设定的目标,尤其是在编程能力方面;与此同时,谷歌已开始训练其迄今所称最具雄心的模型 Gemini 4。
此次延迟恰逢谷歌上周宣布对其 AI 领导层进行 一次重大改组。
Google DeepMind 联合创始人兼诺贝尔奖得主 Demis Hassabis 已 relinquish(放弃)对该公司著名 DeepMind AI 部门的日常管控权,转任该部门主席,并同时出任 Alphabet 首席科学家。
与此同时,前 DeepMind 首席技术官 Koray Kavukcuoglu 现以高级副总裁身份直接向 CEO Sundar Pichai 汇报,负责管理该部门。
Kavukcuoglu 掌控 Gemini 模型开发、前沿研究、Gemini 应用程序及开发者团队——实质上将整个 Gemini 产品链整合至一位更侧重产品落地的负责人之下。
首席科学家 Jeff Dean、Gemini 联合负责人 Oriol Vinyals、Quoc Le 和 Sanjay Ghemawat 离职创办了 研究型初创公司 Discovery Loop。
这些离职事件紧随 Gemini 联合负责人 Noam Shazeer 加入 OpenAI,以及曾获诺贝尔奖的 AlphaFold 科学家 John Jumper 离职加入 Anthropic 之后。 路透社报道称 ,内部意见分歧、受限的算力分配以及谷歌的官僚体制,共同导致了模型发布节奏放缓及编程能力薄弱。
外界解读从组织修复到更根本性的战略退却不一而足。
SemiAnalysis 曾指出 ,谷歌正日益优先发展向 AI 公司(包括 Gemini 竞争对手)供应云基础设施这一利润极高的业务,而非持续确保自身模型始终处于绝对前沿。该分析还声称谷歌实际上已取消 Gemini 3.5 Pro,尽管谷歌未予证实,且仍将其描述为‘延迟发布’。
《The Verge》则给出了更为审慎的评估:人员流失与模型延迟确属严重问题,但谷歌仍凭借搜索(Search)、Workspace、Android、云服务(Cloud)、定制 AI 芯片及消费者分发渠道保有巨大优势。谷歌表示 Gemini 应用程序月活跃用户已突破 9.5 亿,使其影响力并不完全依赖于拥有得分最高的模型。
当前基准测试同样描绘出一家虽落后于整体领先者但仍具稳固竞争力的公司。Artificial Analysis 在其综合模型 Intelligence Index(智能指数)中将 Claude Opus 5 排名定为 63,而谷歌报告 Gemini 3.7 Flash 得分为 56——较 Gemini 3.6 Flash 的 52 分有所提升,但尚未重返榜首。
Arena 的早期人类偏好测试结果则更为有利,暂将 Gemini 3.7 Flash 排名列为综合第九、网页开发第八。
由此呈现的图景并非谷歌已放弃先进 AI,而是其在快速交付高效 Flash 模型方面愈发强劲,却在推出足以重夺广泛领导地位的高端旗舰模型方面遭遇困难。Gemini 4 将成为最清晰的检验——即此次领导层重组能否弥合这一执行差距。
即日起面向谷歌全部开发者技术栈开放
开发者可通过 Google AI Studio 和 Android Studio 中的 Gemini API,以及谷歌的 Antigravity 环境访问 Gemini 3.7 Flash;企业客户可通过 Gemini Enterprise Agent Platform 和 Gemini Enterprise 部署该模型;而订阅 Google AI Pro 或 Ultra 的消费者可在支持国家通过 Spark 访问该模型。
据该公司称,谷歌亦同步推出更新的安全防护措施,覆盖化学、生物、放射性与核风险,以及网络攻击滥用风险。
从 Gemini 3.6 Flash 到 3.7 Flash 异常迅速的跃升,表明一种模型开发周期——即算法改进可无需等待新一代旗舰模型发布,即可直接投入生产产品。Ars Technica 亦强调了两次发布之间仅相隔三周,而谷歌表示本次更新背后的技术将为未来模型提供参考。
对开发者而言,这种更快的发布节奏本身即引发一项运营问题:模型可快速迭代升级,但生产团队仍需在变更部署前,针对自身代码库、提示词(prompts)、工具模式(tool schemas)及失败场景(failure modes)对新版本进行全面基准测试。
Gemini 3.7 Flash 为此类团队提供了尤为强烈的动力去执行该评估。谷歌自身数据显示,该模型在生产级编程、网页开发、文档理解及工作流自动化方面均有显著提升,虽未宣称在所有领域均居领先地位。在其入门定价下,谷歌实质上是在押注:开发者将看重这样一款模型——它既具备足够竞争力以媲美更昂贵系统,又足够廉价,可反复在智能体内部运行。
该优势能否在明年一月恢复全价后持续存在,将更多取决于 Gemini 3.7 Flash 完成实际工作的可靠性,而非排行榜上的名次。
JOTO 企业落地观察
- 对企业部署而言,0.75美元/百万输入令牌的限时定价,配合AutomationBench得分从17.0%跃升至30.4%,意味着企业可低成本试运行高吞吐量文档理解与跨应用智能体,但需在2026年底前完成成本-可靠性实证,因2027年起价格翻倍。
- 对智能体工程而言,3.7 Flash强调‘审慎思考’与多步规划强化,而非单纯减少工具调用次数——这要求开发者重构提示词与失败回退机制,尤其需测试其在PDF解析(GDP.PDF+12个百分点)与长链工具调用中的稳定性,而非仅依赖单轮推理指标。
- 对AI安全治理而言,谷歌同步更新化学、生物、核及网络攻击滥用防护策略,但全文未说明该模型是否通过第三方红队评估或具备可审计的拒绝响应日志;其作为Gemini Enterprise Agent Platform默认模型,将直接嵌入企业敏感业务流,安全能力需随实际调用场景验证。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


