Gemini 3.8 Flash 来了:价格没涨,开始死磕长任务
Gemini 3.8 Flash 于9月2日发布,定位为保持3.7 Flash速度与单价的前提下提升长程任务能力,尤其在DeepSWE v1.1测试中达73.7%,接近Claude Opus 5;API价格暂维持每百万输入0.75美元、输出3.75美元,但因推理步数增加,实际Token消耗可能上升;同步推出仅限可信机构申请的Cyber专用版本。
便宜模型开始啃长任务了
Gemini 3.8 Flash 还保留便宜、快和高并发这些标签,但 Google 这次把发布页的大半篇幅都给了软件工程和自主 Agent。

最醒目的成绩来自 DeepSWE v1.1。这个测试看的是模型能不能在陌生代码库里持续工作,把复杂工程问题从头做到尾。
Gemini 3.8 Flash 得到 73.7%,上一版 3.7 Flash 是 65.3%。它只比 Claude Opus 5 的 74.0% 低 0.3 个百分点,同时超过了 GPT-5.6 Sol 的 72.7%。
价差却很大。Google 给出的对照表里,3.8 Flash 当前每百万输入和输出 Token 分别是 0.75 美元和 3.75 美元;Claude Opus 5 是 5 美元和 25 美元。
在更偏知识工作的测试里,它也往前挪了一截:Vals Finance Agent v2 从 59.0% 升到 61.4%,HLE-Verified 从 53.6% 升到 54.9%,Harvey 法律 Agent 测试从 8.8% 升到 10.0%。
不过,官方总表并没有一路蓝到底。
Terminal-Bench 4.0 上,3.8 Flash 只有 19.1%,Claude Opus 5 是 51.8%,GPT-5.6 Sol 是 37.3%;OSWorld 2.0 里它得到 59.0%,也落后于 Opus 5 的 75.4%。长程代码任务已经很能打,通用终端和电脑操作还没有一起冲到最前面。


价格没变,账单未必不变
Gemini 3.8 Flash 的标准 API 价格与 3.7 Flash 相同:2026 年 12 月 31 日之前,每百万输入 Token 0.75 美元,输出 Token 3.75 美元,免费层也可以使用。
这是一档限时价格。2027 年 1 月 1 日起,输入会变成 1.50 美元,输出变成 7.50 美元。
还有一个更容易被忽略的地方:Google 在公告里直接写了,3.8 Flash 会“更努力地工作”。遇到复杂任务,它会增加推理步骤,反复调用工具;把 effort 调高以后,Token 消耗也可能跟着增加。
所以单价没涨,不保证每个任务的最终账单原地不动。
如果在意的是长任务完成率,可以先试 3.8 Flash;如果业务更看重吞吐和可控成本,Google 给出的建议是降低 effort,或者继续使用仍受支持的 3.7 Flash。
官网 Demo 有点放飞
Google 这次准备了四个 Agent Demo:一个带谜题和环境叙事的 3D 巫师游戏、一套地形剖面工具、可以拆开硬件逐层查看的 3D 可视化,以及一个 DOS 版 Google Maps。

最后这个最有画面。
Gemini 3.8 Flash 用一条 Prompt 在 Google Antigravity 里做出了一套能玩的 DOS 地图,地点搜索、路线规划和 Street View 都能操作。巫师游戏同样从一条 Prompt 开始,再靠循环指令持续搭建关卡,纹理由 Nano Banana 生成。
这些 Demo 的重点落在持续迭代、调用工具和交出可操作成品上,和这次主推的长程 Agent 方向正好对上。
Cyber 版本先锁起来了
Gemini 3.8 Flash Cyber 与普通版使用同一套基础智能,但放宽了部分网络安全限制,专门用于漏洞发现和自动修补。
Google 称它在一套覆盖 20 种编程语言的内部漏洞测试中成功率超过 70%。这个数字属于 Cyber 版本,普通开发者现在拿到的 gemini-3.8-flash 并不是这个受限端点。
Cyber 版目前只通过 Fairwind Program 提供给可信政府机构、关键基础设施运营方和软件维护者,需要单独申请。
现在就能用
Gemini 3.8 Flash 已经是 GA 状态,输入上下文 100 万 Token,最大输出 64K Token。它支持文本、图片、音频、视频和 PDF 输入,带函数调用、代码执行、搜索和 Preview 状态的电脑操作能力。
开发者可以在 Gemini API、Google AI Studio 和 Google Antigravity 里使用;Google AI Pro 和 Ultra 用户也能在 Gemini App、Search 的 AI Mode 以及 Gemini in Sheets 中看到它。
准备把 Coding Agent 连续跑上几个小时的人,可以先看 DeepSWE 这条提升能不能落到自己的仓库里。跑大批量固定流程的人,最好顺手盯一下任务总 Token——这次 Flash 虽然没涨单价,但它确实更愿意花力气了。
JOTO 企业落地观察
- 企业部署长程 Agent 时,需重新评估「单位任务成本」而非仅看单价:3.8 Flash 的 effort 自适应机制使 Token 消耗波动加大,需在真实业务链路中埋点监控实际消耗分布。
- 当 RAG 知识工程与 Agent 工具链耦合加深,模型对上下文长度和多跳检索的稳定性要求提高,3.8 Flash 的 100 万 Token 输入能力成为关键门槛,但需验证其在长文档切片与跨段引用中的连贯性。
- 安全敏感场景下,Cyber 版本的定向开放策略表明:AI 安全治理正从「模型层权限控制」转向「端点级访问隔离」,企业需提前规划合规接入路径,而非仅依赖通用模型微调。
- Flash 系列加速向 Agent 基础设施演进,意味着 FDE 驻场共创中需更早介入任务编排设计——不是等模型能力就绪再适配流程,而是以「长程决策+工具调用」为原生约束反推业务流程重构。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


