JOTO
Contact us
← AI 智库
大语言模型

Gemini 3.8 Flash 来了:价格没涨,开始死磕长任务

2026 年 9 月 3 日

Gemini 3.8 Flash 于9月2日发布,定位为保持3.7 Flash速度与单价的前提下提升长程任务能力,尤其在DeepSWE v1.1测试中达73.7%,接近Claude Opus 5;API价格暂维持每百万输入0.75美元、输出3.75美元,但因推理步数增加,实际Token消耗可能上升;同步推出仅限可信机构申请的Cyber专用版本。

便宜模型开始啃长任务了

Gemini 3.8 Flash 还保留便宜、快和高并发这些标签,但 Google 这次把发布页的大半篇幅都给了软件工程和自主 Agent。

图 1:Google 官方发布博客的 Gemini 3.8 Flash 双版本主视觉
图 1:Google 官方发布博客的 Gemini 3.8 Flash 双版本主视觉

最醒目的成绩来自 DeepSWE v1.1。这个测试看的是模型能不能在陌生代码库里持续工作,把复杂工程问题从头做到尾。

Gemini 3.8 Flash 得到 73.7%,上一版 3.7 Flash 是 65.3%。它只比 Claude Opus 5 的 74.0% 低 0.3 个百分点,同时超过了 GPT-5.6 Sol 的 72.7%。

价差却很大。Google 给出的对照表里,3.8 Flash 当前每百万输入和输出 Token 分别是 0.75 美元和 3.75 美元;Claude Opus 5 是 5 美元和 25 美元。

在更偏知识工作的测试里,它也往前挪了一截:Vals Finance Agent v2 从 59.0% 升到 61.4%,HLE-Verified 从 53.6% 升到 54.9%,Harvey 法律 Agent 测试从 8.8% 升到 10.0%。

不过,官方总表并没有一路蓝到底。

Terminal-Bench 4.0 上,3.8 Flash 只有 19.1%,Claude Opus 5 是 51.8%,GPT-5.6 Sol 是 37.3%;OSWorld 2.0 里它得到 59.0%,也落后于 Opus 5 的 75.4%。长程代码任务已经很能打,通用终端和电脑操作还没有一起冲到最前面。

图 2:Google 官方 DeepSWE v1.1 成绩和平均任务成本对照图
图 2:Google 官方 DeepSWE v1.1 成绩和平均任务成本对照图
图 3:Google 官方 Finance Agent v2 多模型成绩对照图
图 3:Google 官方 Finance Agent v2 多模型成绩对照图

价格没变,账单未必不变

Gemini 3.8 Flash 的标准 API 价格与 3.7 Flash 相同:2026 年 12 月 31 日之前,每百万输入 Token 0.75 美元,输出 Token 3.75 美元,免费层也可以使用。

这是一档限时价格。2027 年 1 月 1 日起,输入会变成 1.50 美元,输出变成 7.50 美元。

还有一个更容易被忽略的地方:Google 在公告里直接写了,3.8 Flash 会“更努力地工作”。遇到复杂任务,它会增加推理步骤,反复调用工具;把 effort 调高以后,Token 消耗也可能跟着增加。

所以单价没涨,不保证每个任务的最终账单原地不动。

如果在意的是长任务完成率,可以先试 3.8 Flash;如果业务更看重吞吐和可控成本,Google 给出的建议是降低 effort,或者继续使用仍受支持的 3.7 Flash。

官网 Demo 有点放飞

Google 这次准备了四个 Agent Demo:一个带谜题和环境叙事的 3D 巫师游戏、一套地形剖面工具、可以拆开硬件逐层查看的 3D 可视化,以及一个 DOS 版 Google Maps。

图 4:Google 官方 Gemini 3.8 Flash DOS Maps Demo 画面
图 4:Google 官方 Gemini 3.8 Flash DOS Maps Demo 画面

最后这个最有画面。

Gemini 3.8 Flash 用一条 Prompt 在 Google Antigravity 里做出了一套能玩的 DOS 地图,地点搜索、路线规划和 Street View 都能操作。巫师游戏同样从一条 Prompt 开始,再靠循环指令持续搭建关卡,纹理由 Nano Banana 生成。

这些 Demo 的重点落在持续迭代、调用工具和交出可操作成品上,和这次主推的长程 Agent 方向正好对上。

Cyber 版本先锁起来了

Gemini 3.8 Flash Cyber 与普通版使用同一套基础智能,但放宽了部分网络安全限制,专门用于漏洞发现和自动修补。

Google 称它在一套覆盖 20 种编程语言的内部漏洞测试中成功率超过 70%。这个数字属于 Cyber 版本,普通开发者现在拿到的 gemini-3.8-flash 并不是这个受限端点。

Cyber 版目前只通过 Fairwind Program 提供给可信政府机构、关键基础设施运营方和软件维护者,需要单独申请。

现在就能用

Gemini 3.8 Flash 已经是 GA 状态,输入上下文 100 万 Token,最大输出 64K Token。它支持文本、图片、音频、视频和 PDF 输入,带函数调用、代码执行、搜索和 Preview 状态的电脑操作能力。

开发者可以在 Gemini API、Google AI Studio 和 Google Antigravity 里使用;Google AI Pro 和 Ultra 用户也能在 Gemini App、Search 的 AI Mode 以及 Gemini in Sheets 中看到它。

准备把 Coding Agent 连续跑上几个小时的人,可以先看 DeepSWE 这条提升能不能落到自己的仓库里。跑大批量固定流程的人,最好顺手盯一下任务总 Token——这次 Flash 虽然没涨单价,但它确实更愿意花力气了。

JOTO 企业落地观察

  • 企业部署长程 Agent 时,需重新评估「单位任务成本」而非仅看单价:3.8 Flash 的 effort 自适应机制使 Token 消耗波动加大,需在真实业务链路中埋点监控实际消耗分布。
  • 当 RAG 知识工程与 Agent 工具链耦合加深,模型对上下文长度和多跳检索的稳定性要求提高,3.8 Flash 的 100 万 Token 输入能力成为关键门槛,但需验证其在长文档切片与跨段引用中的连贯性。
  • 安全敏感场景下,Cyber 版本的定向开放策略表明:AI 安全治理正从「模型层权限控制」转向「端点级访问隔离」,企业需提前规划合规接入路径,而非仅依赖通用模型微调。
  • Flash 系列加速向 Agent 基础设施演进,意味着 FDE 驻场共创中需更早介入任务编排设计——不是等模型能力就绪再适配流程,而是以「长程决策+工具调用」为原生约束反推业务流程重构。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.