DeepSeek-V4-Flash 正式版深度解读:Agent 能力暴涨 7 倍,价格却只有 GPT-5.6 的 1/40
2026年7月31日,DeepSeek-V4-Flash 正式版上线。130亿激活参数跑出 Agent 能力暴涨7倍,价格仅 GPT-5.6 的 1/40。连续14周中国模型调用量碾压美国,全球前五全是国产。一文读懂这场\x26quot;小马拉大车\x26quot;的技术革命。
本文基于 DeepSeek 官方公告、Artificial Analysis 数据及开发者实测整理。
🔥 引子:一份让硅谷睡不着觉的成绩单
2026 年 8 月 3 日,一份全球 AI 大模型周调用量榜单在开发者社区炸开了锅。
中国 AI 大模型周调用量,连续第 14 周超过美国。 上周全球总调用量 56.8 万亿 Token,排名前五的模型——全部来自中国。
排在第一的,是 7 月 31 日刚刚发布正式版的 DeepSeek-V4-Flash:7.22 万亿 Token 周调用量,环比增长 13%。
这个数字本身已经够震撼了。但真正让硅谷坐不住的,是另一组数据:
• DeepSWE 基准从 7.3 飙到 54.4——暴涨近 7 倍 • Agent Last Exam 25.2 分,逼近 Anthropic 旗舰 Opus 4.8 的 25.7 分 • 缓存命中价格 $0.0028/百万 Token,比 GPT-5.6 Luna 便宜两个数量级 • 2000 万 Token 的 Agent 任务,折前只要 $3.5
130 亿激活参数,打出了 7440 亿总参数模型的效果。价格,只有对手的四十分之一。
这不是"追上了"——这是重新定义了游戏规则。
📊 现状分析:正式版到底改了什么
架构一览:MoE 的极致效率
DeepSeek-V4-Flash 正式版沿用了 MoE(混合专家)架构,核心参数如下:
| 总参数 | |||
| 激活参数 | |||
| 上下文长度 | |||
| 架构 | |||
| 推理模式 |
🧠 类比理解:如果把大模型比作一家公司,总参数是"员工总数",激活参数是"每次开会实际到场的人数"。GLM-5.2 有 7440 名员工、每次 400 人开会;V4-Flash 只有 2840 名员工、每次 130 人开会——但开出来的会,效果不相上下。这就是 MoE 架构的精髓:不是所有人都要上班,但每次上班的都是最对的人。
正式版的关键变化
官方明确表示,正式版仅重新进行了后训练(post-training),模型底座参数没有变化。但这步"后训练",效果却是脱胎换骨的:
| Terminal Bench 2.1 | 82.7 | ||
| DeepSWE | 54.4 | +645%(近7倍) | |
| Artificial Analysis 智能指数 | 50 分 |
后训练做到这个程度,说明 DeepSeek 在强化学习对齐和 Agent 行为塑造上,已经有了非常成熟的方法论。底座不变、能力暴涨——这不是"换了个模型",是"同一个人去了趟训练营,回来变了个人"。
🧩 核心论点拆解
🏆 维度一:性能跃迁——130 亿激活参数,凭什么打出旗舰效果

先看完整的官方基准测试成绩:
| Terminal Bench 2.1 | |||
| DeepSWE | |||
| NL2Repo | |||
| Cybergym | |||
| Toolathlon-Verified | |||
| Agent Last Exam | |||
| Automation Bench Public | |||
| DSBench-FullStack | |||
| DSBench-Hard |
最值得关注的是 Agent Last Exam——这个基准被公认为衡量 AI Agent 综合能力的"高考":
| Opus 4.8 | |||
| V4-Flash 正式版 | 25.2 | 130 亿 | |
| V4-Pro 预览版 |
V4-Flash 以 130 亿激活参数,打出了 25.2 分——只比 Anthropic 的旗舰 Opus 4.8 低 0.5 分,却比自家的 V4-Pro 预览版高出 9.4 分。

再看 Artificial Analysis 智能指数,这是业界最权威的综合能力评分之一:
| V4-Flash 正式版 | 50 分 | |
50 分 vs 51 分——差距只有 1 分。但 V4-Flash 的价格,是 Luna 的四十分之一。
一个类比:这就像一辆 1.5T 排量的车,在赛道上跑出了接近 V8 跑车的圈速。不是排量决定一切——是效率工程决定一切。
💰 维度二:价格屠夫——重新理解 AI 推理经济学
先看 V4-Flash 正式版的完整定价:
| 缓存命中 | $0.0028 | |
| 缓存未命中 | ||
| 输出 |
这个价格意味着什么?来做一个单任务成本对比:
| V4-Flash(折前) | ~$3.5 | |
| V4-Flash(98%缓存命中) | ~$0.8 | |
即使 GPT-5.6 Luna 降价 80%,V4-Flash 的单任务成本仍然低约 60%。
更关键的是缓存命中折扣的差异:
| DeepSeek | 98% | |
| 8 个百分点 |
💡 为什么 98% 缓存折扣这么重要? Agent 任务的特点是"多轮对话+大量重复上下文"——系统提示、工具定义、历史消息在每一轮都会被重新发送。如果缓存命中率高(Agent 场景通常 95% 以上),那 98% 的折扣意味着:你只在 2% 的 Token 上付全价,其余几乎免费。8 个百分点的差距,在大规模调用下就是真金白银。
来看一个具体场景:一个企业每天跑 1000 次 Agent 任务,每次 2000 万 Token,98% 缓存命中:

| V4-Flash | ~$800 | ~$24,000 | ~$292,000 |
一年省下 300 万美元。 这不是"省了一点"——这是"省出了一整个团队的成本"。
🤖 维度三:Agent 时代——从“能聊”到“能干”的质变

DeepSWE 从 7.3 飙到 54.4,这个数字需要放在具体场景里才能感受到它的分量。
DeepSWE 测的是什么?是让 AI 像一个真正的软件工程师一样,独立完成从理解需求到修改代码到运行测试的全流程。7.3 分意味着"基本干不了";54.4 分意味着"能独立完成相当一部分工程任务"。
来看两位开发者的实测对比:
| 任务完成时间 | 40 秒 | ||
| 开发者 |
⚡ 张泽的实测说明:在特定 Agent 任务上,V4-Flash 不仅更便宜,还更快。130 亿激活参数的低推理延迟,在实时交互场景中是巨大优势。
开发者孙涛的评价更为中肯:
| 整体水平 | ||
| 对比 GPT-5.6 | ||
| 优势方向 |
这个评价非常务实——V4-Flash 不是"全面超越 GPT-5.6",但在推理、代码、长文档三个方向上,已经具备和旗舰模型掰手腕的能力,而且价格只有对方的零头。
再来看 V4-Flash 支持的思考/非思考双模式:
| 思考模式 | |||
| 非思考模式 |
双模式的价值在于一个模型覆盖两类需求。不需要为简单任务调一个轻量模型、为复杂任务再切一个重量模型——V4-Flash 自己就能在两种模式间切换。对于 Agent 编排来说,这意味着更简单的工程链路。
从"能聊"到"能干",这四个字的分量比你想象的更重。过去两年,大模型的竞争主轴是"谁的回答更聪明"——基准测试刷分、排行榜你追我赶。但 Agent 时代的竞争主轴变成了"谁能把事情做完"——不只是生成一段文字,而是理解任务、规划步骤、调用工具、验证结果、自我纠错。
DeepSWE 从 7.3 到 54.4 的跃迁,本质上是 V4-Flash 从"能写代码"进化到了"能做工程"。写代码是生成一个函数,做工程是理解一个项目结构、定位问题文件、修改代码、运行测试、确认通过。这中间隔着几道认知鸿沟——而 V4-Flash 正式版跨越了这些鸿沟。
Toolathlon-Verified 70.3 分和 Cybergym 76.7 分同样值得关注。前者衡量多步工具调用推理能力,后者衡量网络安全攻防场景的执行能力——这两个方向都是 Agent 落地的核心战场。V4-Flash 在这两个基准上的表现,说明它不只是一个"代码模型",而是一个具备多领域 Agent 执行能力的通用模型。
🔥 维度四:格局改写——连续 14 周领跑意味着什么

8 月 3 日的全球调用量榜单,是这篇文章最有分量的数据:
| 1 | DeepSeek-V4-Flash | 7.22 | +13% | |
| (第 6-7 位为其他中国模型) | ||||
| 8 | GPT-5.6 Luna | 1.95 | +456% |
几个关键信号:
| 中国连续 14 周领先 | ||
| 全球前五全是国产 | ||
| DeepSeek 双线霸榜 | ||
| GPT-5.6 Luna 首次上榜 |
GPT-5.6 Luna 的 +456% 环比增长看似惊人,但注意背景:这是在降价 80% 之后的结果。OpenAI 用"骨折价"换来了上榜资格——而 DeepSeek 不需要降价,因为它的原价就已经是骨折价了。
小米 MiMo-V2.5 的 -40% 环比下滑也值得关注。这说明市场正在向头部集中——V4-Flash 发布后,大量原本使用 MiMo 的开发者转向了性价比更高的 DeepSeek。
🛠️ 对用户的影响:怎么用起来
Dify 接入实战:5 分钟跑通
DeepSeek 提供 OpenAI 兼容 API,在 Dify 中通过「OpenAI-API-compatible」供应商即可接入。

以下是完整配置:
# Dify 接入 DeepSeek-V4-Flash 配置
# 路径:设置 → 模型供应商 → OpenAI-API-compatible → 添加模型
# ── 基础配置 ──
provider: openai_api_compatible
model_name: deepseek-chat # 模型标识
model_display_name: DeepSeek-V4-Flash # 显示名称
model_type: llm
mode: chat
# ── API 配置 ──
api_key: sk-your-deepseek-api-key # 替换为你的 API Key
api_base: https://api.deepseek.com/v1 # DeepSeek API 端点
# ── 模型参数 ──
context_size: "1048576" # 1M 上下文
max_tokens: 8192 # 最大输出 Token
temperature: 0.7 # 温度参数
top_p: 0.95 # Top-P 采样
# ── 能力支持 ──
supported_capabilities:
- function_calling # 支持 Function Calling
- stream_mode # 支持流式输出
- vision: false # 当前版本不支持视觉
# ── 模型版本指定 ──
# 在 API 调用时通过 model 参数指定版本:
# model: "deepseek-chat" → 默认指向 v4-flash-0731
# 如需显式指定:
# model: "deepseek-chat"
# extra_body:
# model_version: "v4-flash-0731"接入后,你可以在 Dify 的 Agent 应用中直接选择 DeepSeek-V4-Flash 作为 LLM 节点,并开启 Function Calling 能力。
| 供应商类型 | ||
| API Base | https://api.deepseek.com/v1 | |
| 模型名 | deepseek-chat | |
| 上下文 | ||
| Function Calling | ||
| 流式输出 |
vLLM 自部署:中小企业的私有化方案
对于有数据合规需求的企业,V4-Flash 也支持通过 vLLM 自部署:
| 激活参数 | ||
| 最小部署配置 | ||
| vLLM 支持 | ||
| 适用场景 |
130 亿激活参数是 V4-Flash 自部署的核心优势。对比 GLM-5.2 的 400 亿激活参数,V4-Flash 的推理显存需求只有前者的约 1/3——这意味着用更少的 GPU 就能跑起来,对中小企业来说门槛大幅降低。
选型建议:什么时候用 V4-Flash
| 高频 Agent 任务 | ||
| 代码生成 / SWE | ||
| 长文档处理 | ||
| 复杂多步推理 | ||
| 极致质量优先 | ||
| 多模态(视觉) | ||
| 私有化部署 | ||
| 超高并发 API |
一句话总结:如果你在做 Agent、写代码、处理长文档,且对成本敏感——V4-Flash 是 2026 年下半年性价比最高的选择,没有之一。
🧊 冷静思考:狂欢之下的几个隐忧
数据和情绪都很燃,但作为技术观察者,有几个问题需要冷静看待。
第一,Agent Last Exam 的 25.2 vs 25.7 差距虽小,但方向不同。 Opus 4.8 的 25.7 分是在更广泛的任务分布上取得的;V4-Flash 的 25.2 分可能集中在推理/代码/长文档等优势领域。在开放域创意写作、复杂多语言翻译等场景,差距可能更大。孙涛说的"比 GPT 5.6 差一些"是诚实的。
第二,调用量不等于收入。 V4-Flash 7.22 万亿 Token 的周调用量确实惊人,但以 $0.0028/MTok 的缓存命中价格计算,大量调用的实际收入可能远低于按原价估算的规模。薄利多销的商业模式,需要极高的规模化运营能力来支撑。
第三,MoE 架构的部署复杂度不容忽视。 虽然 130 亿激活参数降低了推理显存需求,但 2840 亿总参数的模型权重仍然需要全部加载到显存中。这对部署硬件的总显存容量提出了不低的要求——"激活参数少"不等于"部署门槛低"。
第四,竞争格局瞬息万变。 GPT-5.6 Luna 靠降价 80% 就实现了 +456% 的环比增长。如果 OpenAI 进一步降价或推出更具性价比的模型,当前的格局可能很快被打破。14 周的领先,在技术竞赛的长跑中只是一段冲刺。
第五,小米 MiMo-V2.5 的 -40% 环比下滑值得警惕。 这说明市场正在快速向头部集中——V4-Flash 发布后,大量开发者从其他国产模型迁移过来。短期内这是 DeepSeek 的红利,但长期来看,如果国产模型之间互相"内卷"而忽视了与海外旗舰模型的差异化竞争,可能会出现"赢了调用量、输了技术天花板"的局面。中国模型需要在多模态、自主规划、长程推理等前沿方向持续投入,而不仅仅在价格战中消耗弹药。
第六,后训练的效果能否持续? V4-Flash 正式版仅通过后训练就实现了 Agent 能力的暴涨,这固然令人振奋,但后训练的边际收益递减是行业共识。从预览版到正式版的提升幅度,在未来几个版本中能否复制?当后训练的红利被吃尽后,下一个增长点在哪里——是更大的底座、更长的上下文,还是全新的架构范式?这些问题,目前没有答案。
✍️ 写在最后
回到这篇文章的标题——"Agent 能力暴涨 7 倍,价格却只有 GPT-5.6 的 1/40"。
这不仅仅是一个产品的发布,而是 AI 行业竞争逻辑的一次范式转移:
过去,竞争的焦点是"谁的模型更大"。 7440 亿参数碾压 2840 亿参数,万亿参数碾压千亿参数——参数规模就是护城河。
现在,竞争的焦点变成了"谁的效率更高"。 130 亿激活参数打出 25.2 分的 Agent Last Exam,$0.0028/MTok 的缓存命中价格——效率工程正在取代规模暴力,成为新的竞争维度。
DeepSeek-V4-Flash 正式版传递的核心信息是:你不需要最大的模型,你需要的是最对的模型。 在合适的架构设计、精细的后训练对齐、极致的推理优化三者叠加之下,"小马拉大车"不再是一个比喻——而是一种可复制的方法论。
连续 14 周中国模型领跑全球调用量,前五名全是国产——这不是某一家厂商的胜利,而是中国 AI 产业链整体效率优势的体现。从模型训练到推理部署,从 API 定价到开发者生态,中国厂商正在用"极致性价比"改写全球 AI 的竞争格局。
但竞赛远未结束。GPT-5.6 Luna 的 +456% 环比增长提醒我们:当价格不再是壁垒时,真正的竞争才刚刚开始。
下一轮比拼什么?也许是多模态、也许是自主性、也许是可靠性。但有一点是确定的——AI 推理的"1 美分时代"已经到来,再也回不去了。
🔗 参考资料
• DeepSeek 官方 API 文档 • DeepSeek-V4-Flash 正式版发布公告 • Artificial Analysis 大模型智能指数 • Agent Last Exam 排行榜 • Dify 官方文档 - OpenAI-API-compatible 接入 • vLLM 官方文档 - DeepSeek-V4 部署指南 • GPT-5.6 全面解读(阿强学AI) • vLLM v0.25.0 重磅发布:DeepSeek-V4 跨厂商再提速(阿强学AI)
互动话题:V4-Flash 的 130 亿激活参数打出旗舰效果,你觉得是 MoE 架构的胜利,还是后训练的胜利?如果你的团队要做 Agent 应用,你会选 V4-Flash 还是 GPT-5.6 Luna?欢迎在评论区分享你的选型思考和实战经验。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


