DeepSeek V4 Flash 在真实智能体任务中表现不及预期,价格大幅上调引发企业部署再评估
DeepSeek V4 Flash 虽登顶模型排行榜并广受开发者欢迎,但在多工具智能体任务测试中仅完成53.8%;其价格最高上涨1100%,凸显编排能力比原始模型能力更关键,企业需重新权衡成本、可靠性与安全治理。

DeepSeek 的 V4 Flash 模型已登顶各大模型排行榜,并自发布以来被开发者誉为“彻底的怪兽”。但在真实场景测试中,它仅完成了批量复杂智能体任务中的 53.8%。
Composio 将该模型运行于八种不同的智能体框架(agent harnesses)之中,包括 Claude Code、Codex 和 OpenCode,在涵盖 Gmail、GitHub、Slack 和 Google Sheets 等实时工具的 30 项刻意设计的高难度多步骤任务上进行测试。在总计 240 次运行中,129 次通过;而 30 个工作流中,仅有 6 个被所有受测框架全部成功完成。
这一差距凸显了编排(orchestration)能力——而非模型原始能力——可能才是决定该模型能否在企业环境中取得成功的关键:同一模型在不同框架、工具配置、缓存行为、重试机制及供应商技术栈上运行时,产生了显著差异的结果。
DeepSeek 表示将上调 V4 Flash 和 V4 Pro 模型的价格,这两款模型已迅速成为构建编程助手和智能体的开发者的首选。
尽管此举看似可能削弱其自身吸引力——即以远低于前沿厂商所能匹配的超低价格提供惊人能力的模型——但它也推动叙事超越了如今已成陈词滥调的“廉价中国模型”框架,因为早期用例正陆续浮现,企业也在逐步厘清不同模型在其技术栈中的定位,以及应将其应用于哪些具体工作流。
"‘疯狂’的采用数据,DeepSeek 正颠覆成本结构
DeepSeek 于 7 月 31 日向公众开放 V4 Flash 的公开测试版,并于 8 月 13 日全面上线 V4 Pro。参数量达 2840 亿的 Flash 模型专为高吞吐量与高速度而构建,参数量达 1.6 万亿的 Pro 模型则面向更复杂的工作流。
两款模型均具备灵活的推理能力(低、高、最高)及‘思考模式’(thinking modes),通过应用思维链(CoT)推理提升答案准确性。
用户立即对 Flash 的能力印象深刻。它自发布以来一直占据 OpenRouter 使用量排行榜首位,目前是该平台按周 token 使用量计算的最常用模型。 主导 OpenRouter 的使用量排行榜 ,目前是该平台按周 token 使用量计算的最常用模型。
“初始版 DeepSeek V4 Flash 的采用数据简直疯狂,” 机器学习研究员 Nathan Lambert 在 X 平台发帖称, 并补充称新版本“得分与 GLM 5.2 相同”,使其成为一款将被广泛使用的“彻底的怪兽”。
DeepSeek 调整计价模式增添了有趣的新维度。
V4 API 费率 将根据模型类型、token 类型及使用时段,最高上涨 1100%。新的定价结构如下:
Flash 模型非高峰时段为每百万输入 token 0.22 美元、每百万输出 token 0.66 美元;高峰时段为每百万输入 token 0.44 美元、每百万输出 token 1.32 美元。这代表涨幅为 57% 至 371%。
Pro 模型非高峰时段为每百万输入 token 0.66 美元、每百万输出 token 1.98 美元;高峰时段为每百万输入 token 1.32 美元、每百万输出 token 3.96 美元。这代表涨幅为 51% 至 355%。
与此同时,缓存命中(即模型复用已有提示而非从头开始生成)费用将上涨 52% 至 1100%。
DeepSeek 表示,提供比常规价格低 50% 的非高峰时段使用费率,旨在鼓励“更灵活的工作负载调度”。每日 24 小时中,有 17 小时维持半价;而新定价结构实际上将该公司本土市场定价定为最高。
“这并非一次简单的涨价,” Greyhound Research 公司分析师 Sanchit vir Gogia 表示,“这是一种将推理时机本身变为一项经济变量的定价架构。”
可延后执行的工作——例如批量评估、合成数据生成以及夜间开发运行——将转移至低价时段;而交互式智能体与实时运营则无法延迟。Gogia 表示,开发者与企业的真实不满情绪强烈且表达明确,而 DeepSeek 过去的低价策略并不意味着它必须永远保持低价。
科技分析师 Carmi Levy 表示:“乍看之下,这似乎是一项‘自杀式举措’,尤其对于一家仍在努力对抗更成熟 AI 模型供应商以建立可信度的平台而言。” 科技分析师 Carmi Levy 表示。此次涨价无疑将侵蚀 DeepSeek 的价格优势,并迫使客户更审慎地权衡该公司中国背景所引发的顾虑。
不过,他指出,就所有定价指标而言,DeepSeek 相较于 OpenAI、Anthropic、Google、Cohere、xAI 等其他公司的竞品模型,仍要便宜得多。
因此,尽管此举将迫使 DeepSeek 更强调性能与安全性而非成本,却远未抹除其业已显著的价格-性能优势,仍能为客户留出充足空间,以证明其在特定工作负载中使用的合理性,Levy 表示。只是相关数学计算需更为精确。
Levy 表示:“这一优势很可能随时间推移而逐渐减弱,因为 DeepSeek 必然会持续调整定价以贴合市场现实;但目前,构建商业论证依然十分容易。”
DeepSeek Flash 可在企业环境中承担何种角色?
由于成本、能力、可靠性、数据治理、安全性及其他因素,其在企业内部的采用仍属未知数。
Levy 表示,一种适用场景是批处理。此类工作通常例行化且重复性强,而非要求顶尖智能水平,因此使用更廉价、更高效的模型是合理选择。“它是一款高性能推理引擎,企业可考虑将其用于点状解决方案(point solution)类工作负载,而非作为现有主流方案的全面替代品。”Levy 表示。
部分采用可能涉及隔离部署、非敏感工作负载,且具备明确定义的成功衡量标准、严格监督、权限控制,以及故障时的备用模型,他指出。更广泛的部署则要求 DeepSeek 及其托管合作伙伴证明自身在可靠性、安全性、隐私性、可审计性及部署选项方面具备强大实力。随着其依据需求调整价格结构,DeepSeek 还必须维持足够大的价格-性能优势,以证明任何潜在风险的合理性,他表示。
预计 IT 团队将在后台实验室及受控测试环境中开展未经正式批准的小规模试用,以便熟悉这款新模型,并厘清何时、如何向高层领导申请预算审批。
他表示:“DeepSeek 已建立起全球颠覆者这一实至名归的声誉,而其迈向更广泛企业采用的步伐显然将持续加速。”
在多工具工作流中测试 DeepSeek
尽管许多用例仍处于实验阶段,Meta 软件工程师 Naman Ahuja 提出了一项可直接转化为企业环境的应用案例。在一个与其雇主无关的项目中,他使用 DeepSeek V4 Flash 构建了一个家庭自动化智能体,以探索一款低成本模型作为真实多工具工作流的推理/编排层时的表现。
当他离家时,该智能体会协调多个原本彼此独立的系统执行一系列操作:例如将恒温器设为“离家”模式以减少不必要的能源消耗、启动 Ring 安防系统、关闭并锁好门窗。
Ahuja 表示:“令我感兴趣之处,并非模型是否能理解某条指令,而是它能否将用户意图转化为跨多个工具的一系列操作序列——而在此过程中,可靠性至关重要。”
最重要的教训是:一旦模型能够执行操作,其可靠性便与智能性同等重要。该系统需要结构化的工具输出、对操作是否真正成功的验证、重试/失败处理机制,以及明确界定模型被允许执行的操作边界。
在企业场景中,‘架构是相似的’。家用设备被替换为企业级工单系统、数据库、CRM平台或基础设施API。最有用的智能体(agents)很可能是在多个系统间编排重复性工作流的智能体,具备限定范围的权限、可审计性、可观测性,并对高风险操作要求人工审批。
‘许多有价值的AI智能体将不是聊天机器人;它们将是后台智能体,响应事件协调API、基础设施和业务系统,’他表示。
企业需要切实可行的用例。
但Gogia指出,Flash的API目前仍处于公开测试阶段(public beta),尚无已确立的企业采用证据链、真实世界部署案例及具名客户记录。
‘基准测试叙事比其复述版本更松散,投资组合叙事比表面看起来更新,而经济性因素已深入嵌入模型周边系统之中,’他表示。开发者层面的主流化已被证实;但企业级标准化尚未实现。‘该模型在流量层面已是主流,但在合同层面仍未得到验证。’
他指出,DeepSeek自身提供的集成指南是一项重要考量:其至少在一个主流智能体环境(agent environment)的文档中明确指出,内置的V4条目若不通过兼容性覆盖(compatibility overrides),不足以保障可靠运行。
Gogia表示:‘这是一家供应商准确地向市场传达——基准测试性能并非生产就绪(production readiness)的替代指标。一个模型可能在基准测试中得分极佳,但一旦引入工具、凭证和状态,仍可能表现异常。’
服务层(serving layer)的行为并无不同:同一套开源权重(open weights)由不同托管方运行时,在吞吐量和正常运行时间方面均表现出明显差异。Gogia表示:‘因此选择Flash仅回答了一个采购问题,却同时引出了三个新问题:由谁提供服务、在何处运行,以及围绕它部署了哪些管控措施。’
为多模型未来做好准备。
DeepSeek为多模型未来提供了细致入微的例证。Gogia指出,V4 Flash正被部署为多样化企业环境中承担高吞吐量任务的‘主力工作者’:它负责日常生成、检索及后台自动化任务,而更困难或更敏感的任务则交由其他模型处理。
‘关键问题在于其性能是否足以支撑企业实际运行的真实工作流,而非其是否在每一项基准测试中都拔得头筹,’他表示。企业必须确定模型、封装框架(harness)与提供商的何种组合,能在最低成本下安全完成任务。
EmpirioLabs AI首席执行官兼创始人Adam Dalloul指出,更大并不总是更好;工作流应依具体任务而定。例如,他所在的EmpirioLabs AI团队——其单一API已托管100多个模型,包括DeepSeek V4 Flash——近期正在将其网站翻译为多种语言,而完成该任务完全无需GPT 5.6 Sol或Opus 5等大型模型。
‘这正是子智能体(subagents)发挥作用之处,’他表示。
他推荐的方法是:按任务需求生成更低成本的子智能体并动态适配。例如,日常任务使用Flash变体,而需要更强能力时则调用Pro变体。‘这取决于您应用的性质。’
Dalloul指出,许多公司正转向构建自有内部基准测试,以高效调度模型。例如,他的团队设计了一套工作流,让模型依次通过多个关卡与指令集,从而识别出在速度与精度两方面均满足任务需求的模型。
在另一个案例中,某位企业客户明确只希望接入DeepSeek V4 Flash。他们已测试多种模型,而V4 Flash是唯一满足其在速度、成本及‘适当智能阈值’三项标准上的模型。
Meta公司Ahuja亦认同:更小、更高效的模型可胜任高频次、定义明确的智能体任务,而更昂贵的前沿模型则可保留用于‘模糊、困难或更高风险的决策’。相关衡量指标正日益从单纯的‘每Token成本’,转向‘每个成功完成的工作流成本’。
然而,他指出,低成本推理并不自动意味着低成本或安全的自动化。一旦AI系统能够执行操作,其可靠性、验证机制、权限控制、故障处理及安全性便变得至关重要。
Ahuja表示:‘文本响应失败仅带来不便;而在运营工作流中执行操作失败,则可能造成真实后果。’
JOTO 企业落地观察
- 对企业部署而言,V4 Flash 的高基准分与低真实工作流通过率(仅6/30全框架通过)表明:企业采购不能仅看榜单排名,必须在自有工具链、权限体系与失败回退机制下开展闭环验证;非高峰时段半价策略虽鼓励批处理调度,但实时运营场景仍面临成本与可靠性双重压力。
- 对智能体工程而言,Composio 测试揭示核心瓶颈不在模型本身,而在框架适配性——同一模型在8种agent harnesses中结果差异显著;开发者需将‘工具调用结构化’‘操作成功验证’‘重试边界定义’列为工程刚需,而非仅优化prompt或换更大模型。
- 对AI安全治理而言,Ahuja家庭自动化案例直指风险本质:文本失败仅致不便,而执行失败可能引发物理或业务后果;文章明确指出需‘限定权限、人工审批高风险操作、可观测可审计’,这要求企业将智能体纳入现有IT治理流程,而非当作黑盒API调用。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


