JOTO
Contact us
← AI 智库
大语言模型

DeepSeek-V4.1-Flash发布:0.003美元/百万缓存输入,专为智能体长上下文优化

2026 年 9 月 10 日

DeepSeek推出V4.1-Flash模型,5520亿参数MoE架构,原生视觉支持,100万token上下文;非高峰时段缓存输入仅0.003美元/百万token,显著优于GPT-5.6 Sol与Claude Opus 5,但对硬件部署要求大幅提升。

DeepSeek-V4.1-Flash debuts with $0.003/1M off-peak cached-input rate and benchmarks eclipsing GPT-5.6 Sol, Claude Opus 5

DeepSeek 已发布 DeepSeek-V4.1-Flash 于昨夜发布 该模型采用参数量达 5520 亿的混合专家(mixture-of-experts)主干网络,原生支持视觉能力,上下文窗口长达 100 万 token,并且其架构专为降低重复读取大规模上下文的成本而设计。

其开源权重已向开发者和企业开放下载,可在宽松、面向企业的 MIT 许可协议下用于商业用途,托管平台为 Hugging Face。然而,对于正在评估该模型用于编程智能体(coding agents)及其他长期运行工作流的开发者而言,其 headline API 费率立即具备吸引力。

在非高峰时段,DeepSeek 对 V4.1-Flash 的定价为:缓存命中(cache hit)时每百万输入 token 0.003 美元,缓存未命中(cache miss)时每百万输入 token 0.15 美元,每百万输出 token 0.60 美元;高峰时段费率则为上述数值的两倍。

这一区分至关重要,因为一个反复作用于同一代码仓库、工具定义、系统指令或对话历史的智能体,其重读缓存上下文的频次可能远高于读取全新上下文的频次。DeepSeek 自身指出,缓存命中费用可能构成智能体总成本中相当可观的一部分。

DeepSeek 设定的高峰时段为每周一至周五的协调世界时(UTC)01:00–04:00 及 06:00–10:00;其余所有时段均为非高峰时段。因此,对于可调度的智能体任务而言,工作负载的实际运行时间本身即成为另一项成本控制杠杆。

这使得 V4.1-Flash 成为一个尤为有用的实际测试案例,用以检验 VentureBeat 自身研究指出的一个问题:许多企业至今仍无法清晰认知该问题。

根据 VentureBeat Pulse Research 于 2026 年 7 月开展的一项覆盖 170 家员工人数超 100 人的企业的调研,仅有 47% 的企业表示其严格追踪人工智能计算成本与投资回报率(ROI)——这意味着 53% 的企业并未做到;与此同时,12% 的企业表示尚未应对推理内存限制(例如 KV 缓存容量),另有 7% 的企业甚至未意识到该约束的存在;即便在那些已大规模投入生产环境运行人工智能的组织中,严格进行成本追踪的比例也仅为 56%。

这对构建者(builders)的启示十分直接:仅依据未缓存输入价格对模型进行比较,可能掩盖智能体经济性中增长最快的组成部分之一。

0.003 美元这一数字改变了比较格局

DeepSeek 的非高峰时段缓存输入费率,相较于其用于对标 V4.1-Flash 的前沿 API,异常偏低。

OpenAI 将 GPT-5.6 Sol 的定价列为:常规输入 token 每百万 4 美元,缓存输入每百万 0.40 美元,输出每百万 20 美元;Anthropic 对 Claude Opus 5 的定价为:标准输入每百万 5 美元,缓存命中每百万 0.50 美元,输出每百万 25 美元;Moonshot AI 的 Kimi K3 定价为:缓存未命中输入每百万 3 美元,缓存命中输入每百万 0.30 美元,输出每百万 15 美元。

DeepSeek 的对比并非完全同类可比,因其最低费率需满足非高峰时段使用条件;但即便在高峰时段,V4.1-Flash 的费率也仅升至每百万缓存输入 token 0.006 美元、每百万未缓存输入 0.30 美元、每百万输出 1.20 美元。

为简化构建者计算,假设某智能体保留一段 50 万 token 的可复用前缀,并在 100 次请求中均命中该缓存,则共涉及 5000 万缓存输入 token;若忽略缓存写入费用、新增未缓存上下文及输出费用,则这些缓存读取在 V4.1-Flash 非高峰时段的成本约为 0.15 美元,而 Kimi K3、GPT-5.6 Sol 和 Claude Opus 5 在其公布的缓存读取费率下对应成本分别为 15 美元、20 美元和 25 美元。

模型

输入(美元/百万)

输出(美元/百万)

总计(美元/百万)

来源

0.10 美元

0.20 美元

0.30 美元

Meta

MiMo-V2.5 Flash

0.10 美元

0.30 美元

0.40 美元

Xiaomi

DeepSeek-V4.1-Flash — 非高峰时段

0.15 美元

0.60 美元

0.75 美元

DeepSeek

GPT-5.6 Luna

0.20 美元

1.20 美元

1.40 美元

OpenAI

MiniMax-M3

0.30 美元

1.20 美元

1.50 美元

MiniMax

LongCat-2.0 — 限时促销

$0.30

$1.20

$1.50

LongCat

DeepSeek-V4.1-Flash — 高峰时段

$0.30

$1.20

$1.50

DeepSeek

MiMo-V2.5

$0.40

$2.00

$2.40

Xiaomi

DeepSeek-V4-Pro — 非高峰时段

$0.66

$1.98

$2.64

DeepSeek

LongCat-2.0 — 标准版

$0.75

$2.95

$3.70

LongCat

MiMo-V2.5 Pro(≤256K)

$1.00

$3.00

$4.00

Xiaomi

Gemini 3.7 Flash — 截至2026年12月31日

$0.75

$3.75

$4.50

Google

Gemini 3.8 Flash — 截至2026年12月31日

$0.75

$3.75

$4.50

Google

DeepSeek-V4-Pro — 高峰时段

$1.32

$3.96

$5.28

DeepSeek

Muse Spark 1.1 / 1.2 / 1.3

$1.25

$4.25

$5.50

Meta

GLM-5.3

1.40美元

4.40美元

5.80美元

Z.AI

Grok 4.6 — <200K 提示词(prompt tokens)

2.00美元

6.00美元

8.00美元

xAI

MiMo-V2.5 Pro(>256K)

2.00美元

6.00美元

8.00美元

小米(Xiaomi)

Qwen3.8-Max

2.00美元

6.00美元

8.00美元

QwenCloud

Gemini 3.7 Flash — 自2027年1月1日起生效

1.50美元

7.50美元

9.00美元

Google

Gemini 3.8 Flash — 自2027年1月1日起生效

1.50美元

7.50美元

9.00美元

Google

GPT-5.6 Terra

2.00美元

12.00美元

14.00美元

OpenAI

Grok 4.6 — ≥200K 提示词(prompt tokens)

4.00美元

12.00美元

16.00美元

xAI

GPT-5.4

2.50美元

15.00美元

17.50美元

OpenAI

Kimi K3

3.00美元

$15.00

$18.00

Moonshot AI

Claude Opus 5

$5.00

$25.00

$30.00

Anthropic

Sakana Fugu Ultra(≤272K)

$5.00

$30.00

$35.00

Sakana AI

GPT-5.6 Sol — 标准模式

$5.00

$30.00

$35.00

OpenAI

Claude Fable 5 / Claude Mythos 5

$10.00

$50.00

$60.00

Anthropic

Claude Fable 5.1 / Claude Mythos 5.1

$10.00

$50.00

$60.00

Anthropic

GPT-6 Astra — 标准模式

$10.00

$50.00

$60.00

OpenAI

GPT-5.6 Sol — 快速模式

$10.00

$60.00

$70.00

OpenAI

GPT-6 Astra — 快速模式

$20.00

$100.00

$120.00

OpenAI

实际工作负载无法实现完美的缓存重用,总成本取决于输出长度、推理令牌数、重试次数、工具调用次数以及任务成功率。但正因如此,评估智能体工作负载的开发者应测量缓存命中率和每项完成任务的成本,而非将总提示令牌数乘以模型标称的输入价格。

DeepSeek-V4.1-Flash 目前处于全球付费 API 市场绝对价格最低端,同时其能力也明显超出其定价层级所暗示的水平。

每输入 0.15 美元 / 每输出 0.60 美元,或 非高峰时段每100万token总计0.75美元在当前排行榜中,其排名仅落后于Meta的Contributor级Muse Spark和MiMo-V2.5 Flash;即便在其 高峰时段0.30美元/1.20美元单价下,或 总计1.50美元,它仍与MiniMax-M3及LongCat的促销定价持平,远低于约 4.50–8.00美元 的中端模型集群,并显著低于Claude Fable/Mythos 5.1、GPT-6 Astra及GPT-5.6 Sol Fast模式等高端前沿模型。

战略要点在于,DeepSeek正将V4.1-Flash不仅用作一款廉价的“Flash”模型,更将其作为其API的新重心:其文档指出,旧版V4 Flash请求现由V4.1-Flash提供服务,且V4.1 Flash在性能、成本、速度及总耗时方面已“全面超越V4 Pro”,而V4 Pro将于2026年9月14日起路由至V4.1 Flash,直至未来V4.1 Pro发布。

VentureBeat的Pulse数据显示,相关指标体系尚未跟上这一进展。在接受调查的企业中,仅有31%将每百万token成本列为基础设施成功的核心衡量指标,而正常运行时间与可靠性以51%居首,开发者生产力与部署速度达39%;仅有22%将总体拥有成本(TCO)选为首要采购标准。

DeepSeek的技术报告还揭示了支撑此类缓存命中经济性的底层机制。该公司表示,全局KV(键值)缓存保留在其持久化缓存中,且保证至少72小时的有效期。相比之下,短生命周期的滑动窗口注意力(SWA)KV则存储于一个分布式内存池中,该内存池从主机DRAM中划拨10%容量,并设定分钟级有效期。当长生命周期全局缓存尚存但SWA状态已丢失时,V4.1-Flash仅重放最近一个注意力窗口(而非完整历史)即可重建缺失状态。

DeepSeek正在缩小缓存,而非模型

该架构差异同样重要。V4.1-Flash采用DeepSeek所称的 因果编码器-解码器(Causal Encoder-Decoder) 架构,将其40层Transformer拆分为一个20层因果编码器与一个20层解码器。该设计在读取输入(即prefill阶段)时每token激活 80亿参数 ,而在生成输出时激活 160亿参数

这纠正了一个易被误用的简略说法:V4.1-Flash并非在整个推理周期内均为“8B活跃”模型;其在prefill阶段激活80亿参数,在decode阶段则激活160亿参数。

该模型将该架构与压缩稀疏注意力2(CSA2)、分层稀疏索引及FP4 KV缓存相结合。DeepSeek称,这些技术使全局KV缓存降至每token约890字节,约为V4-Flash的四分之一,而其持久化缓存存储需求亦降至约八分之一。

对于输入密集型智能体循环任务,这些可能是意义重大的服务性能提升。持续反复读取代码仓库的编程智能体,正是prefill与KV缓存效率起主导作用的典型工作负载。

但‘Flash’一词已不再意味着小型化。DeepSeek此前的V4-Flash采用2840亿参数主干网络(backbone),其中130亿参数处于活跃状态。V4.1-Flash将主干网络增至5520亿参数,增幅约94%。prefill阶段活跃参数数从130亿降至80亿,但生成阶段活跃参数数实际从130亿升至160亿。

且5520亿仅指主干网络参数量:DeepSeek技术报告另单独列出其稀疏访问的Engram条件记忆模块含1960亿参数。

该权衡已引发开发者在讨论该发布时的质疑。一位在 Hacker News发布帖讨论中评论者质疑 一款5520亿参数模型是否‘已不再真正属于Flash范畴’,并指出其庞大得多的总占用空间,即便其稀疏激活与缓存架构提升了服务效率,仍使本地部署要求显著提高。

此类批评具有价值,但并未否定DeepSeek的效率主张,而只是对其作了更精确界定。

V4.1-Flash在总权重数量上并不比V4-Flash更紧凑。其设计目标是在摄入token时消耗更少算力,并在保留长上下文时大幅减少内存占用。对于向DeepSeek采购推理服务的构建者而言,这可转化为更低的API定价;而对于计划自托管MIT许可证权重的团队,参数量从2840亿跃升至5520亿,将使硬件配置要求变得明显不友好。

技术报告为‘它只是变大了’这一批评提供了重要制衡。DeepSeek称,CED(因果编码器-解码器)可使足够长序列的prefill计算量有效减半,而单token decode的FLOPs随上下文长度从4K扩展至100万token(256倍)仅增加约25%。换言之,V4.1-Flash在权重数量上更大,但DeepSeek已将随上下文增长而增加的计算工作量设计为更缓慢地扩展。

相应地存在一项警示。DeepSeek明确指出,新架构产生了其尚未完全表征的鲁棒性边界。该公司称,潜在的CSA2稀疏选择错误及SWA有界重放(Bounded Replay)所采用的近似状态重建,可能在未经测试的边缘场景中导致能力下降,尤其涉及极长上下文下的稀疏检索及缓存恢复边界。DeepSeek表示其自身测试中未观察到系统性退化,但计划开展额外压力测试。

DeepSeek自身的发布说明甚至建议,对大规模部署感兴趣的组织若拥有约2000块GPU加一个存储集群的资源,应直接联系该公司。

基准测试结果令人鼓舞,但工作负载形态更为关键

DeepSeek报告其在DeepSWE v1.1上得分为 74.2,略高于其报告的Claude Opus 5的 74.0 及GPT-5.6 Sol的 73.0 。其亦报告V4.1-Flash在CyberGym上得分为88.1,在AutomationBench上得分为54.8。

DeepSeek-V4.1-Flash benchmark comparison

图片来源:DeepSeek

这些是DeepSeek自行运行的评测,结果并非全面占优。Opus 5在Terminal-Bench 3.0上以43.3领先V4.1-Flash的30.0,在Terminal-Bench 4.0上以51.8领先V4.1-Flash的31.2;而GPT-5.6 Sol在DeepSeek的表格中于GPQA Diamond及SEC-Bench Pro上领先。

这些头条分数背后还隐藏着另一项成本变量:推理努力度(reasoning effort)。DeepSeek在最大努力度设置(100)下运行了该对比表格。据该公司自身测试,将努力度从25提升至100,可使DeepSWE v1.1得分从66.0%升至74.2%,Terminal-Bench 2.1得分从82.4%升至90.6%,但输出token消耗量约增至2.5倍。DeepSeek称增益呈前置集中:努力度介于60至80之间即可在不足一半token预算下恢复大部分最高努力度精度,而最终提升至100则使智能体执行轨迹延长1.6–1.8倍,却仅带来相对微小的精度提升。

这为构建者创造了另一项实际路由决策。DeepSeek在公开API中提供低、高、最大三档预设,对应推理努力度值分别为50、75和100。因此,以每项成功任务成本为优化目标的团队可能发现,该模型的最佳运行点并非支撑其排行榜分数的最大努力度配置。

VentureBeat获得的早期第三方证据亦指向相同的价格-性能命题,而非清晰的智能优势。

OpenDesign 表示,V4.1-Flash 在公司设定的一组日常设计请求上,达到了 GPT-6 Astra 质量评分的 98%,而成本仅为后者的 1.4%。这是一个范围狭窄的第三方工作负载,并非通用模型评估,但它进一步强化了应以“每美元完成的有效工作量”而非仅以基准测试排名作为衡量标准的观点。

构建者还应注意另一项生产环境限制:DeepSeek 已停用 V4-Flash 和 V4-Flash-Vision-Exp,并暂时将它们现有的标识符路由至 V4.1-Flash。该公司还表示,自 9 月 14 日起,对 deepseek-v4-pro 的调用将被路由至 V4.1-Flash,直至 V4.1-Pro 上线。

该政策已引发 开发者在 Hacker News 上提出的另一条批评意见,他们指出,即使替换模型名义上更优或更便宜,更改现有生产标识符背后的底层模型仍可能导致回归测试失效。对于提示词(prompt)和智能体(agent)行为经过高度精细调优的团队而言,模型迁移仍是一项需经实测验证、而非可直接假设成立的操作。

一次具有关键意义时刻的性价比发布

此次发布恰逢 DeepSeek 的商业雄心似乎正在扩大之际。 路透社 本周报道称,该公司已聘请中信证券为其筹备在上海科创板上市做准备。路透社还报道称,当前一轮融资可能使 DeepSeek 的估值高达 5000 亿元人民币(约合 75 亿美元)。

这一背景提升了此次发布的战略重要性——其核心主张并非在于赢得每一项基准测试,而在于降低在大规模部署中运行高性能模型的成本。

对开发者而言,V4.1-Flash 提出的问题比‘DeepSeek 是否又推出了一款廉价的前沿挑战者’更为具体:某项工作负载是否具备足够强的输入密集型特征、重复性与可缓存性,从而能充分利用其 80 亿参数的预填充(prefill)路径及显著更小的 KV 缓存;以及这些节省是否足以抵消模型体积几乎翻倍、解码(decode)路径现在需激活 160 亿参数所带来的额外开销。

技术报告为此方程增添了另一个变量:该工作负载是否能从最大推理努力(maximum reasoning effort)中获益足够多,从而证明其输出 token 消耗量约为原先 2.5 倍的合理性;抑或采用中等推理努力设置能否实现更优的单位任务成本(cost-per-task)结果。

对智能体(agent)构建者而言,这才是真正重要的基准:不仅关乎每 token 的智能水平,更关乎每缓存 token、每秒、每美元所能完成的实际工作量。

JOTO 企业落地观察

  • 对企业部署而言,V4.1-Flash虽提供MIT许可开源权重,但主干参数量跃升至5520亿(+94%),且解码阶段需激活160亿参数,大幅抬高本地GPU集群门槛;企业若无2000卡级资源+专用存储集群,难以自托管,将被迫依赖其API服务。
  • 对智能体工程而言,该模型将缓存命中率与重用前缀长度直接转化为成本变量——例如50万token前缀重复调用100次,在非高峰时段仅耗0.15美元,而竞品达15–25美元;开发者必须实测缓存命中率与任务成功率,而非仅比对标称输入单价。
  • 对FDE落地而言,VentureBeat Pulse数据显示仅47%企业严格追踪AI计算ROI,而V4.1-Flash的阶梯式定价(区分缓存/未缓存、峰/谷时段)倒逼企业建立细粒度成本计量体系;未配置缓存监控与任务调度策略的组织,将无法兑现其宣称的成本优势。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.