JOTO
Contact us
← AI 智库
Dify

DeepSeek V4 Pro 突然转正,我在 Dify 里把 Fable 5 换了

2026 年 8 月 13 日

DeepSeek V4 Pro 于 8 月 13 日 quietly GA,模型 ID 为 deepseek-V4-Pro-0813。作者在 Dify 中通过 OpenAI-API-compatible 通道快速接入,实测其支持标准 tool_calls、具备 1M 上下文与 384K 输出能力,价格仅为 Claude Fable 5 的约 1/60。但并发限制(500)、高峰延迟、思考链表达生硬及隐私政策等仍存现实约束。

DeepSeek V4 Pro 突然转正

今天早上刷到 DeepSeek API 文档更新,deepseek-v4-pro 的模型版本号从 preview 切成了 DeepSeek-V4-Pro-0813。没有发布会,没有官方博客,连条推文都没有。就这么 quietly GA 了。

DeepSeek V4 Pro 突然转正,我在 Dify 里把 Fable 5 换了

我第一反应不是激动,是手痒。上个月刚把 Dify 里的 Agent 供应商从 GPT-5.6 Sol 切到 DeepSeek V4-Flash,账单直接腰斩。这次 Pro 转正,我倒要看看它能不能把 Claude Fable 5 也从我的工作流里挤出去。

我先在 Dify 里接了一把

Dify 的模型供应商设置里,DeepSeek 官方接口其实一直在。但 v1.16 之后我更习惯走「OpenAI-API-compatible」这条通用通道,因为模型名不用等 Dify 官方更新,base URL 一填就能跑。Dify 对官方模型的适配往往慢半拍,通用通道反而更稳。

配置出奇地简单:

# Dify Settings -> Model Providers -> OpenAI-API-compatible
model_name: deepseek-v4-pro
base_url: https://api.deepseek.com/v1
api_key: sk-xxxxxxxx

保存,测试连接,绿色对勾。从打开设置到跑通第一条消息,三分钟不到。

DeepSeek V4 Pro 突然转正,我在 Dify 里把 Fable 5 换了 配图 2

顺手跑了个 function calling 测试,让 Agent 调一个天气查询工具。V4 Pro 的 tool_calls 结构跟 OpenAI 格式一致,Dify 原生的 Agent 节点不用改任何模板。这点比某些国产模型的"伪兼容"强多了——表面上是 OpenAI 格式,真到 tool 调用就丢字段。

但这里有个坑。旧版 deepseek-chatdeepseek-reasoner 在 7 月 24 日之后已经指向 V4-Flash 的非思考和思考模式了。如果你跟我一样手里还留着几个月前的供应商配置,现在调 deepseek-v4-pro 才是拿到 0813 正式版的正确姿势。旧名字不是不能用,只是它背后已经不是你以为的那个模型。

另一个细节:Dify 里同一个 base URL 不要重复加。我之前已经有 V4-Flash 的供应商,这次新建 V4 Pro 时发现模型下拉列表里两个名字很容易搞混。建议在模型显示名里直接写清楚:DeepSeek V4-Pro-0813,别偷懒只写 deepseek-v4-pro

这次转正到底转了什么

先列硬参数,不多废话。

项目V4 Pro 0813V4-Flash 0731Claude Fable 5GPT-5.6 Luna
上下文1M tokens1M tokens200K tokens1M tokens
最大输出384K tokens8K tokens64K tokens128K tokens
输入价(未命中)¥3 / MTok¥1 / MTok~¥70 / MTok¥1.4 / MTok
输出价¥6 / MTok¥2 / MTok~¥350 / MTok¥8.4 / MTok
缓存命中¥0.025 / MTok¥0.02 / MTok约 90% 折扣
并发限制5002500未公开未公开
思考模式默认开启默认开启可选默认开启

Pro 和 Flash 的价差正好三倍,定位也清楚:Flash 负责高频轻量任务,Pro 负责长上下文、复杂 Agent 和一次性大输出。跟 Fable 5 一比,V4 Pro 的输出价只有对方的六十分之一。注意是"之一",不是"左右"。这个数字本身就有冲击力。

但便宜不是白送的。Fable 5 的并发和稳定性经过大量生产验证,V4 Pro 的 500 并发意味着你把它塞进高并发的客服系统里,可能会撞上瓶颈。这跟模型能力无关,是基础设施的成熟度问题。

真正让我意外的是 Anthropic API 兼容。Dify 里如果之前接的是 Claude 供应商,现在理论上可以把 base URL 改成 https://api.deepseek.com/anthropic,模型名改成对应 ID,就能让原来的 Claude Code / Claude Desktop 工作流直接跑在 DeepSeek 上。这招对那些被 Fable 5 账单折磨的 Agent 开发者来说,简直是明抢用户。

跑分很猛,但先别急着磕头

DeepSeek 自己放出来的数据确实吓人。

  • • Terminal Bench 2.1:72.1 → 87.9
  • • Cybergym:52.7 → 83.3
  • • DeepSWE:12.8 → 62.7
  • • AutomationBench:12.8 → 31.8

DeepSWE 涨了近五倍。这个数字大到不像同一款模型,更像是换了一套考试大纲。实际上也确实有猫腻:Terminal Bench 从 2.0 升级到了 2.1,不同版本不能直接比;DeepSWE 是 DeepSeek 自己的 Harness 框架,评测权重几乎和模型一样黑盒。

OpenRouter 援引 Artificial Analysis 给 V4 Pro 的综合智能指数是 45.3,"优于 70% 的模型"。这跟"追平 Fable 5"的叙事之间,差着一条马里亚纳海沟。

同一天 Grok 4.6 也发布了,xAI 号称在 Artificial Analysis Intelligence Index 上追平 GPT-5.6 Sol,定价 6。这场面很有意思:DeepSeek 和 xAI 不约而同地选在 8 月 12 日深夜发旗舰,一个打价格战,一个打"数字同事"概念。真正睡不着的可能是 OpenAI 和 Anthropic 的定价团队。

所以我的态度是:价格是真的便宜,跑分先信一半。等第三方复现、等开源权重更新、等 huggingface 上的真实测评出来,再下结论不迟。我自己跑下来的感觉是:编程基准靠谱,Agent 长链任务的稳定性还需要在自己业务里磨。

我实测了三个场景

既然 Dify 里接好了,就顺手跑了几轮日常任务。

场景一:读一个 30 万字的 PDF 会议纪要合集

直接丢进 Dify 知识库,检索模式用多路召回 + Rerank,大模型总结用 V4 Pro。它确实能一次吃完,不用切片。总结出来的要点覆盖度不错,但会漏掉一些边缘但关键的讨论——就是那种"最后五分钟有人小声提了一句"的内容。384K 的输出上限在这里没派上用场,因为输入已经塞满了 1M。

这个场景里,V4 Pro 的真正价值不是"读得多",而是"不用切"。之前用短上下文模型,我得先把 PDF 拆成 20 段,每段跑一轮总结,再拼一轮。现在一次调用搞定,工程复杂度直接降了一个数量级。但代价也明显:一次调用烧掉近 1 块钱,如果每天跑几十份,账单也不秀气。

场景二:让 Agent 重写一个 Python 日志聚合脚本

给了它三个要求:把正则换成结构化解析、加异常重试、输出性能对比。V4 Pro 在 Dify Agent 里跑了 2 分 15 秒,生成了 180 行代码,其中有一处 import 路径写错。手动改完能跑。同样的任务用 Fable 5 大约 38 秒,代码一次通过。用 V4-Flash 大约 1 分 40 秒,有两处逻辑 bug。

价格是 Fable 5 的零头,但时间和正确率也是另一回事。便宜不等于好用,这个道理在 AI 上格外明显。

场景三:长文档生成

让它根据一份产品需求文档,直接输出一份 8000 字的技术方案。这是 Pro 真正拉开差距的地方。Flash 输出到一半就停了,Pro 能稳定输出长文本,结构也保持得不错。代价是 token 费确实上去了——一次调用烧了将近 2 块钱。

让我意外的是输出速度。384K 的长输出不是一口气吐完的,中间有明显的"喘气"感,类似于 GPT-4 早期长回复时的分段输出。对实时性要求高的场景不合适,但做离线报告生成完全够用。

一些真实的槽点

  1. 思考链会说"山顶洞语"。词汇破碎、语法别扭,但意思还在。我怀疑这是为了压缩 token 消耗做的取舍,写作能力被明显牺牲了。
  2. 隐私政策依旧是个刺。企业敏感数据我不敢直接喂,个人项目无所谓。
  3. 涨价预告挂在定价页上。"计划在不久的将来上调整体 API 定价,预计涨幅较大"。当前这个价格是窗口期,不是承诺。别为了省几百块就 All-in。
  4. 0813 的开源权重还没出。HuggingFace 上还是 4 月的预览版。想本地部署的得再等等。
  5. 高峰时段会变慢。DeepSeek 的算力储备跟用户增长速度不完全匹配,晚上八九点调用时,首 token 延迟能从平时的 2 秒飙到 8 秒以上。做异步任务无所谓,实时对话会很难受。

给 Dify 用户的建议

不用二选一,两条供应商同时配置:

供应商 A:deepseek-v4-flash
用途:日常问答、轻量 RAG、高频调用

供应商 B:deepseek-v4-pro
用途:长文档生成、复杂 Agent、代码重构

在 Dify Workflow 里用模型切换节点按任务长度和复杂度路由,比死磕一个模型省钱得多。我的做法是:输入 token 超过 50K 或者预期输出超过 4K 的任务走 V4 Pro,其余全部走 Flash。这样 Flash 承担了大约 85% 的调用量,Pro 只用在刀刃上。

如果你现在每个月 API 账单超过 500 块,建议先用 V4-Flash 替换掉 80% 的调用,再用 V4 Pro 替换掉剩下 20% 里真正需要强推理的任务。别为了省 Fable 5 的钱,把自己变成 DeepSeek 的免费测试员。

另外,缓存命中率是省钱的关键。DeepSeek 的缓存折扣是 98%,前提是前后两次请求的输入前缀高度一致。在 Dify 里这意味着 system prompt 和上下文要尽量固定,少做动态拼接。如果你的 Workflow 每次都把不同变量塞在 prompt 最前面,缓存基本命中不了。

这次转正为什么让我多想了一分钟

不是因为跑分,不是因为价格,是因为 Anthropic API 兼容。

这件事意味着 DeepSeek 不再满足于做 OpenAI 的平价替代,它开始直接抢 Claude 的生态位。Claude Code、Cursor、Windsurf、Dify 里那些已经按 Anthropic 格式写好的工具链,理论上可以无缝切过去。对开发者来说,迁移成本几乎为零;对 DeepSeek 来说,用户获取成本也几乎为零。

这不是技术竞争,这是生态竞争。模型本身的差距在缩小,接口和价格的差距在放大。接下来半年,我们可能会看到更多"双兼容"甚至"三兼容"的模型出现。到那时候,Dify 这类平台的价值会进一步凸显——它本来就是模型中立的,谁便宜好用就接谁。

收尾

我把 Dify 里那个用了两个月的 Claude Fable 5 供应商暂时禁用了。不是因为它不好,是它的价格让我每次点"运行"都像在赌场下注。V4 Pro 给了我在自己任务上实测的机会,成本低到可以任性。

但我也不会把 Fable 5 删掉。

就放在那里,等哪天 V4 Pro 在我那十几个真实项目里连续跑通不翻车,再彻底卸载。模型选型这件事,跑分只是参考,自己的账单和血压才是硬指标。

JOTO 企业落地观察

  • 企业若考虑将 V4 Pro 用于 RAG 知识工程,需重点评估其 1M 上下文虽支持整份长文档加载,但 500 并发限制与高峰延迟可能影响多用户实时检索体验;相比 Fable 5 的稳定服务,该模型更适合离线批量摘要而非高 SLA 要求的在线知识服务。
  • V4 Pro 的 Anthropic API 兼容性为企业智能体工程带来新选项:已基于 Claude 工具链开发的 Agent 可低成本迁移,但需验证其 tool_calls 实际字段完整性与错误处理鲁棒性,避免因‘伪兼容’导致生产环境中的 silent failure。
  • 该模型 384K 输出能力对 FDE 驻场共创中的长文档交付场景有直接价值,如自动生成技术方案或合规报告;但其思考链表达生硬、高峰延迟及隐私政策限制,意味着驻场团队需配套设计缓存策略、异步调度机制与数据脱敏流程,不可直接替换现有稳定链路。
  • V4 Pro 当前未提供开源权重且企业数据隐私条款模糊,这对重视 AI 安全治理的企业构成明确约束——无法本地化部署即无法满足数据不出域要求,也无法进行模型层安全审计,仅适合非敏感场景的 PoC 验证。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们

相关文章

Dify
Dify

从零到规模化:企业级 Dify 实践的五大关键跃迁路径

Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.