DeepSeek 发布开源智能体运行框架 Harness 及 V4-Pro 模型,同步上调 API 价格
DeepSeek 推出开源智能体运行框架 DeepSeek Harness v0.1,对标 Claude Code;发布优化代理能力的 V4-Pro 正式版,并启用高峰/非高峰时段差异化 API 定价,缓存未命中价格最高上涨超 300%。

DeepSeek 正在超越模型层,进一步深入软件开发者用于部署 AI 智能体(AI agents)所使用的软件层。
这家中国人工智能实验室于周四 发布了 DeepSeek-V4-Pro 的正式版本——一款重点面向智能体工作负载(agentic workloads)的更新版旗舰模型——同时发布 DeepSeek Harness v0.1——一款全新的开源智能体运行框架(agent harness),为开发者提供 Anthropic 公司 Claude Code 等集成式编码智能体环境的替代方案。
这两项发布共同构成 DeepSeek 更广泛的开发者战略推进。V4-Pro 现已上线 DeepSeek 的网页界面、移动应用及 API,并原生支持 OpenAI Responses API,且与 Codex 集成。
与此同时,DeepSeek Harness 正以 MIT 许可证形式进入开发者预览阶段,其代码现已可在 GitHub 上下载并使用。它基于一种异常模块化的理念构建:智能体运行时(agent runtime)的几乎所有组成部分均可作为插件进行替换。
但通过 DeepSeek API 接入 V4 的开发者很快将为此支付显著更高的费用。DeepSeek 正同步 放弃现有统一费率的 API 定价模式 ,转而采用高峰时段与非高峰时段差异化定价,新定价机制将于 8 月 16 日(星期日)UTC 时间 16:00(美国东部时间凌晨 2 点)起生效。
即便享受折扣的非高峰时段缓存未命中(cache-miss)及输出价格,也将远高于当前价格。
这一组合举措意义重大,因为 DeepSeek 不再仅围绕模型智能水平与 token 价格展开竞争。借助 Harness,它正进军决定模型如何调用工具、操作文件、维持会话以及执行长期运行智能体工作流(long-running agent workflows)的软件层——这正是 Anthropic 的 Claude Code 及其他编码智能体日益成为重要开发者产品的领域。
DeepSeek 自主构建其智能体运行框架
DeepSeek 将 Harness(或 dsh)描述为一款基于 Cordis 框架构建的开源智能体运行框架;Cordis 是一种专为可组合插件(composable plugins)而设计的框架。
其核心指导原则十分简洁: “一切皆为插件。”
据 DeepSeek 所述,该原则涵盖模型、工具、技能、会话、沙箱、文件系统、循环、编排(orchestration)及用户界面。Harness 并未将这些组件固化为单一编码智能体的固定部分,而是旨在让开发者能够自由混搭、替换和扩展它们。
该项目采用 MIT 许可证发布,目前可通过 npm 启动,命令为 npx @deepseek-ai/dsh web。DeepSeek 还提供了直接从源代码构建的详细说明。该代码仓库明确将该软件标注为“开发者预览版”,并警告称:“将出现破坏兼容性的变更(THERE WILL BE COMPATIBILITY-BREAKING CHANGES)。”
这一警示对企业的开发者尤为重要。Harness 目前尚未被定位为稳定、可即插即用(drop-in)的生产级平台。但其架构指向了一种潜在的重要战略:DeepSeek 现在不仅能向开发者提供模型,还能提供一个开放框架,供其组装围绕模型构建的各类系统。
Anthropic 的 Claude Code 和 OpenAI 的 Codex 因此成为有用的竞品参照,尽管这些产品不应被视为功能完全等同。
DeepSeek Harness 是一款开源、模型无关(model-agnostic)的替代方案,旨在替代支撑 Claude Code 和 Codex 的智能体基础设施——但尚不能完全取代任一产品所提供的更广泛开发者体验。
它目前已能实现代码仓库检查、文件编辑、shell 命令执行、文件与网络搜索、计划维护、技能调用、任务委派至子智能体(subagents),以及审批策略强制执行。这些正是使 Claude Code 和 Codex 成为智能体式编码工具(agentic coding tools),而非简单自动补全系统(autocomplete systems)的核心能力。
DeepSeek 明确将标准模式(Standard mode)描述为具备文件编辑、shell 访问、搜索、规划、子智能体及工作流的完整编码智能体;其本地网页界面允许用户选择工作区并对敏感操作进行审批。
但 Claude Code 和 Codex 的能力现已远超该智能体循环(agent loop)。以下为快速对比:
维度 | DeepSeek Harness | Claude Code | OpenAI Codex |
读取、编辑与测试代码仓库 | 是 | 是 | 是 |
Shell 与开发工具 | 是 | 是 | 是 |
规划与子智能体 | 是 | 是 | 是 |
权限控制与沙箱机制 | 是,可通过插件配置 | 是,具备成熟内置的权限与沙箱系统 | 是的,细粒度沙箱和审批控制 |
主要接口 | 本地 Web UI;无头命令行;Python SDK | 终端、VS Code、JetBrains、桌面端、浏览器、移动端及 Slack | 命令行工具(CLI)、IDE 插件、桌面应用、Web/云服务及集成 |
托管后台代理 | 未作为 DeepSeek 管理的服务予以文档化 | 是 | 是 |
原生 GitHub PR 工作流 | 未作为已完成集成予以文档化 | GitHub Actions、自动评审、从 Issue 到 PR 的工作流 | 云任务、自动评审、PR 修复及 GitHub Action |
模型选择 | DeepSeek、Anthropic、OpenAI 及自定义兼容端点 | 主要为 Claude,包括 Amazon Bedrock、Google Cloud 和 Microsoft 托管版本 | 主要为 OpenAI 模型,在开源 CLI 中支持可配置的提供商 |
可扩展性 | 极为出色:几乎所有组件均可替换 | 强大:技能(skills)、钩子(hooks)、MCP、插件及代理团队 | 强大:技能(skills)、MCP、自定义代理、SDK 及应用服务器 |
产品成熟度 | 开发者预览版;预计会出现不兼容变更 | 已确立的商用产品 | 已确立的商用产品加开源 CLI |
许可证 | MIT 许可证 | 商用产品,具备可扩展性接口 | Codex CLI 为开源;云服务与应用服务为托管产品 |
DeepSeek Harness 则更强调模块化与可替换性:模型本身是另一个插件,而非垂直整合堆栈中必然居于中心的位置。
DeepSeek 的代码仓库在发布当日即已吸引大量开发者关注,截至 8 月 13 日,GitHub 星标数约为 27,500 颗,Fork 数约为 2,000 次;不过这些快速变动的数字更宜视作快照,而非采用率指标。
V4-Pro 获得面向代理功能的升级
Harness 与 DeepSeek-V4-Pro-0813 的正式发布(general-availability)同步推出。
DeepSeek 最初于 4 月以预览形式推出 V4 系列。 该系列产品包括参数量达 1.6 万亿的 V4-Pro(每 token 激活 490 亿参数),以及参数量较小的 V4-Flash(2840 亿参数,每 token 激活 130 亿参数)。两者均支持最高达一百万 token 的上下文窗口。
因此,DeepSeek 于 8 月 13 日发布的版本并非 V4-Pro 的首次亮相,而是从早期预览版向更新后的正式版本的过渡,DeepSeek 特别强调了其代理性能。
DeepSeek 在其 API 网站上表示:“DeepSeek-V4-Pro 正式版现已发布,显著增强了代理能力,并支持 Responses API 与 Codex 集成。它目前已全面开放于网页端、移动应用及 API 接口;我们欢迎各位进行测试并提供反馈。”
DeepSeek 的更新日志同样指出,该正式发布版本的模型具备“显著增强的代理能力”,尤其体现在生产环境中。使用 API 的开发者无需更改模型标识符: deepseek-v4-pro 现解析为最新版 V4-Pro。
该公司还新增了原生 OpenAI Responses API 支持,从而降低了已基于该接口构建的应用程序所需的集成工作量。
DeepSeek 表示,V4-Pro 针对 OpenAI 自有的开源 harness Codex 进行了优化,支持一键式设置。其当前 API 文档列出的 V4-Pro 与 V4-Flash 共同支持的接口包括:Responses API、工具调用(tool calling)、JSON 输出,以及 Anthropic 格式 API。
对于直接使用 DeepSeek(而非通过 API)的开发者,V4-Pro 现可通过该公司应用及网站上的“专家模式”(Expert Mode)访问。
推理开销成为另一项部署调节参数
DeepSeek 还将推理开销(reasoning effort)明确设为 V4-Pro 与 V4-Flash 的一项跨平台可控参数。
V4模型文档描述了三个层级:非思考(Non-think),专为快速常规任务设计;高思考(Think High),适用于更复杂的解决问题和规划任务;最大思考(Think Max),为困难问题分配显著更多的推理资源。
该区分在代理系统(agent systems)的实际运行中可能具有重要意义,因为每一步都启用最大推理能力会不必要地消耗时间与token。例如,一个编程代理(coding agent)在检查文件或执行常规工具调用时可能仅需相对较少的推理能力,而在诊断复杂bug或规划多阶段代码变更时则会加大推理投入。
DeepSeek最新发布的基准测试表显示,0813模型在面向代理(agent-oriented)的测试中实现了大幅改进,尽管这些数据由该公司自行报告,且部分结果依赖于测试框架(harness)的具体配置。
DeepSeek报告V4-Pro-0813模型在各项基准测试中的得分为: Terminal Bench 2.1上为87.9分,Toolathlon-Verified上为74.1分,DSBench-FullStack上为71.1分,DSBench-Hard上为67.2分。它并未在DeepSeek自身发布的基准测试表中每一项均领先:例如Fable 5在Toolathlon-Verified上得分为77.9,在DSBench-FullStack上得分为77.2。
基准测试表下方隐藏着一项尤为重要的限定说明:对于公开的Code Agent任务,DeepSeek表示V4-Pro-0813是在其即将推出的DeepSeek Harness的“最小模式”(minimal mode)下进行测试的。
换言之,伴随Harness一同发布的部分代理测试结果,并非纯粹的模型基准测试结果;它们衡量的是模型在代理执行环境(agent execution environment)内部的运行表现——而这正是DeepSeek当前正向开发者发布的软件层。
DeepSeek API定价轨迹出现显著逆转。
对已在生产环境中部署DeepSeek的团队而言,更重大的即时变化可能在于定价。
DeepSeek当前API文档列明:V4-Flash模型在缓存未命中(cache-miss)输入token上的价格为每百万token 0.14美元,输出token为每百万token 0.28美元;而V4-Pro模型的缓存未命中输入token价格为每百万token 0.435美元,输出token为每百万token 0.87美元。缓存命中(cache hits)价格则大幅降低:Flash为每百万token 0.0028美元,Pro为每百万token 0.003625美元。
这些价格本身已较V4最初于4月发布时的定价大幅下调。V4于4月发布时,V4-Pro的缓存未命中输入token价格为每百万token 1.74美元,输出token为每百万token 3.48美元。至5月下旬,DeepSeek已将降价幅度永久定为75%,进一步强化其作为高吞吐量代理工作负载(high-volume agent workloads)异常低成本选项的定位。如今,这一趋势正转向相反方向。
自8月16日16:00 UTC起,DeepSeek将根据API调用发生的时间段收取不同费率。高峰时段为UTC时间01:00–04:00及06:00–10:00(对应美国东部时间晚9:00至午夜12:00,以及凌晨2:00至上午6:00),其余时段均归类为非高峰时段。非高峰时段费率均为对应高峰时段费率的一半。
对于V4-Flash模型,非高峰时段缓存未命中输入价格将从每百万token 0.14美元升至0.22美元,输出价格则从0.28美元升至0.66美元;高峰时段费率则分别达到0.44美元(输入)与1.32美元(输出)。
V4-Pro模型当前缓存未命中输入价格为每百万token 0.435美元、输出为0.87美元;调整后,非高峰时段价格将分别升至0.66美元与1.98美元;高峰时段则升至1.32美元(输入)与3.96美元(输出)。
缓存输入(cached input)的价格涨幅更为显著:V4-Pro缓存命中价格将从当前每百万token 0.003625美元升至非高峰时段0.022美元、高峰时段0.044美元;V4-Flash则从0.0028美元升至非高峰时段0.007美元、高峰时段0.014美元。
模型 | 旧输入价格(每100万token) | 旧输出价格(每100万token) | 旧总成本(100万输入+100万输出) |
deepseek-v4-flash | $0.14 | $0.28 | $0.42 |
deepseek-v4-pro | $0.435 | $0.87 | $1.305 |
新定价仍使DeepSeek通过API成为相较于西方专有实验室(Western proprietary labs)的经济型替代方案,但 路透社周四报道称 依据所选模型、token类别及使用时段的不同,此次调价幅度介于现有费率的50%至逾1100%之间。
模型 | 输入(美元/每百万token) | 输出(美元/每百万token) | 总计(美元/每百万token) | 来源 |
$0.10 | $0.20 | $0.30 | ||
MiMo-V2.5 Flash | $0.10 | $0.30 | $0.40 | |
DeepSeek-V4-Flash — 非高峰时段 | $0.22 | $0.66 | $0.88 | |
GPT-5.6 Luna | $0.20 | $1.20 | $1.40 | |
MiniMax-M3 | $0.30 | $1.20 | $1.50 | |
LongCat-2.0 — 限时促销 | $0.30 | $1.20 | $1.50 | |
DeepSeek-V4-Flash — 高峰时段 | $0.44 | $1.32 | $1.76 | |
MiMo-V2.5 | $0.40 | $2.00 | $2.40 | |
DeepSeek-V4-Pro — 非高峰时段 | $0.66 | $1.98 | $2.64 | |
LongCat-2.0 — 标准版 | $0.75 | $2.95 | $3.70 | |
MiMo-V2.5 Pro(≤256K) | $1.00 | $3.00 | $4.00 | |
DeepSeek-V4-Pro — 高峰时段 | $1.32 | $3.96 | $5.28 | |
Muse Spark 1.1 / 1.2 | 1.25美元 | 4.25美元 | 5.50美元 | |
GLM-5.2 | 1.40美元 | 4.40美元 | 5.80美元 | |
Grok 4.6 — <200K 提示词(prompt tokens) | 2.00美元 | 6.00美元 | 8.00美元 | |
MiMo-V2.5 Pro(>256K) | 2.00美元 | 6.00美元 | 8.00美元 | |
Qwen3.8-Max | 2.00美元 | 6.00美元 | 8.00美元 | |
Gemini 3.6 Flash | 1.50美元 | 7.50美元 | 9.00美元 | |
GPT-5.6 Terra | 2.00美元 | 12.00美元 | 14.00美元 | |
Grok 4.6 — ≥200K 提示词(prompt tokens) | 4.00美元 | 12.00美元 | 16.00美元 | |
GPT-5.4 | 2.50美元 | 15.00美元 | 17.50美元 | |
Kimi K3 | 3.00美元 | 15.00美元 | 18.00美元 | |
Claude Opus 5 | 5.00美元 | 25.00美元 | 30.00美元 | |
Sakana Fugu Ultra(≤272K) | 5.00美元 | 30.00美元 | 35.00美元 | |
GPT-5.6 Sol — 标准模式 | 5.00美元 | 30.00美元 | 35.00美元 | |
Claude Fable 5 / Claude Mythos 5 | 10.00美元 | 50.00美元 | 60.00美元 | |
GPT-5.6 Sol — 快速模式 | 10.00美元 | 60.00美元 | 70.00美元 |
这使得‘低50%’的非高峰时段定价表述在缺乏上下文的情况下可能具有误导性。非高峰时段价格比DeepSeek的 新 高峰时段费率低50%;它并非比开发者当前所支付的API价格低50%。
对于一个简单工作负载(包含一百万个缓存未命中输入token及一百万个输出token),V4-Pro当前费用为1.305美元。相同token组合在非高峰时段将花费2.64美元,约为当前价格的两倍;在高峰时段则需5.28美元,超过当前价格的四倍。
V4-Flash在相同简单计算下,价格从0.42美元升至非高峰时段0.88美元、高峰时段1.76美元。
实际应用成本将因缓存输入、未缓存输入与生成输出之间的比例不同而产生显著差异,因此上述综合数字仅具说明性,而非普适的总成本估算。
DeepSeek正向上推进其智能体(agent)技术栈
时机选择使得这一战略方向难以被忽视。
当DeepSeek于4月24日发布V4预览版时,主要关注点在于该公司如何凭借一种异常高效的架构交付前沿级能力。
V4-Pro采用混合注意力设计,结合了压缩稀疏注意力(Compressed Sparse Attention)与高度压缩注意力(Heavily Compressed Attention);在百万token上下文长度下,DeepSeek称其单token推理所需FLOPs仅为V3.2的27%,KV缓存需求仅为V3.2的10%。
至5月下旬,讨论焦点已转向这些效率优势对高吞吐量智能体的经济意义——此类智能体反复读取上下文,使缓存成为推理成本的重要组成部分。DeepSeek大幅下调V4价格进一步放大了该优势。
8月13日发布的更新将竞争再向上推进一层。
DeepSeek现已推出经优化的V4-Pro版本,专为智能体工作负载调优;提供标准化接口,旨在更便捷地对接现有开发者工具;支持可配置的推理努力程度;并提供MIT许可证授权的控制框架(harness),用于管控模型、工具、沙箱、文件系统及智能体周边的编排流程。
与此同时,DeepSeek正表明开发者不应假设其激进的低价API费率会永久维持。对于正在评估该平台的组织而言,工作负载调度、缓存行为以及在自有基础设施上运行开源权重模型的选项,如今已成为总成本计算中更为重要的组成部分。
这使得DeepSeek同时追求两种潜在相互冲突的优势:一方面使其智能体技术栈更具可访问性与开放性,另一方面又使其自托管API价格显著提高。
对企业级开发者而言,“Harness”最终可能成为周四公告中更具深远影响的部分。模型可通过标准化接口日益灵活地互换;但控制智能体如何进行推理、调用工具、编辑软件以及在工作流中持续保存状态的Harness,则往往更难替代。
DeepSeek如今亦开始竞逐这一层级。
JOTO 企业落地观察
- 对企业部署而言,V4-Pro 新增的推理开销分级(Non-think/Think High/Think Max)要求团队必须重构智能体任务调度逻辑——简单文件操作与复杂 Bug 诊断需动态分配不同推理强度,否则将显著推高 token 成本。
- 对智能体工程而言,Harness 的‘一切皆插件’架构虽提升模块替换自由度,但其开发者预览状态及明确声明的破坏性变更警告,意味着企业无法直接用于生产环境,需投入额外适配与封装成本。
- 对 AI 安全治理而言,Harness 支持沙箱、审批策略与细粒度权限配置,但所有安全机制均依赖插件实现而非内置强制策略,实际防护能力高度依赖开发者选型与集成质量,不构成开箱即用的安全保障。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


