关于DeepSeek Harness,业界有六种不同的声音
DeepSeek于8月13日开源agent运行时Harness,两天内GitHub星标破十万。文章梳理业界六类典型反馈:任务响应速度归因争议、v0.1版本稳定性与伪开源质疑、插件化带来的治理成本、是否需要新框架的定位分歧、峰谷计价实质涨价、以及开源不等于去中心化的主权问题。作者基于源码阅读与实测提出中立判断。
8 月 13 日,DeepSeek 将自家的 agent 运行时 Harness 开源,并选在与 V4-Pro 同一天发布。两天内仓库冲到十万 star,关注度很高。现在是117K(截至8月16日上午12:00)

我顺手把它的源码通读了一遍(用WorkBuddy读了一遍),还写了一个插件并跑通测试。开发者讨论的热点,我归为六种声音,每一种都尽量用代码和事实进行了验证:哪些是真实能力,哪些是被放大的情绪,哪些是被精心包装的表述。
声音一:能干活,但慢是任务的问题
博主程序员鱼皮做了四个任务:注意力残差站约 20 分钟、缓存 99%,3D 竹知了游戏约 40 分钟、缓存近 100%,四单总花费不到 5 元。
Reddit 上有用户用 V4 Flash 写 Three.js 滑沙游戏,认为 DSH 比 Reasonix 和 Codex 更顺手。
小红书上有用户称,一个 Bug 修了一小时,两次各思考一小时答案仍然错误。53ai 的实测里,复杂数据处理 DSH 用了 50 分钟,比接 WorkBuddy 的 33 分钟更慢。
我的观点:
两方数据都不假,但把慢归因于产品本身并不准确。慢主要来自任务复杂度。同一批实测里,做 PPT 约 3 分钟、建站约 7 分钟、财报分析约 1.5 分钟。复杂任务交给任何 coding agent 都需要长时间,这是任务属性,不是 DSH 的缺陷。
我自己写的 project_brief 插件九个测试全部通过,至少说明 Model+Harness 这条路径是成立的,并非空谈。
声音二:0.1 就是 0.1,外加伪开源争议
GitHub 上的问题清单比较具体:MSYS2 启动静默失败返回 127、插件热更新命中旧缓存、任务结束后主分支仍显示执行中、Windows 极简预设未经审批就写入工作区外。更深的是持久化问题:事件写入采用 200 毫秒的批量延迟,界面重载可滞后约 50 分钟,有人看到屏幕显示 5/9,实际已经跑完 9/9。
另一桩争议是伪开源。DeepSeek 关闭了 GitHub 的 Issues 功能,反馈通道被限制。

我的观点:
当前 DSH 确实属于 v0.1 早期产品,但是这些问题会随着版本迭代修复,不构成架构层面的否定。但关闭 Issues 是一个值得记录的治理信号,它和后面常被提及的"公共底座"定位存在疑惑。一个号称开源、欢迎共建的项目,先收窄了提意见入口,说实话个人觉得有点不够大气。
声音三:一切皆插件,治理成本不低
工程派也是有一些担忧,InfoQ 指出,插件边界越深,接口稳定性、依赖管理、版本兼容、调试难度都随之上升,v0.1 阶段进入生态要承担较高的迁移成本。另有分析指出,可逆不等于事务:框架只能回收声明过的资源,无法补偿已经发出的网络消息、已经写出的共享文件,或一笔已执行的支付。
另一头是控制点的讨论。Reddit 上已经有人把 OpenAI 兼容的模型接入 DSH,也有人用 Hermes 当作委托式编程引擎。小红书上的高赞观点是:模型会更换,但工具、Session、记忆、沙箱、子 Agent 调度,以及长期留存的轨迹始终存在;谁掌握 Harness,谁就站在模型和应用之间。

我的观点
这正是我从源码读到的结论。Cordis 框架把"换零件不残留"做成强制保证——我特意读了 fiber.ts,DeepSeek 前后打了 18 个补丁,核心目的之一就是硬化 Fiber 的生命周期。可组合性越强,接口契约的稳定压力就越外推给整个生态。工程派说的治理债,和战略派说的底座,是同一机制的两面。
我写的插件能从本地文件系统一键切到远程沙箱 fs-e2b,无需改动代码。这验证了能力接缝(seam)确实可替换。但代价也明摆着:这种自由度依赖生态共同维护契约。

声音四:还需要又一个 agent 框架吗
HN 上有用户写了一个薄桥接层,让 DeepSeek 直接走 Codex,缓存命中输入约 3900 万、未命中仅约 170 万,结论是可复用的成熟 Harness 已经能用缓存,未必需要原生的。
另一种判断更清晰:WorkBuddy 拼的是产品体验,DSH 争的是运行时。有人说它没打算把你伺候舒服,默认你是来拆东西的,和 Claude Code 那种产品感是两条路线。
我的观点:
这不是零和游戏,Claude Code 是成品,DSH 是底座,两者并不冲突。怀疑派低估的是底座的长期杠杆——框架可以开源,但规矩的解释权并不随开源自动转移。
声音五:峰谷计价,实质是涨价
数字可以对上。当前 V4 Flash 输出价 0.28 美元、Pro 0.87 美元;8 月 17 日零点起分峰谷,Flash 谷 0.66、峰 1.32,Pro 谷 1.98、峰 3.96。另有信源补充,V4-Pro 输出峰值从 0.87 拉到 3.96,约为 4.6 倍,且低谷 1.98 仍高于旧峰值;DeepSeek 事后还删去了 significantly enhanced agent capabilities 这句措辞。

我的观点:
分时段这个表述弱化了涨价的实质。Flash 输出低谷价 0.66 相对现价 0.28 上涨约 136%,Pro 上涨约 128%,且低谷价仍高于旧的峰值价。更关键的是,agent 运行时的 token 消耗远高于对话——长会话叠加工具调用,真实账单的位移比单价更显著。另外,我当前的模型已经全面切换到 DeepSeek-V4-Flash,速度,聪明程度都是比较不错的,贵点没事(个人观点)。
声音六:开源,不等于去中心化
Koji 的观点是,不要把它理解成产品,这是战略,把内部研发变成公开的并行实验。Flask 作者 Armin Ronacher 也认为其中有些想法值得借鉴,让他重新思考自家 Harness 的重构。
反向声音也有。宝玉认为软件自进化可能是伪命题,会带来更大混乱,并举了 OpenClaw 的反面例子。
官方那句最常被引用:我们的仓库是灵感,不是标准答案。表述谦逊,但有两个问题需要追问:谁决定什么能进 master?谁定义什么是破坏性更新?答案仍是 DeepSeek。这像一个主人说我家大门常打开欢迎来玩,但菜单由他定、谁上桌由他批、玩不玩得下去由他说了算。开源是开源,主权是主权,两件事要分开看。
总结一下
第一,DeepSeek 这步棋在架构上是诚实的。它不再只满足于做模型供应商,而是补上了执行层;并且没有做成封闭花园,而是做成了可被任意组合的底座。我去翻过源码,没有用花哨概念糊弄人,这一点值得肯定。
第二,但公共底座、并行实验这些词需要被审慎看待。底座目前仍是 DeepSeek 的底座,实验的准入和解释权也仍在它手里。三百多个插件看上去很热闹,能不能长成自演进的生态,还是退化为一座精装样板间,才是真正要观察的。
热闹会过去,代码会留下,我们盯着看就行,DSH 加油!
JOTO 企业落地观察
- 企业部署智能体系统时,需明确区分「运行时底座」与「端到端产品」:DSH 定位属前者,其价值不在开箱即用,而在可审计、可替换、可嵌入现有CI/CD与安全网关的能力。
- 插件化架构虽提升灵活性,但企业级落地必须配套建立插件准入、沙箱隔离、副作用审计三道防线,否则将把模型风险转嫁为运维风险。
- 峰谷计价模式暴露了智能体运行时的成本不可预测性——企业需在RAG知识工程阶段前置评估工具链调用频次与token放大系数,而非仅关注LLM单价。
- 开源不等于治理权移交。企业若将DSH纳入生产环境,须自主承担运行时升级策略、补丁验证流程与回滚机制设计,不能默认依赖上游节奏。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


