JOTO
Contact us
← AI 智库
开源模型

DeepSeek Harness 0.1.2-rc.1 实测:首个候选版,离 1.0 还有多远

2026 年 9 月 7 日

DeepSeek 开源 Agent 运行时 DeepSeek Harness 于 9 月 3 日发布 0.1.2-rc.1 候选版本,标志功能冻结、进入质量攻坚阶段。实测显示其具备完整‘写-跑-验’闭环、自我纠错能力及接口兜底逻辑;rc.1 版本强化透明度、多 Agent 编排与跨平台支持,但破坏性变更仍存、插件生态尚处早期。

rc.1 的定位:功能冻结,冲刺正式版

9 月 3 日,DeepSeek 官方开源 Agent 运行时 DeepSeek Harness(简称 dsh)发布了 0.1.2-rc.1——0.1.2 系列的第一个候选版本(Release Candidate)。rc 的意思很明确:功能基本冻结,接下来的重点从加新功能转向修 bug、稳质量,为正式版铺路。

这套迭代节奏值得单独说一下。看 release 记录:9 月 1 日 0.1.2-alpha.4、2 日 alpha.5、3 日就推到 rc.1,连续三天一天一版。对一个开源 Agent 运行时来说,这种速度背后是明确的信号:项目在冲刺。我拿 headless 模式真跑了两轮,结论放在下面。

任务一:写脚本 + 跑 + 验,一次通过并主动加验

任务:写一个生成 100 个 1-1000 随机整数的 Python 脚本,统计平均值、中位数、最大最小值并运行。dsh 一次通过:生成脚本、实际运行,输出平均值 508.97、中位数 521.0、最大 995、最小 4,全部落在合理范围。

它没停在"写完了"。连跑 5 次做自动化校验,确认每次都恰好 100 个数、均值都稳定在 500 附近——这一步是模型自发加的,任务里没要求。

亮点:"写-跑-验"闭环完整,验证环节主动加码。局限:任务本身简单,看不出长链条能力。

模型:deepseek-v4-flash · headless 模式 · macOS

任务二:带网络的真实任务,自我纠错与接口兜底

任务:写脚本抓今日头条热榜前 5 条并打印热度值,跑不通就自动换百度热搜。这个任务含真实网络请求,最能看出 Agent 的临场能力。两个细节值得讲。

第一个:它中途用编辑工具改文件时,把自己写的函数改坏了——旧函数体和新的定义混在一起。它没有继续往下跑,自己重读文件发现问题,选择整文件重写,恢复干净状态再继续。写坏→自查→修复→继续,这套自我纠错发生在一次任务内部。

第二个:任务要求头条失败就换百度,它照做且做得更细。它发现百度 wise 接口返回的数据里没有热度字段(hotScore),试了加 cookie、加请求头都不行,自动改用同接口的 platform=pc 重试,成功拿到热度值,还把发现写进了脚本注释。最终头条热榜 Top 5 正常抓出:林肯号航母消费 1 亿泰铢以 1958 万 热度排第一。

亮点:自我纠错 + 接口字段探测是真实的临场能力。局限:中途改坏文件说明编辑工具的原子性还有提升空间。

两个任务全程不到三分钟,期间无人工干预

DeepSeek Harness 实测过程截图
▲ 实测实录:两个任务一次跑通,含自动校验、自我纠错与接口兜底

rc.1 关键变更:透明度、编排与开放性

官方 changelog 有几十项,挑几个跟普通用户关系大的:

透明度和审计在加强。会话流默认折叠过程内容,回答末尾直接显示 token 用量和耗时,点开看精确统计——上一版想看清一次任务花了多少 token 没那么容易。回合导航支持预览和跳转任意历史轮次。

多 Agent 和模型编排是变化最密的地方。子代理可以在授权范围内自己选模型,调用方也能指定提供方、模型、推理力度,甚至能为 Claude Code、Codex 单独配置模型;父子 Agent 之间从单向 report 升级成 send_message 双向对话。

开放性和跨平台同步补齐。Python SDK 新增 Windows x64 运行时(之前只有 macOS/Linux),ACP 协议补齐会话控制、模型设置、MCP、权限和取消能力,Web 界面开始支持第三方语言,实验性的 Inspector 和 Web Preview 也上线了。

社区还有个信号:oh-my-dsh 开源社区推出帮插件作者跟着版本升级插件代码的专用 skill。开始有人专门维护"升级"这件事,说明外面已经有不少人基于 dsh 写插件了。

变更来源:官方 GitHub Releases · dsh-v0.1.2-rc.1

离 1.0 还有多远?两个悬而未决的变量

说回标题的问题:rc.1 离 1.0 还有多远?从这次实测看,核心 Agent 能力(写代码、跑命令、调网络、自我纠错)已经相当能打,UI 和多 Agent 编排在快速补齐。两个变量还悬着:0.1.x 的破坏性变更还时有发生(官方自己都提醒过),插件生态刚起步,离"装了就能用"还有距离。候选版的意义正在于此——功能不砍了,剩下的交给 bug 修复和社区反馈去磨。

dsh 是目前开源 Agent 运行时里迭代最快、最值得盯的一个。它和 Hermes 的定位差异没变——dsh 赌"一切皆插件"的极简内核,Hermes 赌开箱即用的完整生态。rc.1 把前者的完成度又推高了一截,两边真正分胜负,要等 1.0 之后。等正式版出来,我再跑一轮给你看。

JOTO 企业落地观察

  • 企业若评估将 DeepSeek Harness 引入智能体工程,需注意其当前版本尚未内置企业级 RAG 知识注入通道与权限沙箱机制;'写-跑-验'闭环虽可验证逻辑正确性,但无法替代生产环境所需的结构化知识绑定与操作审计留痕。
  • rc.1 对 ACP 协议的增强使多模型协同成为可能,但企业需自主设计模型路由策略与上下文传递规范;运行时本身不提供跨模型状态一致性保障,团队须在应用层补全会话状态同步与错误传播拦截逻辑。
  • 插件生态处于早期阶段,企业若计划基于 dsh 构建行业 Agent,将承担大量基础工具链开发成本;缺乏经验证的通用插件市场,意味着 FDE 驻场共创需从零构建调试、部署与版本兼容体系,无法复用成熟社区组件。
  • 自我纠错能力在真实网络任务中体现价值,但其触发完全依赖模型内部判断;企业若要求确定性故障恢复,必须在运行时之外叠加可观测性探针与人工干预熔断点,不可将自治能力视为生产就绪的充分条件。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.