DeepSeek Harness 0.1.2-rc.1 实测:首个候选版,离 1.0 还有多远
DeepSeek 开源 Agent 运行时 DeepSeek Harness 于 9 月 3 日发布 0.1.2-rc.1 候选版本,标志功能冻结、进入质量攻坚阶段。实测显示其具备完整‘写-跑-验’闭环、自我纠错能力及接口兜底逻辑;rc.1 版本强化透明度、多 Agent 编排与跨平台支持,但破坏性变更仍存、插件生态尚处早期。
rc.1 的定位:功能冻结,冲刺正式版
9 月 3 日,DeepSeek 官方开源 Agent 运行时 DeepSeek Harness(简称 dsh)发布了 0.1.2-rc.1——0.1.2 系列的第一个候选版本(Release Candidate)。rc 的意思很明确:功能基本冻结,接下来的重点从加新功能转向修 bug、稳质量,为正式版铺路。
这套迭代节奏值得单独说一下。看 release 记录:9 月 1 日 0.1.2-alpha.4、2 日 alpha.5、3 日就推到 rc.1,连续三天一天一版。对一个开源 Agent 运行时来说,这种速度背后是明确的信号:项目在冲刺。我拿 headless 模式真跑了两轮,结论放在下面。
任务一:写脚本 + 跑 + 验,一次通过并主动加验
任务:写一个生成 100 个 1-1000 随机整数的 Python 脚本,统计平均值、中位数、最大最小值并运行。dsh 一次通过:生成脚本、实际运行,输出平均值 508.97、中位数 521.0、最大 995、最小 4,全部落在合理范围。
它没停在"写完了"。连跑 5 次做自动化校验,确认每次都恰好 100 个数、均值都稳定在 500 附近——这一步是模型自发加的,任务里没要求。
亮点:"写-跑-验"闭环完整,验证环节主动加码。局限:任务本身简单,看不出长链条能力。
模型:deepseek-v4-flash · headless 模式 · macOS
任务二:带网络的真实任务,自我纠错与接口兜底
任务:写脚本抓今日头条热榜前 5 条并打印热度值,跑不通就自动换百度热搜。这个任务含真实网络请求,最能看出 Agent 的临场能力。两个细节值得讲。
第一个:它中途用编辑工具改文件时,把自己写的函数改坏了——旧函数体和新的定义混在一起。它没有继续往下跑,自己重读文件发现问题,选择整文件重写,恢复干净状态再继续。写坏→自查→修复→继续,这套自我纠错发生在一次任务内部。
第二个:任务要求头条失败就换百度,它照做且做得更细。它发现百度 wise 接口返回的数据里没有热度字段(hotScore),试了加 cookie、加请求头都不行,自动改用同接口的 platform=pc 重试,成功拿到热度值,还把发现写进了脚本注释。最终头条热榜 Top 5 正常抓出:林肯号航母消费 1 亿泰铢以 1958 万 热度排第一。
亮点:自我纠错 + 接口字段探测是真实的临场能力。局限:中途改坏文件说明编辑工具的原子性还有提升空间。
两个任务全程不到三分钟,期间无人工干预

rc.1 关键变更:透明度、编排与开放性
官方 changelog 有几十项,挑几个跟普通用户关系大的:
透明度和审计在加强。会话流默认折叠过程内容,回答末尾直接显示 token 用量和耗时,点开看精确统计——上一版想看清一次任务花了多少 token 没那么容易。回合导航支持预览和跳转任意历史轮次。
多 Agent 和模型编排是变化最密的地方。子代理可以在授权范围内自己选模型,调用方也能指定提供方、模型、推理力度,甚至能为 Claude Code、Codex 单独配置模型;父子 Agent 之间从单向 report 升级成 send_message 双向对话。
开放性和跨平台同步补齐。Python SDK 新增 Windows x64 运行时(之前只有 macOS/Linux),ACP 协议补齐会话控制、模型设置、MCP、权限和取消能力,Web 界面开始支持第三方语言,实验性的 Inspector 和 Web Preview 也上线了。
社区还有个信号:oh-my-dsh 开源社区推出帮插件作者跟着版本升级插件代码的专用 skill。开始有人专门维护"升级"这件事,说明外面已经有不少人基于 dsh 写插件了。
变更来源:官方 GitHub Releases · dsh-v0.1.2-rc.1
离 1.0 还有多远?两个悬而未决的变量
说回标题的问题:rc.1 离 1.0 还有多远?从这次实测看,核心 Agent 能力(写代码、跑命令、调网络、自我纠错)已经相当能打,UI 和多 Agent 编排在快速补齐。两个变量还悬着:0.1.x 的破坏性变更还时有发生(官方自己都提醒过),插件生态刚起步,离"装了就能用"还有距离。候选版的意义正在于此——功能不砍了,剩下的交给 bug 修复和社区反馈去磨。
dsh 是目前开源 Agent 运行时里迭代最快、最值得盯的一个。它和 Hermes 的定位差异没变——dsh 赌"一切皆插件"的极简内核,Hermes 赌开箱即用的完整生态。rc.1 把前者的完成度又推高了一截,两边真正分胜负,要等 1.0 之后。等正式版出来,我再跑一轮给你看。
JOTO 企业落地观察
- 企业若评估将 DeepSeek Harness 引入智能体工程,需注意其当前版本尚未内置企业级 RAG 知识注入通道与权限沙箱机制;'写-跑-验'闭环虽可验证逻辑正确性,但无法替代生产环境所需的结构化知识绑定与操作审计留痕。
- rc.1 对 ACP 协议的增强使多模型协同成为可能,但企业需自主设计模型路由策略与上下文传递规范;运行时本身不提供跨模型状态一致性保障,团队须在应用层补全会话状态同步与错误传播拦截逻辑。
- 插件生态处于早期阶段,企业若计划基于 dsh 构建行业 Agent,将承担大量基础工具链开发成本;缺乏经验证的通用插件市场,意味着 FDE 驻场共创需从零构建调试、部署与版本兼容体系,无法复用成熟社区组件。
- 自我纠错能力在真实网络任务中体现价值,但其触发完全依赖模型内部判断;企业若要求确定性故障恢复,必须在运行时之外叠加可观测性探针与人工干预熔断点,不可将自治能力视为生产就绪的充分条件。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


