DeepSeekHarness刷屏后,又一种Harness新玩法
DeepSeek发布DeepSeek Harness v0.1开发者预览版,提出‘Model + Harness = Agent’范式,强调harness作为模型外层壳的设计决定Agent上限。文章对比DeepSeek Harness(通用执行层元框架)与港大HKUDS的DeepTutor(学习场景垂直harness),指出二者分别代表‘横向可组合性’与‘纵向领域深度’两种进化路径,并通过核心数据结构、记忆设计、反馈回路等维度展开分析。
DeepSeek Harness:一切皆插件的通用执行层基础设施
昨天晚上,AI 圈被一条消息刷屏:DeepSeek 正式发布了 DeepSeek Harness v0.1 开发者预览版,GitHub 仓库半天不到冲上两三万星。

官方给的公式极其简洁:Model + Harness = Agent。模型负责思考推理,Harness 负责其他一切——上下文调度、工具调用、任务状态、反馈与边界。
但比发布本身更值得注意的是 DeepSeek 对这个品类的盖章:当模型能力趋同,胜负手在 harness——套在模型外面的那层壳怎么设计,决定了 Agent 的上限。
DeepSeek Harness 的设计信条就一句话:一切皆插件。
模型、工具、技能、会话、沙箱、存储、循环、调度、UI——所有 Agent 能力都是插件,跑在一个叫 Cordis 的元框架上(底层理念来自北大与 DeepSeek 联合署名的"时空可组合性"论文)。
Cordis 只管插件的挂载、卸载和依赖关系,插件之间通过服务和事件协作。开发者不改一行源码,就能在配置层替换任何组件。
它内置四种模式:
- 标准模式(完整工具链的 coding agent)
- PTC 模式(模型生成代码来编排多轮工具调用)
- 极简模式(只留 shell + 文件编辑器,用于模型基准测试)
- 创造模式(检视运行时、在内存里试验插件、组合出新模式)。
另一个值得注意的设计是轨迹(Trajectory)。
模型看到的一切:系统提示词、思维链、工具调用与结果、子 Agent 调度、每一次上下文注入——全部写入仅追加(append-only)的会话日志,恢复、分叉、检索、回放都基于同一条事件流。
DeepSeek Harness 的定位是"通用执行层基础设施":它不做任何领域假设,赌的是"可组合性"——harness 的正确形态是一套什么都能插拔的元框架。
这是一条非常合理的路。但它是"横向"的路。
而 DeepTutor 走的是完全相反的"纵向"路线。
DeepTutor:为"学习者"建模的垂直 harness
DeepTutor 的论文开篇指出的问题非常锋利。现有教育类 Agent 是两座"孤岛":辅导系统诊断出你的错误,但诊断用完即弃;出题系统能生成好题,但出题依据是预设目标,而不是"你最近刚错在哪"。

(a)(b) 此前的辅导与出题 Agent 各自为战、任务局部;
(c) DeepTutor 用混合个性化引擎把辅导痕迹与个性化练习接成闭环
根因是:系统里没有细粒度、持续进化的学习者模型。
它的解法,是一个叫混合个性化引擎的架构,给每个 Agent 的每一步提供两种上下文——领域专长(静态知识奠基 SKG)和学习者感知(动态个人记忆 DPM)。

左侧个性化辅导管线,右侧个性化出题管线,中间是共享的混合个性化引擎*

SKG 把你的教材、论文、笔记拆成原子单元,建双索引:知识图谱管概念间的结构关系,embedding 索引管语义相似,查询时双路召回 + RRF 融合。
这和 Cursor 对代码库建索引思路同构——只不过一个索引函数依赖,一个索引概念依赖。
真正的重头戏是 DPM,核心数据结构叫 Trace Forest(痕迹森林):你的每一次完整学习交互被存成一棵三层树——L1 会话摘要、L2 规划单元、L3 细粒度执行记录(每次工具调用的输出、证据、校验结果),每个节点带 embedding,全森林语义可检索。
森林之上,三个专门的记忆 Agent 持续"复盘"你的痕迹,维护三视图学习者画像:𝒟s(会话历史与趋势)、𝒟w(有证据支撑的弱点清单)、𝒟r(教学反思——哪种讲法对你有效)。
画像不是对最近对话做一遍摘要,而是一次"工具中介的分析过程"。
最后是角色化注入:规划器拿 𝒟s+𝒟w,写作器拿 𝒟r,出题 Agent 拿 𝒟w 加历史出题模式——按角色做记忆的精确路由,token 预算在知识上下文和记忆上下文之间动态分配。
引擎之上两条管线也很讲究:辅导管线先调查再规划(investigate-before-plan),分步引导求解,循证迭代写作,每句话带可溯源引用;
出题管线先透过"你的弱点"这个透镜生成候选构思,再由一个和生成器不共享推理链的独立校验器把关,计算题还要进沙箱跑代码。
于是形成闭环:辅导暴露的弱点决定下一批题怎么出,做题的结果反过来修正下一次讲解。
五家主流 Harness 大对比
铺垫完了,上总表:
| 维度 | DeepSeek Harness | Cursor | Claude Code / Codex | DeepTutor |
|---|---|---|---|---|
| 定位 | 通用执行层元框架 | IDE 内的 coding harness | 终端/云端 coding harness | 学习场景垂直 harness |
| 核心数据结构 | 插件 + 事件流 | 代码库索引 | repo + CLAUDE.md / 任务沙箱 | Trace Forest + 学习者画像 |
| 记忆设计 | append-only 会话日志(可回放/分叉) | 代码索引 + 规则记忆 | 项目记忆文件 | 三层痕迹森林,蒸馏为 𝒟s/𝒟w/𝒟r |
| 反馈回路 | 轨迹可观测,靠人/评测判分 | 编译器、lint、测试 | 编译器、测试、PR | 独立校验器 + 学生模拟器 |
| 扩展方式 | 一切皆插件,配置层重组 | 官方产品功能迭代 | MCP / 子代理 / 技能 | 技能插件 + 可收编 Claude Code、Codex 当子代理 |
| 优化目标 | 让开发者能造任何 Agent | 编程任务完成率 | 编程任务完成率 | 学习者的能力增长 |
这张表里,我想划三个重点。
重点一:DeepSeek Harness 和 DeepTutor 是 harness 的两种进化方向。
一个往"通用"走——把一切变插件,让 harness 本身成为可组合的基础设施;
一个往"垂直"走——为一个特定领域(学习)建立深度领域模型。
前者赌可组合性,后者赌领域理解深度。
这两条路线不矛盾,甚至互补:DeepTutor 自己就支持 MCP、技能插件,还能在对话中途把 Claude Code、Codex 收编成子代理——垂直 harness 站在通用 harness 的肩膀上,很合理。
重点二:同样记录"痕迹",目的完全不同。
DeepSeek Harness 的 append-only 日志,记录痕迹是为了工程可观测性——回放、分叉、调试,是给开发者看的 trace。
DeepTutor 的 Trace Forest,记录痕迹是为了理解人——语义检索、跨会话复盘、蒸馏成画像,是给"老师"看的 trace。
一个是日志系统,一个是记忆系统。这个区分,是我认为判断一个 Agent 产品"有没有记忆设计"的试金石。
重点三:反馈回路的判官不同。
编程是 harness 的"easy mode",因为有编译器和测试当客观判官。
DeepSeek Harness 用极简模式给模型跑基准,本质上也是借这个客观判官。
但学习没有编译器——"你懂了没有"没法 assert。
DeepTutor 的应对是造判官:结构独立的校验器保证出题质量,TutorBench 里的学生模拟器以第一人称扮演真实学习者多轮过招,检验系统是否真的在适应"这个人"。
架构收益,有数据支撑
论文配套构建了 TutorBench:30 个知识库、横跨五大学科、90 个有教材支撑的学习者画像、270 个交互任务,用 LLM 学生模拟器做第一人称多轮评测。


结果:DeepTutor 相对基线个性化指标平均提升 +10.76%;而 CoT、Self-Refine、ReAct 三种常见 prompt 级改造几乎拿不到收益(-0.28% ~ +1.13%)。
提升是架构性的,不是提示词能抄走的。 跨 5 个基座模型,通用 agentic 推理能力平均增强 29.4%——设计对模型不可知。
为什么推荐你去试 DeepTutor
DeepSeek Harness 发布后,很多人问我"harness 这么火,该研究哪个"。我的建议是:想做通用 Agent 基础设施的,去扒 DeepSeek Harness 的 Cordis 插件设计;
想学习"记忆与个性化"怎么做的,DeepTutor 是目前最好的开源样本——痕迹森林、角色化记忆路由、生成器-校验器分离,这些模式搬到任何需要长期服务同一个用户的产品里都成立。
而且它开箱即用:pip install -U deeptutor 或 Docker 一键自托管,接任意 LLM(含本地 Ollama),教材论文喂进知识库就能开始。RAG 引擎可选 LlamaIndex / GraphRAG / LightRAG / PageIndex,还能挂 Obsidian。交互式书籍、数学动画、掌握度路径、三层记忆图谱可视化,产品完成度远超论文 Demo。

DeepSeek 把 harness 变成了通用基础设施,而 DeepTutor 示范了 harness 在一个垂直领域能挖多深。 一个是宽度,一个是深度——研究 Agent 的人,这两个仓库都值得 clone 下来读一遍。
- https://github.com/deepseek-ai/deepseek-harness
- https://github.com/HKUDS/DeepTutor
- https://arxiv.org/html/2604.26962v3
JOTO 企业落地观察
- 企业部署智能体时,若选择通用 harness 路线,需承担插件集成、依赖管理、事件流治理等基础设施级工程成本;而垂直 harness 虽降低初始集成门槛,但其领域模型(如学习者画像)的泛化能力与迁移成本将成为后续扩展的关键瓶颈。
- DeepTutor 的 Trace Forest 设计表明,面向长期用户服务的智能体,其记忆工程必须超越简单会话日志,转向结构化、可检索、可蒸馏的多粒度痕迹建模;这对企业 RAG 知识工程提出了更高要求——需同步构建静态知识图谱与动态用户行为图谱。
- 反馈回路中“判官”的缺失(如教育场景无编译器),迫使企业必须投入资源构建领域专用的校验机制(如学生模拟器、业务规则引擎、沙箱验证环境),而非依赖通用 LLM 输出;这直接关系到 AI 安全治理中“结果可信度”的落地实现。
- DeepSeek Harness 的 Cordis 元框架理念,对企业智能体工程具有启示意义:当多个业务线需共建统一 Agent 平台时,“插件化+配置驱动”的架构可避免重复造轮子,但需提前定义清晰的服务契约与事件规范,否则将陷入插件间隐式耦合的运维困境。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


