给每个员工配上AI之后,公司还缺什么?
当企业为每位员工部署AI助手后,模型能力之外的系统性支撑成为关键瓶颈。文章以周报生成为例,指出AI需解决任务中断恢复、多任务调度、权限隔离、执行记录留存与结果可验证等现实问题,并分析YC开源的QM系统、Anthropic的Managed Agents及微软CORPGEN等方案如何应对。核心结论是:Harness类运行系统决定AI能否真正融入业务流程。
五十个AI助手同时工作时的真实故障
给公司里的每个人配上一个AI助手,听起来已经不难:接入模型,连上工作资料,再给它一些可以调用的工具。但假设五十个助手开始同时工作,问题很快就会变得具体:一个助手整理报告到一半中断了,另一个还在等同事回复,还有一个准备把含有内部数据的附件发出去。谁来保存它们的进度,决定什么时候继续,又在操作越界之前拦下来?每个人都能和AI聊天,距离整家公司可以放心地让AI干活,中间还有不少事情要补。

Harness:模型之外的运行系统
前段时间,YC开源一个QM,就是围绕这类问题开发的系统。它要解决的事情,已经超出了“给模型写一段好提示词”:员工和项目如何使用各自的助手,任务中断以后怎么继续,资料和权限怎样划分,哪些经验可以共享。这些工作指向了一个最近越来越常见的词——Harness。放在AI应用里,可以把它理解为围绕模型搭建的运行系统:模型负责判断下一步,Harness把这个判断接到工具上,记录执行结果,再把需要的信息送回模型,让任务一步步往下走。
讨论Harness,并不意味着模型已经不重要了。一个能力不足的模型,配上再完善的系统,也未必能完成复杂工作。但模型的能力之外,还有一个问题需要单独回答:当AI已经能写报告、查资料、改程序,为什么我们依然很难放心地把一件事交出去,等它做完?
一份周报,远不止生成几段文字
假设你让AI每周五整理销售周报。如果把整理好的数据贴进聊天窗口,它通常能很快写出一篇像样的总结。可在公司里,数据往往还散落在不同地方:订单在业务系统里,退款在财务表里,销售同事对异常订单的解释留在群聊里。AI得先找到这些资料,确认统计的是同一段时间,再判断取消的订单该不该算进去。如果财务还没更新,它还得把这件事记下来,过一会儿再查;报告写完以后,也不能因为一句“发送周报”,就把包含客户信息的附件发给所有人。
这时,模型与Harness的分工就容易理解了。模型可以提出“先查询上周订单”,但实际连接哪个系统、使用谁的账号、查询失败是否重试、返回的几万行数据怎样处理,都需要周围的软件来落实。拿到结果以后,模型可能决定继续核对退款,Harness再执行下一步。我们常说的AI agent,就是这种能够反复观察结果、选择动作并使用工具的系统;Harness承担着把这些动作组织成连续工作的职责。它没有一份全行业统一的功能清单,但只要任务走出聊天窗口,状态、工具和执行控制就很难绕开。
一种可行的安排,是给AI提供能够保留变量的程序运行环境。例如处理十万行订单时,先用程序筛选出上周的记录,计算各地区销售额,再把汇总和异常项交给模型判断。这样,模型不必逐行“阅读”整张表,下一步也能接着使用已经加载的数据。这里的效率来自分工:适合精确计算的部分交给程序,需要解释和判断的部分再交给模型。当然,程序仍可能写错,统计口径也可能理解错,所以运行成功还得接着核对结果。
AI需要一份不会随着对话结束而消失的工作记录
让AI连续工作,常常会遇到一种很像“交接班没交清楚”的故障:上一轮已经查过的资料,下一轮重新查;已经排除的方案,又试了一遍;报告写到一半,换个会话就不知道从哪里继续。模型每次作答时能直接使用的材料,通常叫上下文,你可以把它理解成此刻摆在桌面上的文件。桌面放不下全部工作历史,但如果收走文件时只留下“周报进行中”几个字,接班的人也没法继续干活。
因此,长期运行的AI需要把工作记录放在对话之外。继续用周报举例,一份有用的记录应该包括:订单已查到哪个日期,退款表是哪一版,哪些数字已核对,哪三个异常还在等待回复,以及草稿保存在哪里。下一次启动时,系统只取出当前步骤需要的部分交给模型,而完整记录仍留在外部。它和“把所有聊天记录重新塞进去”有很大区别:前者让模型带着明确进度继续,后者可能让它在几百条过时讨论里重新猜测现在该做什么。
Anthropic在2026年4月介绍Managed Agents时,也讨论了类似的工程选择:把保存事件的会话记录、驱动模型和工具的Harness、实际执行操作的环境分开。这样,执行环境出故障时,可以更换环境,而不必连任务历史一起丢掉。可以把它想成换了一台电脑,但项目文件和工作日志还在,接下来要做的是恢复现场。
不过,恢复记录不代表所有动作都能直接重做。假如系统刚发出一封邮件,还没来得及记下“发送成功”就中断了,重启后再次发送,收件人就会收到两封。合理的恢复流程应当先检查发件记录,确认外部世界究竟发生了什么,再决定继续还是重试。查询一遍资料与支付一笔款项,显然不能使用同样的重试规则。Harness越接近真实业务,越需要处理这类看起来琐碎、出错后却很麻烦的情况。
总有人在中途插进一件事
多数演示都很干净:给AI一个任务,等它完成,再给下一个。办公室里的情况要混乱得多。周报刚整理到一半,客户要求修改报价;报价等主管确认时,同事又来问一个数据;下午还要准备会议材料。人会在这些事情之间切换,记住哪些可以推进、哪些必须等待。AI如果把所有内容放进同一段不断变长的对话,很容易把不同客户的数据混在一起,或者忘了一个任务已经被另一个任务卡住。
微软研究院2026年公布的CORPGEN,专门研究了这类多任务环境。它把计划分成不同层次,让具体子任务在相互隔离的上下文里执行,并按需要调取记忆。对应到日常工作,就是总计划知道“今天要交周报和报价”,处理报价的那一轮却不用同时背着周报的全部细节。在包含46项任务、持续六小时的模拟办公评估中,CORPGEN的任务完成率为15.2%,对照系统为4.3%,约提高到3.5倍。但15.2%也说明,大量任务仍未完成;这项研究提供了改进方向,远不足以证明AI已经能够独立承担一个人的工作。
从这类设计出发,可以得到一个很实用的判断:AI系统需要明确表示“等待”。例如给某项任务标上“等待主管批准,收到回复后继续”,它就不必一直重复查看,也不该擅自替主管做决定。等待期间,系统可以安排另一件已具备条件的工作。这样的调度没有生成一篇长文那么容易展示,却决定了AI能否在一天里承接多件互相牵连的事,也决定了它会不会把时间和调用费用消耗在原地打转上。
记得越多,越要分清什么不能说
公司里的信息并不是一个人人可查的大文件夹。同一个员工可以看自己的绩效反馈,却未必能看同事的薪资;一个项目组可以讨论报价底线,却不能把它放进客户群。当AI开始同时服务个人、群聊和项目,这些边界也必须跟过去。假设助手在私聊里帮主管整理过裁员方案,稍后有人在部门群里问“下季度有什么变化”,它不能因为记得一份相关资料,就把内容带进公开回答。这是一个假设场景,但足以说明:记忆更强,会让错误的信息流动更加危险。
QM目前的公开设计,把个人和共享空间的记忆、文件及权限分开管理,并通过授权进行共享。这里需要区分两件事:后台可以集中存储记录,不等于每个助手都可以读取全部记录。对于敏感资料,系统应在取出数据时检查身份和范围;仅在提示词里写一句“请注意保密”,挡不住错误调用,也不能作为安全保证。
权限还包括能做什么。查询订单、生成修改建议、批量改动订单,风险逐步升高,不能因为AI会调用某个工具,就默认把完整操作权限交给它。让人批准高风险操作,也需要给人提供足够的信息:准备给谁发信,会改哪几行数据,改前改后是什么,有没有撤销办法。人只有看得清,批准才有意义;面对一大段流畅的“我已检查无误”,很容易只剩下习惯性点击。
做完了没有,要看留下了什么
AI很擅长说“已完成”,但一句完成声明与交付之间,可能还隔着不少工作。周报文件是否真的保存了?数字能否追溯到原始表格?附件有没有漏掉?如果任务是修改软件,程序能启动、测试能通过、用户要求的功能能实际使用,才构成更可信的证据。Anthropic此前关于长期运行agent的工程实践,就采用了明确的功能清单、进度记录和增量工作方式,减少模型一次做得过多、随后过早宣布结束的情况。
这也给2026年的落地提供了一种比较稳妥的起点:先选边界清楚、结果容易核对的任务。与其一开始就说“帮我管理销售部门”,不如先让AI定时整理周报草稿,把异常单列出来,把所有数字附上出处,最后由负责人确认发送。等这一步稳定了,再扩大自动处理的范围。系统需要记录每次失败发生在哪一步,区分数据缺失、工具故障和模型判断错误;否则换了一个更强的模型,原来没接好的数据和权限问题依然存在。
长期积累也应当从这些具体错误里来。假如AI连续几次把订单创建时间当成到账时间,就可以把“收入统计使用到账时间”整理成带适用范围的工作规则,下次处理同类任务时加载;如果只是把上次几十页聊天保存下来,模型仍可能重复犯错。但这条规则也不能自动推广到所有报表:统计新增订单时,创建时间可能才是正确口径。因此,经验不能未经检查就变成所有助手的永久规则:它适用于什么任务,依据是什么,修改后有没有改善,都需要留痕和验证。
Harness本身也要接受这种检查。Anthropic报告过,针对一个模型临近上下文上限时提前收工的问题,团队加入了额外的上下文重置机制;换到另一个模型后,相应问题消失了,原来的补丁便成了多余负担。这提醒我们,今天有效的安排,未必值得一直保留。模型能力提升后,有些反复提醒和复杂拆分可以撤掉;但身份权限、执行记录、预算限制与结果验收,仍然是现实业务需要的约束。
给五十个人配上AI助手,并不等于公司自动多了五十个可靠的同事。助手需要知道工作做到哪里,等待什么,允许访问哪些资料,什么情况下必须停下来找人。对于准备部署AI的公司,除了问模型有多聪明,也值得拿出一件真实任务追问到底:中断以后从哪继续,误操作怎样发现,交付结果由什么来证明。Harness的价值,就落在这些具体问题的答案里。
JOTO 企业落地观察
- 企业部署AI助手时,真正的瓶颈常不在模型选型,而在Harness类运行系统的工程成熟度——它决定了中断恢复、多任务调度与权限隔离能否稳定落地。
- 面向RAG知识工程,QM将个人与共享记忆分离的设计提示:企业级知识治理必须支持细粒度的上下文生命周期管理,而非简单堆砌向量库。
- AI安全治理的关键跃迁,是从“提示词合规”转向“执行链路审计”——每一次工具调用、每一条外部数据读取、每一处人工审批节点,都需可追溯、可验证、可回滚。
- FDE驻场共创的价值正体现在此类场景:当客户提出“周报自动生成”需求时,工程师需协同业务方共同定义“完成”的交付标准(如:数字可溯源、附件经脱敏、异常项单列),而非仅交付一段提示词。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


