JOTO
Contact us
← AI 智库
AI 员工

给每个员工配上AI之后,公司还缺什么?

2026 年 9 月 13 日

当企业为每位员工部署AI助手后,模型能力之外的系统性支撑成为关键瓶颈。文章以周报生成为例,指出AI需解决任务中断恢复、多任务调度、权限隔离、执行记录留存与结果可验证等现实问题,并分析YC开源的QM系统、Anthropic的Managed Agents及微软CORPGEN等方案如何应对。核心结论是:Harness类运行系统决定AI能否真正融入业务流程。

五十个AI助手同时工作时的真实故障

给公司里的每个人配上一个AI助手,听起来已经不难:接入模型,连上工作资料,再给它一些可以调用的工具。但假设五十个助手开始同时工作,问题很快就会变得具体:一个助手整理报告到一半中断了,另一个还在等同事回复,还有一个准备把含有内部数据的附件发出去。谁来保存它们的进度,决定什么时候继续,又在操作越界之前拦下来?每个人都能和AI聊天,距离整家公司可以放心地让AI干活,中间还有不少事情要补。

QM YC Agent系统与OpenClaw、Hermes对比示意图
The Next Evolution in AI Agents: Why QM YC Agent System Surpasses OpenClaw and Hermes

Harness:模型之外的运行系统

前段时间,YC开源一个QM,就是围绕这类问题开发的系统。它要解决的事情,已经超出了“给模型写一段好提示词”:员工和项目如何使用各自的助手,任务中断以后怎么继续,资料和权限怎样划分,哪些经验可以共享。这些工作指向了一个最近越来越常见的词——Harness。放在AI应用里,可以把它理解为围绕模型搭建的运行系统:模型负责判断下一步,Harness把这个判断接到工具上,记录执行结果,再把需要的信息送回模型,让任务一步步往下走。

讨论Harness,并不意味着模型已经不重要了。一个能力不足的模型,配上再完善的系统,也未必能完成复杂工作。但模型的能力之外,还有一个问题需要单独回答:当AI已经能写报告、查资料、改程序,为什么我们依然很难放心地把一件事交出去,等它做完?

一份周报,远不止生成几段文字

假设你让AI每周五整理销售周报。如果把整理好的数据贴进聊天窗口,它通常能很快写出一篇像样的总结。可在公司里,数据往往还散落在不同地方:订单在业务系统里,退款在财务表里,销售同事对异常订单的解释留在群聊里。AI得先找到这些资料,确认统计的是同一段时间,再判断取消的订单该不该算进去。如果财务还没更新,它还得把这件事记下来,过一会儿再查;报告写完以后,也不能因为一句“发送周报”,就把包含客户信息的附件发给所有人。

这时,模型与Harness的分工就容易理解了。模型可以提出“先查询上周订单”,但实际连接哪个系统、使用谁的账号、查询失败是否重试、返回的几万行数据怎样处理,都需要周围的软件来落实。拿到结果以后,模型可能决定继续核对退款,Harness再执行下一步。我们常说的AI agent,就是这种能够反复观察结果、选择动作并使用工具的系统;Harness承担着把这些动作组织成连续工作的职责。它没有一份全行业统一的功能清单,但只要任务走出聊天窗口,状态、工具和执行控制就很难绕开。

一种可行的安排,是给AI提供能够保留变量的程序运行环境。例如处理十万行订单时,先用程序筛选出上周的记录,计算各地区销售额,再把汇总和异常项交给模型判断。这样,模型不必逐行“阅读”整张表,下一步也能接着使用已经加载的数据。这里的效率来自分工:适合精确计算的部分交给程序,需要解释和判断的部分再交给模型。当然,程序仍可能写错,统计口径也可能理解错,所以运行成功还得接着核对结果。

AI需要一份不会随着对话结束而消失的工作记录

让AI连续工作,常常会遇到一种很像“交接班没交清楚”的故障:上一轮已经查过的资料,下一轮重新查;已经排除的方案,又试了一遍;报告写到一半,换个会话就不知道从哪里继续。模型每次作答时能直接使用的材料,通常叫上下文,你可以把它理解成此刻摆在桌面上的文件。桌面放不下全部工作历史,但如果收走文件时只留下“周报进行中”几个字,接班的人也没法继续干活。

因此,长期运行的AI需要把工作记录放在对话之外。继续用周报举例,一份有用的记录应该包括:订单已查到哪个日期,退款表是哪一版,哪些数字已核对,哪三个异常还在等待回复,以及草稿保存在哪里。下一次启动时,系统只取出当前步骤需要的部分交给模型,而完整记录仍留在外部。它和“把所有聊天记录重新塞进去”有很大区别:前者让模型带着明确进度继续,后者可能让它在几百条过时讨论里重新猜测现在该做什么。

Anthropic在2026年4月介绍Managed Agents时,也讨论了类似的工程选择:把保存事件的会话记录、驱动模型和工具的Harness、实际执行操作的环境分开。这样,执行环境出故障时,可以更换环境,而不必连任务历史一起丢掉。可以把它想成换了一台电脑,但项目文件和工作日志还在,接下来要做的是恢复现场。

不过,恢复记录不代表所有动作都能直接重做。假如系统刚发出一封邮件,还没来得及记下“发送成功”就中断了,重启后再次发送,收件人就会收到两封。合理的恢复流程应当先检查发件记录,确认外部世界究竟发生了什么,再决定继续还是重试。查询一遍资料与支付一笔款项,显然不能使用同样的重试规则。Harness越接近真实业务,越需要处理这类看起来琐碎、出错后却很麻烦的情况。

总有人在中途插进一件事

多数演示都很干净:给AI一个任务,等它完成,再给下一个。办公室里的情况要混乱得多。周报刚整理到一半,客户要求修改报价;报价等主管确认时,同事又来问一个数据;下午还要准备会议材料。人会在这些事情之间切换,记住哪些可以推进、哪些必须等待。AI如果把所有内容放进同一段不断变长的对话,很容易把不同客户的数据混在一起,或者忘了一个任务已经被另一个任务卡住。

微软研究院2026年公布的CORPGEN,专门研究了这类多任务环境。它把计划分成不同层次,让具体子任务在相互隔离的上下文里执行,并按需要调取记忆。对应到日常工作,就是总计划知道“今天要交周报和报价”,处理报价的那一轮却不用同时背着周报的全部细节。在包含46项任务、持续六小时的模拟办公评估中,CORPGEN的任务完成率为15.2%,对照系统为4.3%,约提高到3.5倍。但15.2%也说明,大量任务仍未完成;这项研究提供了改进方向,远不足以证明AI已经能够独立承担一个人的工作。

从这类设计出发,可以得到一个很实用的判断:AI系统需要明确表示“等待”。例如给某项任务标上“等待主管批准,收到回复后继续”,它就不必一直重复查看,也不该擅自替主管做决定。等待期间,系统可以安排另一件已具备条件的工作。这样的调度没有生成一篇长文那么容易展示,却决定了AI能否在一天里承接多件互相牵连的事,也决定了它会不会把时间和调用费用消耗在原地打转上。

记得越多,越要分清什么不能说

公司里的信息并不是一个人人可查的大文件夹。同一个员工可以看自己的绩效反馈,却未必能看同事的薪资;一个项目组可以讨论报价底线,却不能把它放进客户群。当AI开始同时服务个人、群聊和项目,这些边界也必须跟过去。假设助手在私聊里帮主管整理过裁员方案,稍后有人在部门群里问“下季度有什么变化”,它不能因为记得一份相关资料,就把内容带进公开回答。这是一个假设场景,但足以说明:记忆更强,会让错误的信息流动更加危险。

QM目前的公开设计,把个人和共享空间的记忆、文件及权限分开管理,并通过授权进行共享。这里需要区分两件事:后台可以集中存储记录,不等于每个助手都可以读取全部记录。对于敏感资料,系统应在取出数据时检查身份和范围;仅在提示词里写一句“请注意保密”,挡不住错误调用,也不能作为安全保证。

权限还包括能做什么。查询订单、生成修改建议、批量改动订单,风险逐步升高,不能因为AI会调用某个工具,就默认把完整操作权限交给它。让人批准高风险操作,也需要给人提供足够的信息:准备给谁发信,会改哪几行数据,改前改后是什么,有没有撤销办法。人只有看得清,批准才有意义;面对一大段流畅的“我已检查无误”,很容易只剩下习惯性点击。

做完了没有,要看留下了什么

AI很擅长说“已完成”,但一句完成声明与交付之间,可能还隔着不少工作。周报文件是否真的保存了?数字能否追溯到原始表格?附件有没有漏掉?如果任务是修改软件,程序能启动、测试能通过、用户要求的功能能实际使用,才构成更可信的证据。Anthropic此前关于长期运行agent的工程实践,就采用了明确的功能清单、进度记录和增量工作方式,减少模型一次做得过多、随后过早宣布结束的情况。

这也给2026年的落地提供了一种比较稳妥的起点:先选边界清楚、结果容易核对的任务。与其一开始就说“帮我管理销售部门”,不如先让AI定时整理周报草稿,把异常单列出来,把所有数字附上出处,最后由负责人确认发送。等这一步稳定了,再扩大自动处理的范围。系统需要记录每次失败发生在哪一步,区分数据缺失、工具故障和模型判断错误;否则换了一个更强的模型,原来没接好的数据和权限问题依然存在。

长期积累也应当从这些具体错误里来。假如AI连续几次把订单创建时间当成到账时间,就可以把“收入统计使用到账时间”整理成带适用范围的工作规则,下次处理同类任务时加载;如果只是把上次几十页聊天保存下来,模型仍可能重复犯错。但这条规则也不能自动推广到所有报表:统计新增订单时,创建时间可能才是正确口径。因此,经验不能未经检查就变成所有助手的永久规则:它适用于什么任务,依据是什么,修改后有没有改善,都需要留痕和验证。

Harness本身也要接受这种检查。Anthropic报告过,针对一个模型临近上下文上限时提前收工的问题,团队加入了额外的上下文重置机制;换到另一个模型后,相应问题消失了,原来的补丁便成了多余负担。这提醒我们,今天有效的安排,未必值得一直保留。模型能力提升后,有些反复提醒和复杂拆分可以撤掉;但身份权限、执行记录、预算限制与结果验收,仍然是现实业务需要的约束。

给五十个人配上AI助手,并不等于公司自动多了五十个可靠的同事。助手需要知道工作做到哪里,等待什么,允许访问哪些资料,什么情况下必须停下来找人。对于准备部署AI的公司,除了问模型有多聪明,也值得拿出一件真实任务追问到底:中断以后从哪继续,误操作怎样发现,交付结果由什么来证明。Harness的价值,就落在这些具体问题的答案里。

JOTO 企业落地观察

  • 企业部署AI助手时,真正的瓶颈常不在模型选型,而在Harness类运行系统的工程成熟度——它决定了中断恢复、多任务调度与权限隔离能否稳定落地。
  • 面向RAG知识工程,QM将个人与共享记忆分离的设计提示:企业级知识治理必须支持细粒度的上下文生命周期管理,而非简单堆砌向量库。
  • AI安全治理的关键跃迁,是从“提示词合规”转向“执行链路审计”——每一次工具调用、每一条外部数据读取、每一处人工审批节点,都需可追溯、可验证、可回滚。
  • FDE驻场共创的价值正体现在此类场景:当客户提出“周报自动生成”需求时,工程师需协同业务方共同定义“完成”的交付标准(如:数字可溯源、附件经脱敏、异常项单列),而非仅交付一段提示词。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.