JOTO
Contact us
← AI 智库
Skill 技能

Meta AI推出EvoHarness-RL:让AI代理自主管理运行时状态

2026 年 8 月 28 日

Meta AI与UIUC提出EvoHarness-RL框架,通过统一的信念-进展-经验(BPE)工作区和成本感知强化学习,训练AI代理动态决定何时读取、更新或压缩外部状态,显著提升长周期企业任务中的效率与鲁棒性。

Meta AI's EvoHarness-RL boosts agent efficiency | VentureBeat

考虑一个被指派执行复杂企业工作流的 AI 代理,例如将大批量客户记录从传统 CRM 迁移到云数据库。该代理无法仅依靠其内部上下文窗口来完成持续数小时的任务,而必须依赖运行时层, 即 harness(运行时框架)

该 harness 提供执行反馈(例如服务器日志),以帮助代理准确理解动态 API 连接状况;它还提供状态追踪器和控制流机制,用于管理已完成和待处理的子目标,确保代理不会跳过或重复处理数据批次。当发生意外错误(例如数据库因严格的 API 速率限制而拒绝某个数据批次)时,harness 会提供工具和指令,协助代理恢复。

向代理明确说明其如何及何时使用工具的主要方式,是让人类开发者编写一套规则与指令,逐步告知其应执行的操作。例如,开发者可能指示代理在撰写电子邮件前始终搜索公司维基。由于代理只是遵循一套僵化的脚本,因此缺乏真正的自主性——它并未经过训练以独立权衡自身行动的成本与收益。

为解决这一问题,Meta AI 与伊利诺伊大学厄巴纳-香槟分校(University of Illinois Urbana–Champaign)的研究人员 提出了 EvoHarness-RL,这是一种为代理的 harness 增加抽象层级的框架,用于训练底层模型判断何时读取、更新或整合其从环境中获取的信息。

在长周期任务中,AI 代理如何读取并处理其从环境中获取的信息,对其成败至关重要。代理必须持续更新其对环境的理解、追踪已完成与待处理的子目标、从失败操作中恢复,并复用过往经验中的流程。此类执行高度依赖于 harness。

一系列自演化的代理式框架(例如) Harness-1 通过累积过往执行轨迹并将之提炼为结构化程序化记忆(如可复用技能、工作流或代码库),部分解决了该问题。然而,它们通常将这种长期技能整理工作与实时的单次任务内状态追踪相分离,并未主动训练代理如何管理其即时环境现实,或在执行过程中追踪当前活跃任务步骤。

EvoHarness-RL 论文的共同作者徐颖·宁(Xuying Ning)向 VentureBeat 表示,人工编写的逻辑与僵化的记忆结构是消耗工程资源的主要原因。

“最优的 harness 往往随模型而变,”宁解释道,“不同模型可能需要不同的提示词(prompts)、记忆设计、权限设置或沙箱配置。若所有这些逻辑均需手动编码,则每次模型升级都可能导致新一轮漫长的调优与调试周期。”

此外,现有仅单纯累积经验的记忆系统实际上可能损害代理的推理能力。“仅追加式记忆(append-only memory)假定更多上下文总是有益的,但这未必成立,”宁指出,“在一项长期任务中,记忆可能包含过时的结论、失败的尝试,或已不再相关的信息。”因此,长周期代理需要一种具备更新、压缩与替换信息能力的动态记忆,以避免重复过往错误。

EvoHarness-RL:统一的信念(Belief)、进展(Progress)与经验(Experience)工作区

为克服僵化、人工编写提示词的局限性,研究人员提出了 EvoHarness-RL——一种训练技术,旨在教会代理最优化地利用其 harness。该技术并非盲目遵循硬编码指令,而是让代理学会如何从杂乱的执行数据中构建结构化工作区,并决定在复杂工作流中何时及如何查询该外部状态。

为简化对 harness 各组件的管理,EvoHarness-RL 将代理的支持系统整合为单一、统一的接口。该接口称为信念、进展与经验(Belief, Progress, and Experience,简称 BPE),将代理对外部支持的需求划分为三大功能领域:

  • 信念(Belief): 维持对当前环境的准确感知。

  • 进展(Progress): 管理已完成与待处理的子目标。

  • 经验(Experience): 跨任务复用历史知识。

AI 并不直接使用复杂且面向特定领域的 API,而是通过四种简洁的元动作(meta-actions)——track(追踪)、commit(提交)、recall(回溯)与 note(记录)——与这一清晰仪表盘交互。它发出命令以追踪实时环境、提交工作流更新、在执行前回溯过往策略,并通过记录保存新发现的洞见以供后续运行使用。

BPE framework

BPE 框架(来源:arXiv)

这些状态直接映射至高价值的企业垂直领域。“在软件工程中,‘信念’可代表代理对当前代码仓库的理解,”宁详细说明了代理如何监控组件交互与工作区变更。“‘进展’则追踪哪些内容已完成、哪些仍待完成,以及哪些步骤彼此依赖。”与此同时,“经验”捕获教训(例如用户对某次失误的反馈),以指导未来行动。

宁表示,同一理念亦适用于金融领域。在合规审计期间,“信念”可能描述适用规则与可用证据;“进展”追踪已完成检查项与尚待处理的异常项;“经验”则帮助代理识别反复出现的差异,或判断何时应将问题升级上报。

“综上,这些状态有助于防止代理丢失工作进度或重复采用同样失败的方法,”宁表示。

EvoHarness-RL training pipeline

EvoHarness-RL 训练流程(来源:arXiv)

为教会代理掌握管理其外部工作区的机制与策略,研究人员设计了一种两阶段训练方案。第一阶段为监督式 harness 微调(supervised harness fine-tuning),基础模型学习如何从杂乱的交互日志中提取并结构化有用事实,填入 BPE 框架。

然而,查询记忆或更新追踪器需耗费时间与计算 token,这意味着代理无法承受在每一步都盲目检查其工具。为解决此问题,第二阶段采用“成本感知型”强化学习(cost-aware reinforcement learning)以训练代理提升效率。该阶段训练代理计算访问其外部状态是否值得付出预算成本。这一两步过程将工具使用行为从僵化的硬编码提示词转变为一种习得的运行时行为。

EvoHarness-RL 实际应用

为验证 EvoHarness-RL,研究人员在 ALFWorld 基准测试中评估了该系统。ALFWorld 是一个基于文本的环境,包含多步骤任务,用于检验顺序逻辑与状态追踪能力。

他们以 Qwen3-8B 作为基础模型进行训练。研究团队将训练后的 8B 模型与三款大型前沿模型(Claude Opus 4.5、GPT-4.1 和 GPT-5)、配备静态工具的冻结式代理框架(例如 ReAct、ExpeL 和 ReasoningBank),以及先进可训练方法(例如标准 GRPO、SkillOS 和 SkillRL)进行了对比。

结果显示,更小、更具成本效益的模型性能实现了显著跃升。借助 EvoHarness-RL,Qwen3-8B 模型达到了 96.9% 的平均成功率,较其基线 ReAct 对应版本提升了 49.0 个百分点。

此外,经训练的模型表现优于 SkillRL(89.9%)和 SkillOS(80.2%)等先进可训练框架。对于寻求优化计算成本的企业开发者而言,最令人印象深刻的是:该 8B 模型有效匹配了 Claude Opus 4.5 等昂贵闭源模型的性能上限——后者开箱即用得分为 96.4%。

除赋能小型模型外,实验还表明 BPE 框架对所有规模的模型均具有普适性优势,即使不经过大规模强化学习阶段亦然。当研究人员为冻结的、开箱即用的前沿模型配备 BPE 提示时调度器(prompt-time harness)后,其执行效果显著提升:GPT-4.1 的成功率提高了 22.1 个百分点,GPT-5 提高了 25.7 个百分点。

除实验结果外,研究人员在实验过程中还记录到若干现象,揭示了大语言模型(LLM)在经历 EvoHarness-RL 训练后所获得的动态行为特征。在强化学习阶段,他们观察到智能体随时间推移逐步内化知识,并由此产生行为转变,他们将此称为“调度器退火”(harness annealing)。 

训练初期,AI 几乎每一步都严重依赖查询其“经验追踪器”(Experience tracker)与“进度追踪器”(Progress tracker)。然而,随着其熟练掌握常规操作,它主动减少了对外部工具的依赖,将成功模式直接嵌入自身参数中。在真实企业环境中,这直接转化为更低延迟与更少计算成本。通过退火式减少工具调用,AI 不再浪费 token 和时间去查询数据库以处理其已掌握的标准工作流。

Harness annealing

调度器退火(来源:arXiv)

与此同时,该智能体展现出“调度器演化”(harness evolution)现象:它能根据当前情境的复杂程度动态调整策略。面对简单且熟悉任务时,它会绕过工具;而一旦遭遇新环境或意外障碍,它便主动增强对“信念模块”(Belief module)与“经验模块”(Experience module)的调用。例如,若 AI 智能体正在迁移标准数据库记录,则运行迅速;但当其遇到陌生的遗留 API 端点或复杂的验证错误时,它会放慢速度,调取实时服务器日志,并查询历史工单,以安全解决该边缘情况,而非凭空幻觉猜测。

将 EvoHarness-RL 引入现有系统

尽管取得上述巨大增益,但采用新框架往往会给企业工程团队带来摩擦阻力。然而,EvoHarness-RL 采用环境适配器(environment adapter),允许内部实现继续针对组织现有工具保持领域专用性,同时共享可训练层。

宁(Ning)表示:“我认为将 BPE 集成至现有编排系统中具有重大潜力。这未必要求团队替换当前工具或智能体框架;BPE 可作为额外的状态管理层运行,持续整理智能体现有的信念内容、当前进展程度及其已习得知识。”

对于担忧推理成本的企业构建者而言,该框架解决了整合(consolidation)所隐含的工程成本问题。由于整合需要强推理能力,团队可采用混合式异步架构以优化预算。

宁(Ning)指出:“一种可能的折中方案是,先使用前沿模型生成高质量整合数据,再对具备能力的开源权重模型进行微调,以处理常规状态管理。”此外,“由于整合可异步执行,因此并不总是需要拖慢智能体的主执行循环。”

团队还必须审慎评估:何时真正需要可训练的 BPE 调度器,而何时又属过度设计。

宁(Ning)表示:“对于简短且稳定不变的任务,ReAct 或标准 RAG 可能已足够;而当智能体需连续工作数小时、数天甚至数周时,BPE 的价值才大幅提升。”在这些复杂场景中,智能体需要对其决策形成压缩式理解,以防迷失方向,并依靠“经验”模块,从过往失败及人类反馈中迭代改进。

最终,这一方法标志着 AI 编排工程师角色的转变。宁(Ning)表示:“它并非对工作流工程的彻底替代,而是从直接脚本化智能体行为,转向构建可从中习得更优行为的系统。”

JOTO 企业落地观察

  • 对企业部署而言,EvoHarness-RL支持环境适配器集成,无需替换现有工具链即可叠加可训练状态管理层,降低迁移成本;其‘调度器退火’特性还能随任务重复自动减少token消耗,直接优化推理预算。
  • 对智能体工程而言,该框架将硬编码提示词逻辑转化为习得式运行时行为,使代理能根据任务复杂度动态启用或绕过‘信念/经验’模块——例如在陌生API场景中主动查日志与工单,而非幻觉响应,提升了工程可控性。
  • 对FDE落地而言,BPE框架明确划分‘信念-进展-经验’三类状态,使企业可审计代理对规则(如金融合规条款)、进度(审计项完成率)、教训(历史误判反馈)的实时认知,为AI员工的可解释性与责任追溯提供结构化基础。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.