01

CI 修复 Agent 的目标改成:优先修实现,其次修测试数据,禁止无证据放松断言。 增加一个静态检查:测试断言从精确值改成宽泛判断时,必须触发人工确认。 trace 里新增字段:changed_assertion_type,记录断言是否变弱。
02

模型为什么乱说?
知识库是不是过期?
采购规则是不是没写清楚?
工具是不是查漏了供应商状态?
供应商查询工具增加字段:品类准入状态、临时冻结状态、质量处罚、资质有效期、黑名单标记。 知识召回增加优先级:风险拦截规则高于价格、交付和评分规则。 风险规则写死:冻结 / 黑名单 / 资质过期 / 品类未准入 = 不得自动推荐,必须转人工复核。
03

在 Agent Runtime 或 Harness 层,把Agent 每一步关键动作,都通过统一的运行单和事件流记录,而不是让每个 Agent 自己随手写日志(Harness团队不给力的时候就自己搞)。
为用户提供一个总结、提炼的入口与能力:SAAS的Agent不可能是自己玩的,得靠用户、客户积累。
写回 run_id 对应的 trace,作为本次运行结果。 写回失败案例库,归因为工具字段缺失 / 风险规则未命中。 写回 eval 样本,下次模型、工具、规则变更时必须回归。
04

05

