Agent 观测与优化开发者摸底报告
Agent生产落地遇难题?700+企业调研揭示观测、评估、优化基建薄弱痛点,助你建立可优化工程闭环。 核心内容: 1. Agent生产落地现状:需求强烈但基建薄弱、认知体系化不足 2. 观测与评估核心瓶颈:轨迹观测工具缺乏、评估依赖人工经验 3. 优化闭环与审计合规:闭环未形成但需求迫切,审计落地能力待提升
越来越多企业把 Agent 从 Demo 推入生产环境,但 Agent 的不可预测性、长程推理黑箱、工具调用风险,让传统的日志与监控手段越来越不够用。
为了让更多企业看清 Agent 上线后的真实运行状态、建立可评估与可优化的工程闭环,我们于 8-9 月在北京、上海、深圳三城发起「Agent 评估与优化 · Close the Loop」的系列开发者沙龙,集中分享我们在 Agent 观测、审计、评估、实验回测、优化等方面的实践。
此外,我们尝试通过这种方式对企业 Agent 的落地现状做一个基本的摸底。总体上,呈现出需求强烈、基建薄弱、认知体系化不够的特点。比如,超过六成受访者已进入 POC 或生产阶段,大家推理质量提升、Skills 沉淀、审计可追溯的诉求却非常强烈;但对完整 trajectory 观测、自动化评估、数据回灌闭环的掌握度仍然很低,能拿到完整 trajectory 的仅 13.4%;优化的北极星指标、评估基建还未完全建立起来;另外,由于评估和优化依赖平台方和业务方共同参与,如何进行组织分工是最优解,也是大家讨论非常多的。
本文对 700+ 的调研数据,进行汇总和分析,希望对提升企业 Agent 建设质量,有所帮助。
数据说明:700+ 的调研数据来自三场线下活动的报名问卷,仅作为参会群体的画像研究。
核心结论
Cloud Native
1. Agent 治理能力还未跟上
约六成受访者已进入 POC 或生产阶段,但真正规模化生产的不足 5%。市场已经从“做 Demo”转向“上生产”,但大规模治理的能力尚未跟上。
2. 观测是第一个拦路虎
近半数受访者没有专门观测工具,四成仍在用日志 / print 人工拼调用链,能拿到完整 trajectory 的仅 13.4%。没有轨迹,评估与优化都缺乏事实依据。
3. 评估仍以人工和经验驱动为主
43.4% 靠人肉抽查或用户反馈,仅 6.9% 实现完整线上评估 + A/B 数据驱动发版。Agent 质量的判断仍高度依赖主观经验。
4. 优化闭环远未形成,但需求旺盛
52.6% 完全没有数据回灌闭环,仅 2.8% 已有数据飞轮。与此同时,81.7% 希望提升推理质量,78.1% 希望把经验沉淀为可复用 Skills。
5. 审计合规是普遍且迫切的约束
94.2% 的业务有或预见有审计要求,但 36.2% 有要求却还没能力落地。可追溯不是未来问题,而是当前 Agent 进入生产前的真实瓶颈。
调研分类与解读
Cloud Native
岗位构成、Agent 所处阶段和主流技术栈,决定了后续观测、评估、优化需求的差异性,也决定了 Close the Loop 系列活动必须同时服务开发者、架构师和产品决策者三类人群。
Q1:您的岗位是?
了解参会者的角色构成,判断内容应同时覆盖工程深度与业务视角。

解读:工程师与架构师合计占比超过 60%,说明活动受众以技术决策者和执行者为主;产品经理/项目负责人占 21%,显示 Agent 项目已经开始从实验室走向业务侧立项。学生/研究者与创业者各占 7%,意味着社区中仍有大量早期探索者。
Q2:您的 Agent 目前处于哪个阶段?
识别 Agent 落地的成熟度分布,区分学习、POC、生产与规模化四个阶段。

解读:34% 仍处于学习/ Demo 阶段,但 66% 已经进入 POC 或生产,Agent 从概念验证到真实落地的窗口已经打开。值得注意的是,真正规模化生产的仅占 4.6%,说明从“能跑”到“能管”仍缺少成熟范式。
Q3:您主要用什么框架 / 平台构建 Agent?(多选)
框架生态高度分散,LangChain 与基础大模型直接调用位居前列。

解读:LangChain 生态与基础大模型直接调用双峰并立,说明市场既有“框架派”也有“模型原生派”。AgentScope / QwenPaw 这类 Agentic 框架占比 30%,增长较迅速,12% 仍在调研,Agent 呈现构建碎片化、多源 Agent 管理需求增多的趋势。
只有先看清 Agent 的完整运行轨迹,才能定位问题、量化表现、形成评估与优化的事实依据。这部分揭示了当前从业者如何排查线上故障、使用什么工具,以及距离完整 trajectory 观测还有多远。
Q12:线上 Agent 出问题时,您现在怎么定位?
反映当前问题定位手段的成熟度,人工拼调用链仍是主流。

解读:40.4% 仍在用最原始的日志/ print 拼调用链,19.6% 基本靠猜或复现,意味着近六成团队缺乏可视化轨迹。仅有 13.4% 拿到完整 trajectory,这是 AgentOps 成熟度最直观的短板。没有轨迹,评估和优化都缺乏共同事实基础。
Q13:您在用哪些可观测工具?
接近半数没有专门工具,开源方案与自建 APM 占一定份额。

解读:46.7% 没有专门工具,与 Q12 中近六成团队定位手段落后相互印证。开源方案占 23%,自建 APM 占 18.5%,说明先行者已经在填补空白,但缺少统一标准;云厂商可观测产品渗透率仅 11.6%,存在较大增长空间,开箱即用成为工具或平台型产品的核心竞争力。
审计与可追溯是 Agent 进入生产环境的硬约束,尤其在金融、政企、医疗等关键行业。这个分类衡量合规需求的真实强度与落地能力之间的落差,Agent 上线之后必须解决“可解释、可回放、可追责”。
Q15:您的业务对 Agent 的可审计 / 可追溯有要求吗?
合规压力显著高于落地能力,已上线团队“有要求没落地”的比例最高。

解读:审计需求渗透率高达 94.2%,其中 36.2%“有要求但还没落地”,是最典型的“想要但做不到”。已强制全链路留痕的仅占 31.4%。这说明可追溯不是未来问题,而是当前 Agent 进入生产前的真实瓶颈。
评估是判断 Agent 是否更好的标尺。这部分对比了人工经验驱动与数据驱动两种评估模式,展示指标体系的普及程度,以及自动化评估和 A/B 实验在当前的渗透率。
Q17:您现在如何判断 Agent 回答“够好”?
评估方式仍以人工为主,数据驱动发版者极少。

解读:人工驱动评估合计占比 70.9%,自动化评估仅占 19.8%,完整线上评估 + A/B 数据驱动发版仅 6.9%。这与 Q10 中 31.4% 已上线形成明显落差:大量 Agent 已经上线,却依然靠人肉判断质量。这种状态风险高、不可持续,也解释了为什么“Agent-as-a-Judge”和数据驱动发版会成为下一阶段热点。
Q18:您关注 / 用过哪些评估指标?(多选)
任务完成率、工具调用准确率最受关注,近三成尚未建立指标体系。

解读:任务完成率与工具调用准确率是最受关注的硬指标,合计超过半数受访者关注。近三成(29.8%)尚未建立指标体系,说明有指标意识和有指标体系之间存在断层。事实一致性占比 40.2%,反映 RAG / 工具调用场景下对幻觉控制的重视。
优化是 Close the Loop 的最终目标。这个分类关注团队是否已经形成数据回灌闭环,以及他们希望通过 Agent 进化解决哪些核心痛点,从推理质量、知识沉淀到成本与迭代效率。
Q20:您有没有建立“数据回灌 → 持续优化”的闭环?
优化闭环整体薄弱,超过半数完全没有闭环。

解读:52.6% 完全没有闭环,30.2% 会看线上数据但没闭环,合计 82.8% 的优化仍停留在人工或半人工阶段。仅有 2.8% 建成数据飞轮。优化闭环是当前 Agent 工程化的最大洼地,也意味着谁能把“线上数据 → 评估 → 实验 → 回测 → 发版”串成可配置 Pipeline,谁就能占据下一轮竞争高地。
Q21:您希望通过进化,提升什么?(多选)
推理质量与 Skills 沉淀是最高优先级诉求,成本与迭代周期也高度关注。

解读:四项诉求均获得超过六成受访者选择,说明优化需求旺盛且多元。推理质量(81.7%)与 Skills 沉淀(78.1%)位居前两位,反映团队既追求单次效果提升,也追求组织能力沉淀。降低成本(63.5%)与缩短迭代周期(74.6%)同样是规模化生产的刚性诉求,与 Q20 中闭环薄弱形成供需错配。
综合判断
Cloud Native
综合全部数据,可以把当前 Agent 市场概括为:需求强烈、基建薄弱、认知体系化不够的特点。
从建设阶段看:多数团队已经跨过尝鲜期,Agent 进入真实业务场景只是时间问题。但 POC 到规模化生产之间隔着一套完整的工程化体系。 从观测能力看:没有统一 trajectory,问题定位靠猜、靠日志、靠复现,直接拖累故障排查效率和迭代速度。 从评估能力看:指标体系意识已经觉醒(超过七成受访者关注任务完成率、工具准确率等硬指标),但工程化评估和自动化门禁远未普及。 从优化能力看:团队普遍希望把经验沉淀为 Skills、提升推理质量、缩短迭代周期,但缺少把“线上数据 → 评估 → 实验 → 回测”串起来的平台与流程。 从审计合规看:这是 Agent 进入金融、医疗、政企等关键行业的硬门槛。当前有要求没落地的状态,意味着合规能力将成为下一阶段产品竞争的关键差异化点。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


