JOTO
Contact us
← AI 智库
大语言模型

Agent 观测与优化开发者摸底报告

2026 年 9 月 8 日

Agent生产落地遇难题?700+企业调研揭示观测、评估、优化基建薄弱痛点,助你建立可优化工程闭环。 核心内容: 1. Agent生产落地现状:需求强烈但基建薄弱、认知体系化不足 2. 观测与评估核心瓶颈:轨迹观测工具缺乏、评估依赖人工经验 3. 优化闭环与审计合规:闭环未形成但需求迫切,审计落地能力待提升

越来越多企业把 Agent 从 Demo 推入生产环境,但 Agent 的不可预测性、长程推理黑箱、工具调用风险,让传统的日志与监控手段越来越不够用。

为了让更多企业看清 Agent 上线后的真实运行状态、建立可评估与可优化的工程闭环,我们于 8-9 月在北京、上海、深圳三城发起「Agent 评估与优化 · Close the Loop」的系列开发者沙龙,集中分享我们在 Agent 观测、审计、评估、实验回测、优化等方面的实践。

此外,我们尝试通过这种方式对企业 Agent 的落地现状做一个基本的摸底。总体上,呈现出需求强烈、基建薄弱、认知体系化不够的特点。比如,超过六成受访者已进入 POC 或生产阶段,大家推理质量提升、Skills 沉淀、审计可追溯的诉求却非常强烈;但对完整 trajectory 观测、自动化评估、数据回灌闭环的掌握度仍然很低,能拿到完整 trajectory 的仅 13.4%;优化的北极星指标、评估基建还未完全建立起来;另外,由于评估和优化依赖平台方和业务方共同参与,如何进行组织分工是最优解,也是大家讨论非常多的。

本文对 700+ 的调研数据,进行汇总和分析,希望对提升企业 Agent 建设质量,有所帮助。

数据说明:700+ 的调研数据来自三场线下活动的报名问卷,仅作为参会群体的画像研究。

01

核心结论

Cloud Native

1. Agent 治理能力还未跟上

约六成受访者已进入 POC 或生产阶段,但真正规模化生产的不足 5%。市场已经从“做 Demo”转向“上生产”,但大规模治理的能力尚未跟上。

2. 观测是第一个拦路虎

近半数受访者没有专门观测工具,四成仍在用日志 / print 人工拼调用链,能拿到完整 trajectory 的仅 13.4%。没有轨迹,评估与优化都缺乏事实依据。

3. 评估仍以人工和经验驱动为主

43.4% 靠人肉抽查或用户反馈,仅 6.9% 实现完整线上评估 + A/B 数据驱动发版。Agent 质量的判断仍高度依赖主观经验。

4. 优化闭环远未形成,但需求旺盛

52.6% 完全没有数据回灌闭环,仅 2.8% 已有数据飞轮。与此同时,81.7% 希望提升推理质量,78.1% 希望把经验沉淀为可复用 Skills。

5. 审计合规是普遍且迫切的约束

94.2% 的业务有或预见有审计要求,但 36.2% 有要求却还没能力落地。可追溯不是未来问题,而是当前 Agent 进入生产前的真实瓶颈。

02

调研分类与解读

Cloud Native

1. 受访者画像

岗位构成、Agent 所处阶段和主流技术栈,决定了后续观测、评估、优化需求的差异性,也决定了 Close the Loop 系列活动必须同时服务开发者、架构师和产品决策者三类人群。

Q1:您的岗位是?

了解参会者的角色构成,判断内容应同时覆盖工程深度与业务视角。

Agent 观测与优化开发者摸底报告

解读:工程师与架构师合计占比超过 60%,说明活动受众以技术决策者和执行者为主;产品经理/项目负责人占 21%,显示 Agent 项目已经开始从实验室走向业务侧立项。学生/研究者与创业者各占 7%,意味着社区中仍有大量早期探索者。

Q2:您的 Agent 目前处于哪个阶段?

识别 Agent 落地的成熟度分布,区分学习、POC、生产与规模化四个阶段。

Agent 观测与优化开发者摸底报告 配图 2

解读:34% 仍处于学习/ Demo 阶段,但 66% 已经进入 POC 或生产,Agent 从概念验证到真实落地的窗口已经打开。值得注意的是,真正规模化生产的仅占 4.6%,说明从“能跑”到“能管”仍缺少成熟范式。

Q3:您主要用什么框架 / 平台构建 Agent?(多选)

框架生态高度分散,LangChain 与基础大模型直接调用位居前列。

Agent 观测与优化开发者摸底报告 配图 3

解读:LangChain 生态与基础大模型直接调用双峰并立,说明市场既有“框架派”也有“模型原生派”。AgentScope / QwenPaw 这类 Agentic 框架占比 30%,增长较迅速,12% 仍在调研,Agent 呈现构建碎片化、多源 Agent 管理需求增多的趋势。

2. 观测 Observe

只有先看清 Agent 的完整运行轨迹,才能定位问题、量化表现、形成评估与优化的事实依据。这部分揭示了当前从业者如何排查线上故障、使用什么工具,以及距离完整 trajectory 观测还有多远。

Q12:线上 Agent 出问题时,您现在怎么定位?

反映当前问题定位手段的成熟度,人工拼调用链仍是主流。

Agent 观测与优化开发者摸底报告 配图 4

解读:40.4% 仍在用最原始的日志/ print 拼调用链,19.6% 基本靠猜或复现,意味着近六成团队缺乏可视化轨迹。仅有 13.4% 拿到完整 trajectory,这是 AgentOps 成熟度最直观的短板。没有轨迹,评估和优化都缺乏共同事实基础。

Q13:您在用哪些可观测工具?

接近半数没有专门工具,开源方案与自建 APM 占一定份额。

Agent 观测与优化开发者摸底报告 配图 5

解读:46.7% 没有专门工具,与 Q12 中近六成团队定位手段落后相互印证。开源方案占 23%,自建 APM 占 18.5%,说明先行者已经在填补空白,但缺少统一标准;云厂商可观测产品渗透率仅 11.6%,存在较大增长空间,开箱即用成为工具或平台型产品的核心竞争力。

3. 审计 Audit

审计与可追溯是 Agent 进入生产环境的硬约束,尤其在金融、政企、医疗等关键行业。这个分类衡量合规需求的真实强度与落地能力之间的落差,Agent 上线之后必须解决“可解释、可回放、可追责”。

Q15:您的业务对 Agent 的可审计 / 可追溯有要求吗?

合规压力显著高于落地能力,已上线团队“有要求没落地”的比例最高。

Agent 观测与优化开发者摸底报告 配图 6

解读:审计需求渗透率高达 94.2%,其中 36.2%“有要求但还没落地”,是最典型的“想要但做不到”。已强制全链路留痕的仅占 31.4%。这说明可追溯不是未来问题,而是当前 Agent 进入生产前的真实瓶颈。

4. 评估 Evaluate

评估是判断 Agent 是否更好的标尺。这部分对比了人工经验驱动与数据驱动两种评估模式,展示指标体系的普及程度,以及自动化评估和 A/B 实验在当前的渗透率。

Q17:您现在如何判断 Agent 回答“够好”?

评估方式仍以人工为主,数据驱动发版者极少。

Agent 观测与优化开发者摸底报告 配图 7

解读:人工驱动评估合计占比 70.9%,自动化评估仅占 19.8%,完整线上评估 + A/B 数据驱动发版仅 6.9%。这与 Q10 中 31.4% 已上线形成明显落差:大量 Agent 已经上线,却依然靠人肉判断质量。这种状态风险高、不可持续,也解释了为什么“Agent-as-a-Judge”和数据驱动发版会成为下一阶段热点。

Q18:您关注 / 用过哪些评估指标?(多选)

任务完成率、工具调用准确率最受关注,近三成尚未建立指标体系。

Agent 观测与优化开发者摸底报告 配图 8

解读:任务完成率与工具调用准确率是最受关注的硬指标,合计超过半数受访者关注。近三成(29.8%)尚未建立指标体系,说明有指标意识和有指标体系之间存在断层。事实一致性占比 40.2%,反映 RAG / 工具调用场景下对幻觉控制的重视。

5. 优化 Optimize

优化是 Close the Loop 的最终目标。这个分类关注团队是否已经形成数据回灌闭环,以及他们希望通过 Agent 进化解决哪些核心痛点,从推理质量、知识沉淀到成本与迭代效率。

Q20:您有没有建立“数据回灌 → 持续优化”的闭环?

优化闭环整体薄弱,超过半数完全没有闭环。

Agent 观测与优化开发者摸底报告 配图 9

解读:52.6% 完全没有闭环,30.2% 会看线上数据但没闭环,合计 82.8% 的优化仍停留在人工或半人工阶段。仅有 2.8% 建成数据飞轮。优化闭环是当前 Agent 工程化的最大洼地,也意味着谁能把“线上数据 → 评估 → 实验 → 回测 → 发版”串成可配置 Pipeline,谁就能占据下一轮竞争高地。

Q21:您希望通过进化,提升什么?(多选)

推理质量与 Skills 沉淀是最高优先级诉求,成本与迭代周期也高度关注。

Agent 观测与优化开发者摸底报告 配图 10

解读:四项诉求均获得超过六成受访者选择,说明优化需求旺盛且多元。推理质量(81.7%)与 Skills 沉淀(78.1%)位居前两位,反映团队既追求单次效果提升,也追求组织能力沉淀。降低成本(63.5%)与缩短迭代周期(74.6%)同样是规模化生产的刚性诉求,与 Q20 中闭环薄弱形成供需错配。

03

综合判断

Cloud Native

综合全部数据,可以把当前 Agent 市场概括为:需求强烈、基建薄弱、认知体系化不够的特点。

  • 从建设阶段看:多数团队已经跨过尝鲜期,Agent 进入真实业务场景只是时间问题。但 POC 到规模化生产之间隔着一套完整的工程化体系。
  • 从观测能力看:没有统一 trajectory,问题定位靠猜、靠日志、靠复现,直接拖累故障排查效率和迭代速度。
  • 从评估能力看:指标体系意识已经觉醒(超过七成受访者关注任务完成率、工具准确率等硬指标),但工程化评估和自动化门禁远未普及。
  • 从优化能力看:团队普遍希望把经验沉淀为 Skills、提升推理质量、缩短迭代周期,但缺少把“线上数据 → 评估 → 实验 → 回测”串起来的平台与流程。
  • 从审计合规看:这是 Agent 进入金融、医疗、政企等关键行业的硬门槛。当前有要求没落地的状态,意味着合规能力将成为下一阶段产品竞争的关键差异化点。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.