企业对AI智能体自主生产部署的信任度显著下降:从75%降至56%
VentureBeat调查显示,允许AI智能体不经人工审批即实施生产变更的企业比例由7月的75%骤降至8月的56%;同期,坚持人工审核的组织比例翻倍至42%。尽管评估工具采用率上升,但内部测试通过却引发客户故障的事件频发,暴露自动化评估与真实表现间的信任鸿沟。

企业越来越犹豫是否在未经人工审批的情况下,赋予AI智能体全面权限以将代码或系统变更部署至生产环境,尽管它们仍在持续投资于旨在评估智能体可靠性的工具。
在VentureBeat的 8月智能体可靠性与评估(Agentic Reliability and Evaluations) 调查波次中, 56%的受访者 所在组织已部署自主AI智能体,他们表示 目前已仅依据自动化评估结果就允许实施某些生产环境变更,无需人工审核;或正在对其系统进行工程化改造,以便在未来一年内实现这一能力。这一比例较VentureBeat 7月调查中的75%出现了 显著下降。

图片来源:VentureBeat Intelligence
一个可能的复杂因素是受访者构成: 8月调查的140名受访者中,超过一半(53%)为最终AI采购决策者,而7月该比例为44%。
然而,这一下降趋势在该群体内部同样明显。在已部署自主智能体的组织中,身为最终采购决策者的受访者中,允许未经审核即实施生产变更或正为此构建能力的比例,从7月的88%降至8月的61%。
因此,这些发现指向被调查组织内部发生的实质性转变,而非单纯由受访者构成差异所导致。不过,两次调查均依赖于不同且自我选择的VentureBeat读者及小组成员群体,这意味着结果未必能反映整个企业市场的相应变化。
有趣的是,这一动向发生在Anthropic首席执行官Dario Amodei发表其引发轰动的论文 “我们必须放慢前沿步伐” (9月12日)之前,他在文中呼吁放缓前沿AI发展速度并加强安全监管。包括OpenAI首席执行官Sam Altman和Google DeepMind的Demis Hassabis在内的其他行业领导者随后 表达了对采取更大谨慎态度的支持。
由于该调查于8月开展,此次转变不可能是对Amodei论文的直接反应。然而,数据并未明确揭示企业为何对自主部署变得更加谨慎。
更富启示性的分歧在于:企业虽愿意将自动化评估用于生产部署决策,却仍在持续采用相关工具本身。尽管取消人工审批的支持率下降,但OpenAI原生评估工具的使用率却大幅上升,从7月的31%增至8月的59%。
与此同时, 61%的受访者 所在组织在部署前会开展评估 报告称,在过去12个月内至少发生过一次AI智能体或大语言模型(LLM)功能通过内部测试,但随后导致面向客户故障的事件 。

图片来源:VentureBeat Intelligence
综合来看,这些发现表明企业正区分对待自动化评估的两种用途:一是将其用于评估AI系统,二是将其作为将变更投入生产的唯一授权依据。
信任鸿沟使人工监督在企业AI中保持核心地位
8月的回应将企业划分为截然不同的阵营。超过四分之一(27%)的企业已允许某些低风险智能体在 无需人工验证的情况下部署变更,而35%的企业则在可预见的未来彻底排除该做法,另有20%的企业正于12个月内朝此方向进行工程化建设。另有16%的企业根本不部署自主智能体。剩余2%的受访者表示不确定。这些数据涵盖全部140名8月受访者,包括未部署自主智能体的组织。
若剔除未部署自主智能体的组织受访者,则在已部署自主智能体的组织中,32%已允许针对特定低风险智能体或变更实施未经审核的生产变更,另有24%正为此构建能力。另有42%预计将在可预见的未来持续保留人工审核。
最后这一比例代表了本次调查中最清晰的变化之一:预计将持续保留人工审批的、已部署智能体的组织受访者比例,从7月的20%上升至8月的42%,这一增长具有统计学显著性。
然而,转向保留人工审批的趋势似乎并未伴随可靠性投入优先级的同等转变。

图片来源:VentureBeat Intelligence
当被问及未来一年内哪一项 单一可靠性或评估类投资 将增长最多时,8月受访者的选择如下:
人工审核工作流: 30%
生产可观测性工具: 26%
自动化评估流水线: 21%
安全与政策评估: 11%
可靠性预算未增加: 11%
这些数字衡量的是受访者预期投资增长最快的领域,而非其所在组织实际支出的分配方式。
7月调查结果总体相似:31%选择人工审核工作流,30%选择生产可观测性,19%选择自动化评估流水线,16%选择安全与政策评估。
因此,人工审核在8月仍是最常被选中的增长领域,尽管其领先于生产可观测性的幅度过小,不足以构成统计学上显著的差异。调查结果也并未表明企业正在削减评估支出,或正将资金从自动化方向重新分配。
安全 与政策评估比模型是否准确更为深入;它们涉及分析智能体是否会在应拒绝时拒绝、是否遵守政策,以及是否避免产生有害输出。
尽管将安全与政策评估列为增长最快投资领域的受访者比例从16%下降至11%,但这并不意味着相关活动的实际支出减少;它仅表明更少的8月受访者将该类别选为其所在组织预期可靠性投资增长最大的单一领域。
相反,该调查描绘出一幅图景:企业在持续开发人工与自动化监督能力的同时,也在重新审视哪些决策可完全交由机器独立完成。
内部评估仍无法防止面向客户的事故
企业可能不愿取消人工审核的一个原因是内部评估与真实世界表现之间持续存在的差距。然而,该调查并未直接证实评估失败导致了部署态度的变化。
VB询问:一项通过内部评估的AI或大语言模型(LLM)功能,最终是否引发了面向客户的 故障。
剔除5%未进行上线前评估的受访者后, 61%报告称在过去12个月内至少发生过一次此类故障。 令人震惊的是, 22%报告称 发生过不止一次 此类故障。
可直接比较的7月数据为101名受访者中的53%,而非此前公布的全部108名7月受访者中的49%。
8月数值虽略高,但差异无统计学显著性,这意味着该调查未能证实经历“通过评估却仍发生故障”的组织比例实际增加。
一项更窄范围的发现确实显示出统计学上显著的变化:报告恰好发生一次此类故障的比例从7月的27%上升至8月的39%。
这一区分至关重要,因为这些结果衡量的是多少受访组织至少经历过一次故障,而非单个智能体或单次部署发生故障的频率。一家部署数百项AI功能的企业,遭遇面向客户事故的机会远高于仅部署少量功能的企业。
人们对旨在发现此类问题的系统信任度相应薄弱:当被问及哪一限制因素最削弱其对自动化智能体评估的信任时,仅有9%的8月受访者选择“我们如今信任自动化评估”这一选项。相比之下,7月为13%,6月为5%。
从7月到8月的下降幅度无统计学显著性。此外,由于受访者被要求仅选择其最关切的一项限制因素,因此不应将该结果解读为91%的受访者对自动化评估完全不抱任何信心。
最主要的反对意见是评估系统与真实世界结果不一致(27%的受访者指出);其他担忧包括缺乏可解释性(24%的受访者)、评估存在偏见或不一致(16%)、数据泄露或隐私问题(13%),以及工具链尚不成熟(12%)。
有趣的是,曾经历过“通过评估却仍发生故障”的受访者,在推进自主部署方面的意愿并未明显弱于未经历过此类故障的受访者。
在8月报告其所在组织部署自主智能体的受访者中,报告过“通过评估却仍发生故障”的受访者里有59%已允许未经审核的生产变更,或正为此类目标进行工程开发;而报告未发生此类故障的受访者中,对应比例为55%,差异过小,不足以确立有意义的关联。
这与7月调查形成显著对比:在7月调查中,曾经历过“通过评估却仍发生故障”的组织似乎更倾向于追求零人工部署;但这一关联在8月调查中并未清晰显现。
最终,8月调查结果支持一个比“企业因自动化评估无效而简单放弃自动化”更为细致的结论:企业正日益不愿在生产部署中移除人工审批环节,同时仍在持续投资并采用评估基础设施。
当前浮现的关键问题并非企业是否会实现智能体评估的自动化,而是这些评估在无人工干预的情况下被赋予多大的运行决策权限。
企业如何对智能体开展上线后测试
但上线前测试仅是一层保障措施。同样重要的是,企业需了解智能体上线后实际执行了哪些操作。
在118名报告其所在组织部署自主智能体的8月受访者中,仅有29%表示其主要的生产监控方式是对实时智能体输出执行自动化质量检查。
相比之下,36%主要依赖事务追踪日志(transaction trace logging),即记录基础设施活动、token数量以及输入和输出内容,以供后续调试之用,但未必评估智能体回答是否正确。
这令人担忧,因为一个快速但自信错误的响应可能生成一条干净的追踪日志和一个200状态码,即HTTP请求已成功完成。
以下为部署自主智能体的组织中,各类 主要生产监控方式 的完整分布情况:
事务追踪日志(transaction trace logging): 36%
对实时流量执行内联质量断言(inline quality assertions on live traffic): 29%
API网关基础设施追踪(API gateway infrastructure tracking): 16%
不知道或不属于我的领域: 11%
临时审查: 8%
合计,53%的受访者将事务追踪或网关监控列为他们的主要方法。这两种方法均可帮助识别基础设施问题,但问卷中并未将二者描述为直接检查代理生成输出正确性的手段。
监控缺口在已允许自主生产部署的组织中尤为明显。根据VentureBeat Intelligence底层的8月调查分析, 在38名其所在组织已允许某些无需人工审批即可进行生产变更的受访者中,仅有10人 将 对实时输出的自动化质量检查 列为他们的主要监控方法。
该比例约为26%,与7月40名可比受访者中记录的28%相近。研究结果表明,从部署流程中移除人工审批,并不必然意味着企业将自动化输出质量监控作为其生产环境中的首要保障措施。
然而,该结果并未证实其余组织缺乏其他质量控制措施。部分组织可能运行补充性的自动化检查,或依赖于本单选题未涵盖的其他形式审查。
尽管如此,结果表明,许多企业的生产监控仍更侧重于判断AI系统是否在运行,而非其是否生成了正确答案。
当组织允许 AI代理在无需人工审批步骤的情况下部署变更 时,这一区别尤为关键。
在部署环节取消人工审查,并不一定意味着后续无法通过自动化机制检测问题。但当组织主要依赖基础设施监控时,一个看似合理实则错误的代理输出可能不会触发任何错误或告警。
8月调查并未确定,在允许未经审查即部署的组织中,究竟有多少家完全缺乏实时质量监控,也未说明其问题通常是否通过自动化告警、员工反馈或客户投诉被发现。
但它揭示了寻求更高代理自主性之企业面临的一项实际挑战:自动化评估必须捕捉的不仅是基础设施故障,还必须识别那些语法有效、成功交付却依然错误的输出。
对于正在扩大代理使用范围的组织而言,一个关键问题是:如何在部署后建立有效的质量监控机制,而不完全依赖客户或人工评审员来发现问题。
供应商市场
AI评估与可观测性工具领域同样呈现混合态势。
OpenAI开发者平台出现在59%的技术栈中(相较7月的31%),增幅具有统计显著性,且被40%的8月受访者(回答了平台问题者)列为主要评估平台。 主要评估平台 的8月受访者所选。

图片来源:VentureBeat Intelligence
在明确使用OpenAI原生评估工具的组织中,约69%将其列为自身主要平台。这是两项不同指标:前者描述OpenAI作为主要平台在全部受访者中的占比,后者衡量已采用OpenAI的组织中选择其作为主要平台的比例。
Confident AI出现在36%的技术栈中,10%的全部受访者将其列为自身主要平台;在使用Confident AI的组织中,29%将其列为主要平台。
与此同时,Braintrust出现在23%的技术栈中,作为全部受访者的主平台占12%;Anthropic出现在16%的技术栈中,作为全部受访者的主平台占10%;LangSmith出现在13%的技术栈中,作为全部受访者的主平台占2%。
为保持一致性,下表比较均以136名8月受访者为基数,同时用于平台采用率与主平台选择率。
平台 | 技术栈中采用 | 主平台 |
OpenAI开发者平台 | 59% | 40% |
Confident AI(DeepEval) | 36% | 10% |
Braintrust | 23% | 12% |
Anthropic Claude Console / Workbench | 16% | 10% |
LangSmith | 13% | 2% |
受访者可列出多个正在使用的工具,但仅能指定一个主要平台,因此各项采用率并非互斥。
月度同比供应商趋势中最显著的发现是 OpenAI 采用率上升,从31%增至59%。 Confident AI 的采用率也从7月的27%上升至8月的36%,但该差异在统计学上并不显著。
VentureBeat Intelligence 未对两个月份间各供应商作为主要平台的份额进行直接比较,因为7月调查允许受访者选择一个其此前并未确认为正在使用的平台作为主要平台,从而导致无法进行严格意义上的逐项对比。
至于基础设施路线图, 62%的8月受访者计划在12个月内采用一款新的、额外的或替代性的评估平台。超过三分之一 (35%)预计将在三个月内实施。
这些计划并不必然意味着组织对其现有评估供应商感到不满或正准备弃用它们。调查涵盖两类企业:一类希望在当前工具之外新增另一平台;另一类则正在考虑更换现有平台。
对供应商而言,这表明其在技术栈中所处地位存在差距——即究竟是作为技术栈中的主要驱动者,还是仅仅作为其中一员而存在。随着相关技术日趋成熟,这种差距可能催生不同的竞争格局及续约风险。
然而,本次调查并未直接衡量供应商留存率、续约率,亦未考察将某平台作为次要工具使用的组织是否更有可能停用该平台。这些仍属潜在的竞争影响,而非已确立的结果。
企业AI信任鸿沟正在演变,而非消失
综合来看,VentureBeat Intelligence 的8月调查结果揭示了企业AI市场中的一种张力:尽管组织持续部署评估基础设施,却愈发谨慎地依赖自动化评估结果来授权无需人工审批的生产环境变更。
在已部署自主智能体(autonomous agents)的组织中,目前已允许未经审核即部署、或正朝此方向建设的受访者比例显著下降,从75%降至56%;而预期在可预见的未来持续保留人工审核环节的受访者比例则翻倍以上,从20%升至42%。
与此同时,大多数在其组织中开展上线前评估的受访者报告称,某项功能虽通过内部测试,但上线后仍至少发生过一次面向客户的故障;而在部署自主智能体的组织中,仅有29%的受访者将实时输出质量检查列为他们的主要监控方式。
这些发现表明,企业在判断智能体可靠性时所依赖的系统仍存在尚未解决的缺口。但它们并未证明评估本身正变得越来越无效,亦未证实上述报告的故障直接导致组织重新思考部署自主性。
且企业远未放弃该技术:OpenAI 的评估工具获得大幅采用,而近三分之二的8月受访者预计将在一年内采用、新增或替换一款评估平台。
对企业AI团队的启示在于:自动化评估与自动化部署审批是两项不同决策,当底层测试失败时,二者将带来不同后果。
随着智能体逐步获得对日益关键的业务系统进行变更的能力,企业必须决定的,不仅在于自动化评估是否有用,更在于其结果何时足够可靠,足以证明可将人类从最终审批流程中移除。
8月调查显示,对越来越多的受访者而言,这一门槛尚未达到。
JOTO 企业落地观察
- 对企业部署而言,该变化表明:即使持续投资OpenAI等评估工具(采用率升至59%),企业仍系统性收紧对‘免审上线’的授权范围——已部署智能体的组织中,保留人工审批者比例从20%跃升至42%,说明部署策略正从‘能力优先’转向‘风险可控优先’。
- 对智能体工程而言,监控实践严重滞后于部署权限下放:仅29%部署智能体的组织以实时输出质量检查为主要监控方式,而53%依赖事务追踪或网关日志——这类基础设施层监控无法识别‘语法正确但语义错误’的输出,导致工程团队需重构质量保障链路,而非仅优化测试阶段。
- 对AI安全治理而言,调查揭示出关键矛盾:安全与政策评估(如拒答合规性、有害输出拦截)虽被明确认知为深层需求,但其作为‘增长最快投资’的占比反从16%降至11%;这暗示当前治理投入仍集中于可观测性与工作流自动化,尚未形成覆盖策略执行、行为审计与后果追溯的闭环治理体系。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


