基于 AiDD 北京大会 90 份一线技术团队问卷的数据洞察
90 份有效样本 | AiDD 北京 大会现场 | 技术团队 受访主体 | 2026.08 调研
企业 AI 应用的竞争焦点,已经从「选择模型」全面切换到了「工程能力」。这个判断不是来自咨询师的 PowerPoint,而是来自 90 份一线问卷——我们在 AiDD 北京大会现场收集,受访者主要来自各家公司的技术与科技团队。这份样本的价值不在于它有多大,而在于它几乎是一份「AI 工程一线」的快照:正在亲手把模型往生产里推的人,他们卡在哪里、愁什么,比任何二手行业报告都更诚实。
一、调研画像:谁在回答这份问卷
90 份样本里,技术负责人 / 架构师与工程师合计占 63%,500 人以上规模企业占 68%。这不是一份来自 CxO 视角的战略设想,而是一线工程团队的实况记录——他们在 POC 和 demo 上花的时间,远多于在会议室里讨论 AI 战略。也正因为如此,下面所有结论最合适的读者,正是那些「模型已经跑通 demo、却始终推不到生产」的技术负责人。

二、成熟度全景:大多数企业卡在「部门级」
我们沿用一套四级智能体演进框架来定位企业的位置:从 Embedded agents(嵌入式智能体,AI 嵌入既有流程)出发,到 Standalone agents(独立式智能体,承担有边界的职能任务),再到 Goal-driven agents(目标驱动型智能体,跨职能编排、以业务结果为约束),最终抵达 Multiagent systems(多智能体系统,人机混合劳动力)。

调研结果呈现出一个陡峭的倒金字塔:约 82% 的企业仍停留在探索期至独立期之间——AI 要么在 POC 里验证,要么嵌入单个流程做增强,要么以独立 Agent 承担某个职能;真正跨过「部门级」门槛、进入 Goal-driven 与 Multiagent 阶段的,只有约 16%。越往上,人越少。

更值得玩味的是工程成熟度随阶段的抬升。我们对四个框架阶段企业的 7 项核心工程能力取 1–5 自评均值,得到一条清晰的上升曲线:Embedded 阶段约 2.6 分,Standalone 约 3.2 分,Goal-driven 约 3.4 分,Multiagent 阶段达到 4.0 分。探索期作为 Embedded 之前的 POC 预备阶段不计入该曲线,其均值约 2.7、与嵌入期基本持平。换句话说,从 Embedded 到 Standalone 的 0.6 分跃升,几乎是四个阶段里最陡的一跳——这正是从「AI 辅助」走向「Agent 独立承担」的分水岭。区分领先者与落后者的最强信号,不是「用了哪个模型」,而是「工程底座有多厚」。
三、瓶颈已变:Harness 工程能力是第一约束
如果把「卡住你的到底是什么」摆上台面,答案会和一年前的直觉完全不同。
39 位受访者(43.3%)把「Agent 工程 / Harness 能力不足」列为头号瓶颈——这几乎是「模型能力不足」(15 位,16.7%)的 2.6 倍。在「阻碍 Agent 落地的最大挑战」中,「缺乏工程化体系(Harness / 工具链 / 编排)」以 36.7% 高居第一,远超「模型能力不够强」的 20%。两组数据像两面镜子,照出同一个事实:模型已经不是最疼的地方,工程才是。

模型焦虑正在退潮,取而代之的是工程焦虑。一个贴切的比喻是:企业今天面临的不是「买不到发动机」,而是「买到了发动机,却造不出能上路的整车」。Harness——把模型、工具、数据、评估、护栏缝合成可运行系统的那层工程体系——才是真正的瓶颈。
四、FDE:浮现中的关键角色,认知即探针
在这场从模型到工程的转变里,一个角色正在浮出水面:FDE(Forward Deployed Engineer,前线部署工程师)。它的出现并非偶然——当模型能力跑在了企业工程化能力前面,中间那道裂缝需要有人来填,FDE 就是那个站在裂缝上的人。

调研里 82% 的受访者听说过 FDE,但只有 7.8% 表示深入了解。更有意思的是 FDE 认知深度与工程成熟度的关系:把受访者按「从未听说 → 听说过但不了解 → 有基本了解 → 深入了解」分组,其团队工程成熟度均值分别是 2.47、2.67、3.2、3.98——一条干净的上坡线,深入了解组的成熟度几乎追平 Multiagent 阶段的数字。
这暗示 FDE 已经不是一个时髦头衔,而是组织 AI 成熟度的探针:一个团队是否真正理解「把模型工程化落到业务现场」这件事,直接反映在它能把 Agent 跑多稳、跑多远。FDE 的核心含义,受访者也用多选投了票——「模型之上的工程化能力」以 65.6% 居首,其次是 Agent 工程框架(52.2%)与数据工程基础(45.6%)。换句话说,FDE 被理解为「懂业务现场的工程师」,而非「更会调模型的科学家」。

「深入了解」组工程成熟度达 3.98;「从未听说」组仅 2.47。FDE 认知与企业工程成熟度强正相关,可视为组织 AI 成熟度的探针指标。
五、场景与能力:代码先行,评估为王
当下的 AI 应用,代码辅助开发以 66.7% 的占比碾压式领先,智能客服(42.2%)与数据分析 / BI(40%)次之。这并不意外——代码是最结构化、最易验证、容错空间最大的场景,自然成为工程团队的第一块试验田。但当试验田需要变成生产线,考验才真正开始。

但当被问及「未来 12 个月最想建设的能力」,排序发生了微妙而关键的反转:企业级评估体系以 54.4% 登顶,Agent Harness 框架(45.6%)与 AI 工程团队培养(35.6%)紧随其后。评估体系的登顶尤其说明问题——企业已经从「能不能做出来」进入「怎么知道它做得对不对」的阶段。一个没有评估体系的 Agent 系统,就像一台没有仪表盘的汽车:能跑,但你不知道它什么时候会偏出车道。这个排序,与前面「瓶颈在工程化、不在模型」的诊断完全自洽。

六、结论:从选择模型到构建能力
把以上几条线收拢,结论并不复杂:
-
第一,工程体系是分水岭。
模型正在商品化,真正的壁垒是 Harness 与评估这类工程能力。 -
第二,评估体系是当务之急。
当 54.4% 的企业把「建评估」列为头等大事,说明行业集体卡在「demo 到生产」的最后一公里。 -
第三,FDE 角色会加速显性化。
既是稀缺人才,也是组织 AI 成熟度的晴雨表。 -
第四,Agentic 转型是一场马拉松。
即便最成熟的 Multiagent 阶段,工程能力均值也才 4.0,没有任何一项能力被普遍「体系化掌握」——市场成熟还早,远未到终局。
最后,留给正在读这篇文章的技术决策者三个自检问题:
我们的 Agent,是「能演示」,还是「能上线、可评测、有边界」? 我们是否已经有了自己的 golden case 评测集和持续评测 pipeline? 团队里,有没有人既懂业务现场、又懂把模型工程化落地的 FDE?
如果三个问题里有两个仍然无法回答,那么比「再换一个更强的模型」更紧迫的,是把 AI 应用的工程底座搭起来。
肖然,英湃科技Inspire(原Thoughtworks)高级副总裁、数智金融总经理,兼任中关村智联联盟秘书长、上高金研究员。他长期深耕企业数字化与智能化转型,曾带队深度服务招行、工行、中行、华为、中金等行业巨头,并担任招行、工行等机构的特聘专家讲师。在大模型引领的“人工智能+”时代,他聚焦数据与智能驱动的商业及组织变革,全力推动AI技术在金融机构的落地应用。
英湃科技
Inspire
英湃科技(Inspire) 是一家拥有顶级高瓴资本(Hillhouse) 背景的新一代科技服务商。作为高瓴资本数智化赋能生态的重要核心企业,我们致力于将前沿 AI 技术与顶尖工程能力深度融合,帮助企业全面跃迁至数智化新高度。
公司源于 Thoughtworks 中国核心团队,于 2025 年 9 月获得高瓴资本的并购投资。我们不仅传承了世界级的软件架构设计与敏捷交付底蕴,更依托高瓴资本深厚的产业投资版图与全局洞察,拥有行业领先的生态协同优势。Inspire 能够深度链接高瓴庞大的被投企业生态与全球产业资源,在战略、技术、业务及供应链等多个维度实现强强联合与资源赋能。
围绕企业核心价值链,Inspire 聚焦研发、供应链、销售与服务等关键领域,全面重塑企业的核心能力与组织模式。迄今为止,我们已赋能银行金融、消费电子、具身智能、智能汽车、高精制造、医疗制药、消费零售等行业的 130+ 家全球 500 强及龙头企业。
Inspire 业务中心遍布新加坡、香港、上海、北京、深圳、成都、西安及武汉,结合高瓴资本的全球化视角与本地化工程精细度,持续为全球客户创造突破性的商业价值。
