JOTO
Contact us
← AI 智库
企业实践

客户案例复盘:5个真实AI智能体交付项目中的关键决策、失败教训与可复用方法论

2026 年 9 月 7 日

引言:为什么90%的企业AI项目上线后没人用? 企业花几百万搭起AI系统,三个月后发现使用率不到15%,业务同事一句“还不如Excel顺手”就把它打入冷宫——问题不在模型跑不跑得通,而在没人认真回看:这东西到底怎么被用的?谁在用?卡在哪?为什么不用? Gartner 2024年那份《AI工程化成熟度报告》里写得挺直白...

客户案例复盘:5个真实AI智能体交付项目中的关键决策、失败教训与可复用方法论

引言:为什么90%的企业AI项目上线后没人用?

企业花几百万搭起AI系统,三个月后发现使用率不到15%,业务同事一句“还不如Excel顺手”就把它打入冷宫——问题不在模型跑不跑得通,而在没人认真回看:这东西到底怎么被用的?谁在用?卡在哪?为什么不用?

Gartner 2024年那份《AI工程化成熟度报告》里写得挺直白:73%的AI项目失败,不是因为模型不准,而是上线后没人系统性地复盘真实使用场景。我们跟37家在Dify上落地AI智能体的企业打过交道。其中8家真正把AI用起来的,共同点很实在——每季度雷打不动做一次客户案例复盘,平均把二次迭代周期压到了11天。

这篇文章没讲大道理,也不堆术语。它来自JOTO团队亲手陪跑的5个头部客户:一家股份制银行、一家工程机械厂、一家三甲医院、一家连锁零售集团,还有一家省级政务服务中心。我们只聊一件事:从需求确认到用户真正在用,中间那些踩过的坑、改过的弯、省下的时间。

一、金融风控智能体:当“自动审批”变成“人工复核助手”

首月拒贷误判率飙到18.7%,问题出在哪?

某全国性股份制银行最初提的需求很明确:“用RAG+规则引擎,实现信贷终审自动化。”可系统上线第一周,拒贷误判率就冲到了18.7%(内部红线是≤3.2%)。

我们拉出所有对话日志、审批员的手动标注记录、模型每次输出的置信度,一条条对下来才发现:业务方其实心里清楚,法律上“终审权”不能交给机器;而技术团队一头扎进F1-score,越调越准,却离真实工作流越来越远。

复盘会之后,需求当场重写:不做终审,只做两件事——标出高风险线索,生成供人工复核的结构化建议。两周后,新工作流上线。

  • 复盘时盯三个地方:业务规则有没有悄悄变过?用户到底想问什么,而不是我们以为他想问什么?知识库里的材料,是不是早就不新鲜了?
  • 每次改之前,必须比对三样东西:当初签的PRD、真实发生的对话样本、现行有效的审批SOP
  • 设了个“熔断点”:如果单日人工干预率超过12%,系统自动发邮件提醒启动复盘

尽调报告PDF乱成一团,RAG召回率掉了一半

银行塞进来2.3万份PDF尽调报告,页眉页脚糊在一起、表格跨页断裂、还有手写批注嵌在扫描件里。测试环境RAG召回Top-3准确率是89.6%,一上生产环境直接跌到54.1%。

问题不是模型不行,是PDF解析器根本没见过银行自己的模板,向量库里更没标哪份报告法律效力强、哪份只是草稿。

后来做了三件事:

  1. 开发BankPDF-Adapter:能识别印章位置、把手写批注单独切出来
  2. 在Chroma向量库里加了个legal_weight: [1-5]字段,让检索时自动给高权重材料加分
  3. 把LLM提示词从“总结风险点”,改成“按《商业银行授信尽职指引》第X条,只提取具备法律追索效力的负面事实”

“AI落地不是让模型更聪明,而是让业务规则在向量空间里可计算、可审计、可追溯。”
——某国有大行科技子公司AI治理负责人,2023年JOTO闭门会

二、制造业设备运维Agent:从“答得上”到“猜得准”

故障描述只有“液压系统有怪声”,AI干瞪眼

某工程机械龙头上线的运维智能体,初期只连了ERP工单文本。工程师输入“液压系统异常噪音”,AI翻遍知识库也答不出所以然——准确率只有29%。

复盘时调出200多条真实故障记录,才看清问题:振动传感器的波形数据、维修视频里的异响帧、备件库存是否告急……三者时间对不上,模型等于在猜。

团队重新搭了数据管道:

  • 以故障发生时刻为圆心,截取前后5分钟的所有数据,打包成一个“特征包”
  • 用Time2Vec处理振动频谱,CLIP-ViT分析维修视频关键帧,图神经网络串起备件供应链关系
  • 把纯RAG升级成“RAG+Graph Reasoning”,根因定位Top-1准确率从31.2%跳到76.4%

工程师说话带方言,指着设备说“那个带红标的小盒子”

现场工程师根本不用键盘打字。他们边走边说:“缸盖喘气了”(其实是“漏气”),或者指着某个部件说“那个带红标的小盒子”。

我们录了217段现场语音,发现:

  • 38%的提问夹杂方言词
  • 42%的描述根本没给编号,全靠“小盒子”“上面那个蓝钮”这种指代

解决方案很土,但管用:

  1. 微调Whisper-large-v3,专识工程机械方言
  2. 做了个轻量级设备三维模型,语音指令能直接映射到BIM坐标上
  3. 在Dify流程里插了个“澄清节点”:听到“小盒子”这类词,立刻弹出TOP3候选部件图,点哪个算哪个

三、医疗科研助手:引用错了文献,整个方案就站不住脚

12.3%的参考文献链接失效,问题出在哪儿?

某三甲医院的临床试验方案生成助手,上线不久就被科研处叫停——输出内容里12.3%的参考文献,要么链接打不开,要么期刊根本没被PubMed收录。

复盘发现:没人验证过RAG返回的每一篇文献,是否真的可查、可引、可信。

后来硬性加了三条:

  • 所有检索结果必须带pubmed_idimpact_factorrettraction_watch_flag三个字段
  • LLM输出前,先过一道“引用校验Agent”,调CrossRef API实时验DOI
  • 设了条“灰色文献线”:近3年被引<5次,且作者单位无临床资质的论文,自动降权不推

四、别搞成会议,搞成动作

客户案例复盘不是坐一起夸成绩、甩锅、写纪要。它是带着数据来的动作:

  1. 小组必须有四类人:真正在用的业务同事(不是对接人)、AI工程师、合规官、一线培训师——少一个,复盘就缺一角
  2. 看四个数:人工干预率、任务完成耗时缩短了多少、知识库更新后多久能生效、合规部门驳回几次
  3. 用一张四象限画布决策:横轴是“这事技术上能不能做”和“业务上值不值得做”,纵轴是“做砸了多危险”和“大家愿不愿意配合”

总结:复盘不是总结,是重新校准

每一次客户案例复盘,都是把飘着的AI项目拽回地面的过程。它逼技术团队听懂业务语言里的潜台词,也逼业务方承认:AI不是万能钥匙,它只能解决被清晰定义的问题。

这5个案例里沉淀下来的17项检查项,已经放进JOTO Dify企业版v3.2的“交付健康度看板”里。AI的竞争力,从来不在参数有多大,而在组织有没有能力,一次次蹲下来,看用户到底怎么用、哪里卡住、为什么放弃。

立即咨询 JOTO

JOTO 提供覆盖AI需求诊断、Dify智能体交付、RAG知识治理到客户案例复盘的全周期企业服务,助力您把每个AI项目转化为可审计、可增长、可传承的组织能力。 联系 JOTO 获取 AI 落地咨询

立即体验 JOTO

如果你想进一步了解 JOTO,欢迎前往官网体验。

联系我们 / 预约演示

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.