降低RAG推理成本6倍的关键:让LLM只处理真正模糊的案例
在高风险、受监管场景中,全量调用LLM处理RAG分类任务会导致审计失效、成本飙升与模型漂移。级联架构通过确定性前置过滤、精准检索增强和非对称风险提示词,将仅10%–15%模糊案例交由LLM,显著提升可解释性、一致性与合规性。

大多数构建 检索增强生成 (RAG)系统以支持高风险分类任务的团队,都做出了相同的基础架构选择:将每个模糊案例直接路由至语言模型,并依赖所检索到的上下文来解决该问题。这种做法在演示中效果良好;但一旦系统需经受审计、监管机构或合规官员的审查——例如被要求解释六个月前某项具体决策的缘由——该方案便会彻底失效。
过去一年,我一直在受监管的企业环境中构建基于RAG的分类系统,在此类环境中,“错误答案”的代价远不止是一次糟糕的聊天机器人回复。一项决策必须能在模型生成之后长期经受住审查。这种环境迫使我们采用一种与当前多数人工智能工程内容所假定的设计哲学截然不同的思路。
当您无法在所有事情上都接受概率性结果时,以下便是随之发生的变化,以及级联架构(cascade architecture)如何解决这些问题。
全语言模型流水线的隐性成本
将所有内容均通过 大语言模型 (LLM)路由的吸引力显而易见:组件更少、迭代更快、模型可处理未预见到的边缘情况。但问题会在后期显现,集中于三个层面。
第一,可审计性。“模型依据所检索上下文作出决定”并非可接受的答案。您需要一条人类无需重新运行推理并寄望获得相同输出即可重建的决策路径。
第二,规模化下的成本。若您的系统每日处理数万个案例,且每个案例均调用一次LLM并附带若干份检索文档作为上下文,则您的推理费用与延迟均会随处理量线性增长,而基于规则的逻辑则不会如此。
第三,也是讨论最少的一点:模型在简单案例上的漂移(model drift)。大语言模型在需细致判断的场景中表现出色;但在本应具有确定性答案的案例上,其表现却存在难以察觉的不一致性。针对明确结构化匹配已知标准的情形,绝不应依赖语言模型的“心情”。
级联方法
解决方案:停止将LLM视作一线处理单元,转而将其视为升级路径。实践中,这意味着采用三阶段流水线。
第一阶段为确定性阶段。精确匹配、结构化字段比对,以及任何具备清晰规则的情形,均在此阶段解决,完全无需调用模型。该阶段应能处理大部分流量,通常超过总量一半(具体比例取决于数据质量),且每一项决策均可完全解释,因其本质是查表而非推理。
第二阶段是检索真正发挥价值之处。对于通过第一阶段(此处‘通过’指未被明确解决)的案例,您需构建一个检索层,以提取与该模糊性相关的特定证据:类似案例的先前审阅者决策、解释表面冲突的上下文文档,或阐明边缘情形的历史先例。在此阶段,检索步骤的重要性远超生成步骤。若您检索到错误的上下文,即使世上最优秀的语言模型也会产生一个自信、论证充分却错误的答案。
第三阶段是 LLM调用,且仅应接收第一与第二阶段均无法解决的剩余案例。这是多数团队在设计初版系统时常忽略的部分,却是控制成本与提升质量最关键的杠杆。在我参与的一个系统中,仅将真正模糊的10%至15%案例路由至LLM,相较于全LLM基线方案,推理成本降低了约6倍,同时将确定性占主导部分的决策一致性提升至近乎完美。
面向非对称风险设计提示词
一旦案例进入LLM阶段,多数团队默认采用中性提示词:“评估此案例是否应获批准或标记。”该框架对于高风险分类而言是错误的,因为两类错误的成本并不对称。遗漏真正需要关注的事项,可能在下游造成实际损害;而错误地标记原本无问题的事项,仅会耗费审阅者时间并导致延迟。这两种后果极少同等严重,然而中性提示词却要求模型将二者视作等同。
非对称风险提示词将该权衡明确告知模型,而非任其猜测您的风险承受能力。具体而言,这意味着指示模型将不确定性视为升级理由而非清除理由,提供两类错误的校准示例并明确列出其后果,并要求模型在给出分类结果的同时提供置信度分数,而非仅输出二元答案。该置信度分数即成为您的第二个级联节点:任何低于特定阈值的案例均须交由人工审阅者处理,不得自动判定,无论模型给出何种分类结果。
这听起来像是一个微小的提示工程细节;实际上,它却决定了系统究竟是减轻审阅者工作负担,还是在看似正常运转的同时悄然增加风险。
如何恰当地评估此类系统
标准RAG评估指标并非为此类用例而设计,若未经调整即直接使用,将使您产生虚假的信心。以下几项调整至关重要。
检索质量需与最终分类准确率分开衡量。一个系统可能拥有极佳的检索排序得分,但若生成步骤对证据权重分配不当,仍可能做出错误的最终决策。这两项指标须独立追踪。
您的评估集需刻意对进入第三阶段的案例进行过采样,因为这正是系统判断力真正接受检验之处。若您的评估集仅镜像生产环境中的分布,则将主要由级联架构已能良好处理的确定性案例构成,从而完全忽视那些恰恰最为关键的失败情形。
LLM作为评判员(judge)的评估方式适用于该领域,但前提是评判员提示词必须编码与生产环境提示词相同的非对称风险框架。若评判员将两类错误同等对待,则在您调优系统时,将系统性地偏向错误的权衡取舍。
最后,需构建一个从确认结果反向反馈至检索语料库的闭环机制。当人工审阅者推翻模型决策时,该案例及其正确解决方案应成为未来类似案例可检索的上下文。若缺乏此机制,您的系统对模糊案例的处理能力将永无改进,只会以相同速率持续犯下同类错误。
更广泛的启示
本能地为每一项决策选用最强大模型的做法可以理解;但在错误答案会产生真实后果的领域中,更有价值的工程工作在于决定哪些决策绝不能交由模型处理。级联架构并非对LLM局限性的权宜之计;而是当您真正不得不向一位职责即为找出您逻辑漏洞的人士辩护自身决策时,一个成熟的RAG系统应有的形态。
若您正为任何受监管或高风险领域构建人工智能系统,则在编写第一条提示词之前,值得提出的问题并非“我该如何让模型妥善处理此事”,而是“此项决策中,哪些部分本就不该由模型承担?”
维尼特·维贾伊(Vineet Vijay)是一名首席人工智能与机器学习工程师。
欢迎加入 VentureBeat 社区!
我们的客座投稿计划旨在邀请技术专家分享洞见,并就人工智能、数据基础设施、网络安全及其他塑造企业未来前沿技术提供中立、无利益关联的深度剖析。
阅读更多 来自我们的客座投稿计划——并查看我们的 投稿指南 如果您有兴趣撰写并投稿自己的文章!
JOTO 企业落地观察
- 对企业部署而言,该文揭示:在金融、医疗等强监管场景中,强制所有案例过LLM并非工程捷径,而是审计风险源;级联架构将50%以上流量拦截于规则层,使系统具备可追溯决策路径与线性可控成本,直接支撑合规验收。
- 对智能体工程而言,级联设计重构了智能体职责边界——LLM不再是默认执行者,而是‘升级通道’;这要求工程师显式建模确定性逻辑(如字段匹配)、模糊性度量(如检索证据置信度)与人工兜底阈值,推动智能体从黑盒响应转向分层可信协作。
- 对AI安全治理而言,非对称风险提示词+置信度阈值闭环机制,首次将‘错误代价不均等’嵌入RAG推理链:它使模型主动识别不确定性并触发人工复核,而非掩盖风险;该机制可直接纳入企业AI治理框架,作为高风险分类任务的强制性安全控制点。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


