引言
关于 AI 搜索的实践
2023 年:采用主流开源框架构建单体 Agent 架构,快速验证可行性; 2024 年:转向多模态全双工交互 + RAG(检索增强生成)为主流的技术栈; 2025 年:构建支持复杂推理的混合智能体体系,通过分层组件化设计、Multi-Agent 架构与 Context Engineering(上下文工程)等模块,逐步形成可支撑企业级产品交付的工程体系。
终端:基于跨端框架,支持灵活扩展答案卡片类型,实现多场景复用;集成 Markdown 增强、ASR(语音识别)、TTS(语音合成)等能力,并创新交互形式如动态筛选、流式翻页、内容折叠等。 网关与协议:包含流式通信协议,实现端到端低延迟通信;同时构建多模态全双工长连接通道,支持 Agent 与客户端双向实时交互。 服务端:采用 Multi-Agent 架构,通过统一的 Agentic 框架,实现业务逻辑编排、模型调度与工具调用;提供开放接口协议,兼容多种接入方式,支撑灵活集成。
Multi-Agent 架构:与算法团队共建面向电商场景的大模型协作框架,使 Agent 能自主规划交互流程——既能主动引导用户、输出结构化知识,又能将答案原子化、多样化呈现,摆脱传统固定意图的限制。
大模型:基于自研大模型进行业务定制,通过 Multi-Agent 架构进行编排和交互。
道:从“追求绝对正确”到“管理概率预期”
道:根本规律与价值理念,是认知的底层; 法:制度与方法体系; 术:具体操作与技术手段。
控制复杂性仍是架构设计的首要任务 稳定交付与持续演进依然是衡量工程团队成熟度的关键标尺
传统工程建立在确定性之上。系统行为遵循 $y = f(x)$ 的严格映射。输入固定,输出必须一致;行为可穷举、可验证。“Bug”是非黑即白的存在——要么正确,要么错误。 AI工程则运行于概率空间之中。智能输出是大模型、提示(prompt)、上下文与环境共同“涌现”的结果。其本质具有内在不确定性。此时,“正确性”让位于合理性、相关性与用户满意度等多维指标。
法:架构准则的延续与演化
1. 平台化思维与能力抽象的延续
从业务域实体转向AI能力组件 从状态机驱动转向Agent驱动
Agent:独立解决某类问题的智能实体。例如AI助手中商品筛选(跑马灯agent),双11清单对话页清单生成Agent等; SOP协议:统一Agent调度层以及Agent执行层调度协议。能够对Agent和tool进行编排(对应langChain框架中chain的概念); Tool:工具服务,基于主搜编排框架,做了工具的配置化接入,支持通用的MCP协议工具、同时支持本地以及远程工具调用; Memory:记忆模块,针对过去回答的结构化存储和检索能力。
2. 高可用与容错机制仍是生命线
1. 从“领域模型”到“上下文工程”
2. 设计“可控的不确定性边界”
架构策略: 用确定性的前处理(输入校验、意图识别)、后处理(结果校验、格式化)与安全保护逻辑(敏感词过滤等)包裹不确定的模型内核; 多级兜底: 当模型表现不佳时,系统必须能平滑降级(Fallback)。例如,当大模型超时或幻觉严重时,能够自动切换到基于规则的兜底策略,或者使用更小、更快的模型接管。
术:新旧武器的融合
用户信息(profile):基于用户在平台内的交互行为,结合输入内容,提取有效信息 Agentic RAG(知识检索):大模型采取「规划 - 执行 - 观察」模式,自主决策获取所需信息,包括站内知识(如行业规则、活动信息)与站外知识(如趋势、百科); Memory(记忆模块):对历史对话进行摘要,保留关键信息;同时截取历史曝光内容,通过模型筛选并总结
人工标注层:由专业评测团队对意图覆盖、逻辑连贯、用户体验打分。为此构建了建设了一套面向大模型标注和评测的标注平台,支持多种数据源,动态编排标注模板、人效看板等功能 线上AB层:通过点击率、转化率、停留时长等业务指标反哺模型迭代
小结
写到最后的话
主动理解大模型原理,建立基本技术判断力 祛魅是第一步:大模型并非万能,其能力有明确边界。要能分辨问题出在提示词(prompt)、上下文长度、数据质量,还是模型本身的认知局限,避免将工程问题简单归因于“AI不行”。 系统目标从“可用性”升级为“合理性与真实性” “流畅”不等于“可信”。一个看似通顺却事实错误的回答,其危害远大于响应稍慢但准确的结果。AI系统的终极验收标准,应是真实、可靠、可解释。 MVP要快,但关键能力需有技术纵深与演进路线 小步快跑验证闭环固然重要,但核心模块(如知识检索、推理链、安全过滤)必须预留技术纵深。在“先跑起来”和“可持续演进”之间,找到动态平衡点。 将模型的不确定性视为前提约束,用工程手段内建鲁棒性 不要把模型当作稳定服务调用,而要预设其输出可能波动、偏移甚至失效。通过校验、回退、多模型投票、人工兜底等机制,把不确定性“封装”在可控边界内。 架构选型要面向AI原生需求,谨慎复用传统平台 Agent、工具调用、动态路由、记忆管理等新范式,呼唤更轻量、灵活、可观测的基础设施。盲目套用传统微服务或单体架构,往往成为后续演进的枷锁。在“复用”与“新建”之间,需以AI工作流的本质需求为准绳。
