JOTO
联系我们
← 资讯中心
技术架构

Agent 的上限看模型,底线看什么?

2026 年 7 月 28 日 · JOTO 团队 · 11 分钟阅读

文章指出 Agent 的能力上限取决于大模型,而其可靠性底线取决于 Web Search 服务的质量。通过三轮实测对比豆包搜索与 Tavily,验证了信源分级能力对 Agent 输出准确性的影响:豆包搜索基于权威信源分级(如公司公告为一级),能有效识别错误信息并标注‘无法核实’;Tavily 虽检索全面但缺乏信源质量管控,易被低质内容误导。

Agent 的上限看模型,底线看什么?

Agent 的可靠性底线在 Web Search

AI 应用技术栈金字塔中,最吃劲的一块是中间那个蓝色小方块 Web Search。对于时效性信息,AI 给出的每个答案、每份研报、每条投资逻辑,都得打它这儿过一遍。它无处不在,你一直在用;但它远比大家想象的脆弱。

脆弱在哪?看左边那列原料:新闻站、公司公告、年报,还混着博客、论坛和来路不明的截图、营销号。真真假假、新旧不一,全都灌入这一块。

要说找得到、读得全,现在确实有人做得挺漂亮。可有个问题始终没人答:搜回来的这一堆,到底哪条能信?通用搜索眼里,网页不分高低:一份公司公告和一篇公众号,分量差不多。更麻烦的是,这堆原料还在加速变质:如今互联网上充斥着 AI 生成的垃圾信息和洗稿文,通用搜索稍不留神就会把 Agent 带进沟里。

搜索对象已从人变为 Agent

过去搜索服务的是人:敲几个词,挨个挨个搜索结果,自己判断真伪。AI 搜索往前走一步,直接给人一个综合答案。可 Agent 接到的压根不是单个问题:「研究一家公司」「核查一篇文章」这种活,它得自己拆问题、把问题改写成若干个关键词去查,再一轮轮搜索、筛选信息源、再整合。

最近注意到豆包搜索,就是因为火山引擎把它定位成「为 Agent 构建的信息获取引擎」。用人话说:它不仅是个搜索引擎,还是个信息质检员。它搜回来的每条结果,都标好了发布时间和确定信息源,甚至还把信源分了等级:权威公告是一档,主流媒体是一档,XX 自媒体又是一档。

信源分级是事实核查的核心

信源四级分层如下:

  • 一级信源 · 结论锚点:公司公告、监管披露、政府统计、权威学术期刊、国际组织数据和顶级机构正式报告。
  • 二级信源 · 专业补充:行业协会、知名咨询机构、主流媒体与专业出版物。核心数字仍要追到原始材料。
  • 三级信源 · 线索池:公众号、博客、论坛和社交媒体。适合发现争议,不能单独支撑结论。
  • 四级信源 · 禁止进入底稿:匿名爆料、无法追溯的「内部消息」、强广告内容和无证据判断。

三轮实测验证信源分级价值

为了看清不同搜索源对 Agent 的影响,在同一条指令、同一家公司的前提下,设计了三组对比实验:

  • 第一遍 · 不挂任何搜索:让模型纯凭自身记忆盲答。
  • 第二遍 · 挂载 Tavily:一款通用的 Agent 聚合搜索。
  • 第三遍 · 挂载豆包搜索:走火山引擎的搜索生态。

以「寒武纪」为例,图里最能说明问题的是「字节占营收比」这条:

  • 不挂搜索:模型直接两眼一抹黑,给不出数据。
  • 挂 Tavily:极其自信地给出了错误答案:「字节是第一大客户、2024 年占近 80%」。它塞给 Agent 的全是自媒体的猜测文和转载稿,完全忽略了公司官方年报里压根没具名客户的事实。
  • 挂豆包搜索:结果完全不同。因为有「官方年报」作为一级信息源,AI 核对出官方未具名客户,第一大客户其实约占 26%。

热点压力测试:世界杯决赛夜

以 7 月 19 日世界杯决赛(西班牙对阵阿根廷)为热点事件进行压力测试:

  • 挂 Tavily:答核心事实确实快——1 比 0 加时、托雷斯进球、大都会(MetLife)球场。可一到争议话题就露馅:前脚刚说金球奖是罗德里,后脚就把「赛事最佳」安给了梅西,左右互搏;甚至还把「FIFA 拒绝重赛请愿」写成了板上钉钉的定论,但其实官方压根还没理这茬。
  • 挂豆包搜索:比分、进球分钟、恩佐的红牌、80663 名观众、裁判名单……每条数据都挂着具体时点和一手出处。它像个判官一样把坊间传闻逐条过了堂:「决赛延期」被证伪、「梅西拿金靴」不实(实际是姆巴佩)、「裁判受贿」尚无确凿证据,而「6 万多球迷请愿重赛」确有其事。最打动我的是一个细节:在扒不到银球、铜球奖的一手信源时,Agent 老老实实地在底稿里标了一句「无法核实,建议不写」。

给 Agent 喂对数据才是关键

虽然 Tavily 找得其实也又快又全,连巨潮资讯网的年报原文都能扒出来。但是对于现在的 AI 搜索来说,它的使命就是给 Agent 这个精炼机提供高纯度的矿石。如今各家的差距早已不在于「能不能搜到」,而在于把海量信息捞回来之后,搜索能不能提前给信源排好座次,直接告诉你到底该信谁。

在 AI 开口说话之前,逼着它先把事实找对,把出处留下,把不知道的盲区老实交代。让搜索提供高纯度的矿石,把盲目信任变成有据可查,这才是 AI 搜索该有的样子。

JOTO 企业落地观察

  • 对企业部署意味着:Web Search 不再是“能搜到就行”的管道,而是必须嵌入信源可信度评估的决策前置环节;选型时需将信源分级能力列为硬性指标,而非仅关注召回率或响应速度。
  • 这类系统的取舍在于:是否接受为信源质量管控付出额外延迟与成本。豆包搜索的分级机制本质是牺牲部分泛化检索广度,换取关键事实链的可追溯性,这对金融、法律等强合规场景尤为关键。
  • 对 RAG 知识工程而言,信源分级能力可直接复用于知识片段置信度标注,使 RAG 输出天然携带来源权重,避免传统 RAG 中“所有 chunk 等权参与”导致的噪声放大问题。
  • AI 安全治理需将搜索服务纳入供应链风险清单——当 Agent 的推理依据来自外部搜索,其输出可靠性便与该搜索服务的信源治理策略强耦合,不可视为黑盒调用。
想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
联系我们

开启企业级 AI 落地

留下你的行业、部门和当前痛点,我们会在 1 个工作日内与你联系,帮你判断适合先做什么、需要准备哪些数据、适合什么平台。

微信咨询
扫码添加,一对一沟通
JOTO 微信咨询二维码
致电我们
+86 (021) 6566 1628
发送邮件
jotoai@jototech.cn

填写需求单

收到你的信息后,我们将在 1 个工作日内与你取得联系。