JOTO
Contact us
← AI 智库
大语言模型

GPT-5与Gemini-3并非‘不知道’,而是‘想不起来’:新研究揭示大模型事实性瓶颈在于回忆而非知识缺失

2026 年 9 月 1 日

Google与Technion研究发现,GPT-5、Gemini-3等前沿模型对测试事实的编码率达95–98%,但26–34%已编码事实无法直接回忆;推理时计算可恢复40–65%此类失败,提示企业应转向‘回忆优化’而非盲目扩模或堆RAG。

GPT-5, Gemini-3 recall lost facts via reasoning | VentureBeat

当大语言模型(LLM)产生幻觉时,开发者通常假设该模型缺乏所需的事实。工程团队将此类错误诊断为知识缺失。标准应对措施是增大模型规模、扩充训练数据,或构建复杂的检索架构。

A 一项新研究 由Google Research与Technion的研究人员开展,证明相关知识往往并非缺失。模型已以参数化方式编码了该信息,但在生成过程中未能将其调取出来。 

他们的实验表明,GPT-5和Gemini-3等前沿模型对所测试事实的编码率达95–98%。这表明,在许多情况下,事实准确性的主要瓶颈在于回忆(recall),而非编码(encoding)。 

通过理解如何借助推理时计算(inference-time computation)解锁已有知识,工程团队可在不必然依赖更大模型或外部数据库的前提下,构建更可靠的应用程序。

知识画像(Knowledge profiling):衡量模型实际掌握的知识

为刻画存储与检索之间的这一差距,研究人员提出将评估重点从问题级准确率转向事实级画像(fact-level profiling)。该方法不再简单判定大语言模型对孤立提示的回答是否正确,而是针对单个底层事实,在多种条件下进行测试,评估该事实是否被存储于模型参数中、能否从不同角度与不同措辞中被查询,以及检索它所需的计算开销。

该框架区分了某事实是否被参数化地“编码”(encoded),以及是否被真正“知晓”(known)。一个模型 编码 某事实,是指当其被原始训练语境提示时,能准确复现该事实;一个模型 知晓 某事实,则指其能在各种措辞与提问方向下,稳定地回答有关该事实的问题。

研究人员写道:“在准确率指标下,编码失败与回忆失败无法区分,但二者暗示着不同的局限性与解决方案。编码失败需通过预训练干预来解决,例如扩大模型规模或提升数据覆盖范围;而回忆失败则提示需采用后训练干预措施,这类措施往往能改善模型对其已编码内容的利用方式。”

论文以一个示例事实说明此点:Oasis乐队首次演出是在Boardwalk俱乐部举行。基于模型处理该信息的方式,该研究将知识划分为五种不同画像:

Knowledge profiing

知识画像(来源:Google)

  • 直接回忆(Direct recall): 模型已编码该事实,并能无需额外推理计算即直接调取该事实以回答直截了当的问题。

  • 编码失败(空置书架,empty shelves): 模型既未编码该事实,也不知晓该事实。它既无法完成一段关于Oasis早期经历的维基百科式句子,也无法回答有关该事件的问题。这表明需要更多预训练数据或更大的模型容量。

  • 回忆失败(遗失钥匙,lost keys): 模型已编码该事实,却无法调取它。它能无缝补全关于Oasis原始训练文本,但在被问及‘Oasis首次演出地点在哪里?’时即便获得充分思考时间仍会失败。

  • 经思考后的回忆(Recall with thinking): 该事实已被编码,但无法通过直接生成访问;仅当模型运用推理时计算(如思维链,Chain-of-Thought)弥合该差距时,才能成功回忆。研究人员将此机制称为回忆促进(recall facilitation)。模型可能最初无法回答直接问题;但通过生成关于该乐队在曼彻斯特早期历史的中间性思考,它在结构上自我提示,从而定位并回忆出被锁定的答案。

  • 无编码下的推理(Inference without encoding): 模型从未显式编码Oasis这一事实;相反,它通过合理猜测或基于其他已知编码事实进行推理,成功回答了该问题。例如,它可能通过串联若干独立数据点推断出答案,如‘Oasis成立于曼彻斯特’、‘Boardwalk是当地一家著名的90年代音乐俱乐部’,以及‘Boardwalk曾主办新兴乐队的早期演出’。

规模扩张的错觉、长尾现象与舌尖效应式恢复(Scaling illusions, long-tails, and tip-of-the-tongue recoveries)

研究人员在超过400万条响应上评估了13个大语言模型。他们使用WikiProfile基准测试集,该集合包含从维基百科提取的2150个事实,并对每个事实测试了从精确语境补全到多项选择验证等多种格式。

对于GPT-5和Gemini-3等前沿模型,编码率已接近饱和:这些模型成功编码了所测事实的95–98%。然而,它们在不借助思考的情况下,仍无法直接回忆其中26–34%的已编码事实。 

Recall with thinking

经思考后的回忆(来源:Google)

推理时思考作为一种关键的恢复机制发挥作用。为模型提供额外计算资源,可成功检索出模型最初无法直接回忆的已编码事实中的40–65%。研究人员将此过程类比为人类的‘舌尖效应’(tip-of-the-tongue state):通过有意识的努力(例如在脑海中回溯相关语境),最终帮助记起该信息。

单纯扩大模型规模并不能自动解决这一差距。事实上,企业常误将回忆失败归因于模型规模不足,进而试图通过微调更大规模的内部模型加以解决——这是一种代价高昂的架构误判。

Google研究科学家Nitay Calderon向VentureBeat表示:“当事实输出错误时,惯常做法是扩大规模,即训练更大模型或添加更多数据。这两种方式均成本高昂;而若事实本就已被编码,二者均无济于事。”

例如,研究人员发现,将Gemma3模型参数量从10亿扩展至270亿,大幅填补了‘空置书架’,使编码失败率从85%降至23%;但与此同时,回忆失败占比却上升,且在不借助思考的情况下达到峰值40%。

这表明,扩大规模主要解决的是存储问题,而非访问问题。随着模型记忆的事实数量急剧增加,更大规模的知识池反而陷入‘已编码但不可访问’的状态。模型错误的主要来源,也从数据缺失转向回忆失败。

研究人员写道:“我们的发现表明,回忆能力与事实被习得的条件紧密耦合;当查询偏离训练时模式时,回忆能力即随之下降。”用户提问的方式,直接决定了模型能否解锁所存储的答案。

例如,实验显示,冷门事实的编码率与热门事实相近;但研究人员却发现,前沿模型在长尾事实与高度热门事实之间存在巨大回忆差距,该差距超过25%。

Distribution of knowlede profiles on different LLMs

不同大语言模型上的知识画像分布(来源:Google)

类似地,模型难以回答反向问题(即要求给出主语而非宾语)。例如,模型可能轻易回答‘Oasis乐队首次演出地点是Boardwalk俱乐部’,却无法回答‘哪家乐队在Boardwalk俱乐部举行了首次演出?’;与此同时,同一模型在多项选择题形式下却能显示出它知道该问题的正确答案。

“尽管这些失败通常被解读为记忆能力或双向编码的局限性,但我们的结果表明了另一种图景:稀有事实往往已被编码,但却无法访问;而反向事实即使无法生成,也可能被识别出来。”研究人员写道,“这将两种现象都重新定义为回忆失败,而非‘知识缺失’。”

思考的投资回报率及面向开发者的实用建议

前沿模型的高编码率要求开发者转变对事实性(factuality)和流水线架构(pipeline architecture)的处理方式。

不要将每个事实性错误都当作检索问题来处理: 企业面对幻觉(hallucinations)时的默认反应往往是部署检索增强生成(Retrieval-Augmented Generation, RAG)、扩大向量数据库规模,或摄入更多领域文档。尽管RAG对于新鲜数据或内部数据而言是正确选择,但将其作为解决幻觉的万能方案,却会为模型已通过参数化记忆(parametric memory)牢固掌握的事实额外增加延迟与成本。

卡尔德隆(Calderon)表示:“团队用RAG解决的大量事实,模型本就能凭记忆作答,因此你白白支付了额外延迟与每次调用的成本。如果某个事实确实缺失,RAG可能是正确的修复手段;但如果该事实已被编码,而模型只是无法回忆起来,那么RAG与扩大模型规模只会让真实问题之上再叠加成本。”

有选择地在推理时启用推理(thinking): 推理恢复了模型未能直接回忆起的40–65%已编码事实。然而,由于实际上仅有10–20%的事实真正需要推理,全局启用该功能将浪费计算预算。挑战在于动态路由查询,因为模型缺乏足够的自我意识,无法可靠诊断自身即将失败的情形。

卡尔德隆表示:“为了高效利用计算资源,模型必须提前感知到一个直白回答即将失败,从而能在作答前升级处理方式。这种自我意识本身即是一项技能,而当前模型尚无法稳定胜任。”这一元认知瓶颈(metacognitive bottleneck)正是谷歌研究人员正在开发如faithful uncertainty等框架的原因——旨在使模型能够准确评估自身置信度,并触发更深入的推理,而非产生幻觉。

部署‘先生成、后验证’(generate-then-verify)流水线: 由于模型在识别事实(验证)方面优于从零生成事实,开发者可构建一种架构循环:模型首先生成响应,随后被提示对其自身主张进行明确反思与验证。“由于识别正确答案比生成答案更容易,对模型自身输出执行一次验证步骤,可捕捉纯生成过程所遗漏的错误,并在事实上带来一定提升。”卡尔德隆表示。

测试语义访问能力,而不仅是基准准确率: 标准准确率指标掩盖了模型底层能力。评估集应针对同一底层事实,采用不同措辞、不同上下文及不同方向进行探测,以真正厘清模型‘知道什么’与‘能可靠访问什么’之间的区别。

利用查询重构(query reformulation)与重试机制: 由于回忆高度依赖上下文,查询的表述方式决定了成败。改变提示(prompt)结构、生成相关中间上下文,或提示模型在作答前先生成推理链,均为合法的可靠性机制,可揭示直白提示所遗漏的信息。

局限性与实践启示

WikiProfile基准测试依赖于百科全书式的维基百科事实。这些发现可能无法完全泛化至专有或高度专业化的企业领域。模型存储与回忆某一特定内部公司指标的能力,可能与其处理公开百科全书数据的方式截然不同。

在WikiProfile套件上对前沿模型进行完整画像(profiling)约需500美元。开发者可通过省略多项选择题变体,或每道题减少响应样本数量,显著降低此项成本。 

团队可在 Hugging Face 上获取WikiProfile基准测试,以评估自身系统。由于该基准测试包含了构建它所使用的全部精确提示,企业数据工程团队可在自己的内部语料库上复现该流水线,从而诊断其定制化智能体(bespoke agents)所面临的问题究竟是数据缺失,还是检索密钥(missing keys)缺失。不过,当脱离百科全书式数据时,团队应合理管理预期。

卡尔德隆表示:“该流水线设计为可应用于新语料库,且我们提供了所有使用过的提示。唯一需注意的是:在维基百科上,问题主要出在回忆环节;而领域特定事实则可能确实未被模型编码。”

最终,这种向知识使用层面的转向,使企业AI技术栈的竞争环境趋于公平。“对于不从头构建模型的公司而言,这是个好消息,”卡尔德隆表示,“预训练成本极高,绝大多数公司难以企及;但如今真正关键的杠杆并非如此:后训练(post-training)仅需少量数据与极少步骤即可奏效,而推理时工具(如推理、验证步骤与检索)已是大多数团队正在使用的手段。”

本文已更新,纳入了谷歌方面的评论。

JOTO 企业落地观察

  • 对企业部署而言,该研究明确警示:将幻觉默认归因为知识缺失而仓促引入RAG或升级模型规模,可能造成显著冗余成本——当事实已被参数化编码却无法访问时,RAG仅增加延迟与开销,而非提升准确性。
  • 对智能体工程而言,‘思考即恢复’机制(如CoT触发回忆)成为关键设计杠杆;但需避免全局启用推理,而应构建动态路由能力——当前模型缺乏稳定元认知,因此需借助faithful uncertainty等框架实现失败预判与计算资源精准调度。
  • 对AI安全治理而言,‘舌尖效应式恢复’揭示幻觉本质常是访问失效而非内容错误,这意味着传统基于输出验证的安全护栏(如后处理过滤)可能无效;更有效路径是前置干预——通过查询重构、生成-验证双阶段流水线,在事实暴露前完成可信度校验。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.