谷歌发布的一篇新研究论文发现,前沿的语言学习模型(LLM)能够编码95%至98%的测试事实,但在回答查询时却无法直接回忆起其中26%至34%的事实。部分原因是,当问题颠倒了训练过程中事实出现的主语/宾语实体顺序时,回忆就会变得更加困难。

参数信息

参数信息本质上是语言学习模型(LLM)在训练过程中编码的信息。这些信息来源于网页、歌词、书籍、说明书、代码以及LLM接受训练时所使用的所有其他资源。

研究人员试图解答的问题是:为什么语言学习模型(LLM)无法回忆起一些它们接受过训练的信息?此前人们认为,可能是因为语言学习模型接受的训练信息不足,但研究人员发现,对于前沿领域的语言学习模型而言,情况并非总是如此。

研究人员解释说,编码已经饱和,这意味着回答问题所需的信息通常已经在 LLM 中了。

他们写道:

“编码已饱和;回忆尚未饱和。对于 Gemini-3-Pro 和 GPT-5 等前沿语言学习模型而言,事实编码已接近饱和,95-98% 的事实已被编码。然而,这些模型无法直接回忆起 26-34% 的事实,即使经过思考,也无法回忆起 11-12% 的事实。”

因此,召回失败占 GPT-5.2 错误率的 70% 以上,在更强大的模型中占比更大,这表明召回确实是一个瓶颈。

这意味着瓶颈不在于前沿法学硕士缺乏足够的事实和信息,而在于如何获取这些信息。

主体和宾语实体

这项研究的一个有趣发现是,学习记忆模型(LLM)无法回忆起特定事实的原因之一是,与该事实相关的主体和客体是按特定顺序学习的。当向LLM提出一个顺序颠倒的查询时,由于学习顺序不同,LLM更难回忆起该事实。

该研究论文解释了主体和客体实体分别是什么:

“主体和客体的角色由提取事实的源文本(例如,维基百科文档)决定:主体是文本中首先出现的实体,客体随后出现。”

然后,它通过颠倒主语和宾语来解释其含义:

“答案是宾语的问题称为直接问句,答案是主语的问题称为反向问句。”

谷歌的解释器使用以下示例来说明主语/宾语实体对:

“Oasis乐队的首场演出是在Boardwalk俱乐部。”

在上面的例子中,“Oasis”是主语实体,“木板路俱乐部”是宾语实体。

因此,在“Oasis”和“The Boardwalk club”的例子中,当这些词对总是以“Oasis”在前出现时,LLM 会遇到无法回忆起查询中主语/宾语颠倒的事实的情况。

现在,我们又有了另一个有趣的发现。LLM能够识别出多项选择题中主语和宾语顺序颠倒的情况。

研究人员并未解释为什么LLM能够识别多项选择题中的答案。他们只是以此证明答案已被编码在LLM中,并且可以被识别。

问题的措辞对回忆的影响微乎其微。

研究人员测试了重新措辞问题是否会影响前沿逻辑学习模型回忆事实的能力。他们发现,重新措辞对模型回忆事实的能力没有显著影响。真正起作用的是颠倒主语/宾语的顺序。

长尾事实难以回忆

另一个有趣的发现是,前沿学习者在处理长尾事实(研究人员称之为罕见事实)时遇到了困难。编码常见事实和罕见事实之间的差距很小,但在回忆方面差距较大。无法回忆罕见事实通常并非因为学习者没有掌握这些信息,而是他们在回忆阶段遇到了瓶颈。

经过验证的解决方案:多加思考

研究人员测试了思维对回忆事实的作用,发现低层次思维模型(LLM)能够回忆起之前无法直接回忆起的40%至65%的已编码事实。然而,思维作用的缺点在于计算成本较高。研究人员还指出,何时触发思维作用也是一个需要考虑的问题。

扩大LLM培训规模并非解决方案

最后,研究人员指出,扩展前沿 LLM 并不能解决召回问题。

SEO与主语/宾语实体对

关于主语和宾语实体对顺序的直觉是,按照查询中最常见的顺序排列它们可能是有益的。这并非研究论文中的发现,也未经证实。但直觉上,按照最常见的顺序配对排列主语实体和宾语实体或许是合理的。

虽然该研究论文并未指出这些实体的常见排序将帮助LLM选择特定的网页,但从SEO的角度来看,这是一个合理的假设。

这篇研究论文的标题是《空书架还是丢失的钥匙?回忆是参数化事实性的瓶颈》(PDF)。