当大模型出现幻觉、给出错误回答的时候,几乎所有工程团队的第一反应都是:模型缺了这部分知识
当大模型出现幻觉、给出错误回答的时候,几乎所有工程团队的第一反应都是:模型缺了这部分知识。 行业通用的药方也非常固定:继续扩大训练数据、堆大模型参数,或者外挂一套检索增强生成系统。 但如果知识从一开始就躺在模型的脑子里呢? 如果它答错的那些事实,有接近九成以上其实早已被塞进了参数深处? 如果它只是在被提问的那一瞬间,找不到打开记忆仓库的钥匙? 2026 年,来自 Google Research 与以色列理工学院 Technion 的研究团队,用一项严密的研究打破了这种传统共识。 他们在 arXiv 上发表的论文编号是 2602.14080。 研究团队搭建了一个名为 WikiProfile 的评测基准,从中抽取了 2150 个维基百科事实,在 13 个主流大模型上跑了超过 400 万次响应测试。 结果展现了一个极度反常识的现实。 像 GPT-5 和 Gemini 3 这类前沿模型,对测试事实的参数编码率已经达到了 95% 到 98%。 也就是说,参数仓库里的货架几乎是满的。 但在没有给予额外思考时间的直接问答中,这些模型却有 26% 到 34% 的已存事实根本无法直接提取。 研究者把这种现象拆解为两台截然不同的机器:空货架与丢钥匙。 空货架代表模型在预训练时压根没见过这条数据,仓库里本来就没有。 丢钥匙代表模型早已完成了精确记忆,只要给它当年的原文上文,它能一字不差地续写出来。 但只要提问换了一种句式、或者从反向角度发问,提取通道就会当场中断。 很多团队以为只要把模型做大,这个问题就会自然消失。 实验数据给出了完全相反的答案。 当研究者把 Gemma 3 模型从 10 亿参数一路扩展到 270 亿参数时,空货架的比例确实从 85% 断崖式下跌到了 23%。 但丢钥匙的比例却一路飙升,直接冲到了 40% 的峰值。 无脑堆大参数规模,解决的是仓库的仓储容量,解决不了取货通道的堵塞。 模型吞下的记忆越多,被困在参数深处的沉睡知识反而越庞大。 真正能把这批失落记忆唤醒的,是推理期的思考时间。 在这项实验中,只要允许模型在输出最终答案前调用推理算力展开思考,就能成功找回 40% 到 65% 原本直接提取失败的事实。 这就像人类心理学上的舌尖现象。 一个熟悉的名字明明就在嘴边,直接逼你立刻说出来,大脑往往一片空白。 但只要给你几秒钟去回想相关的场景、地点和关联人物,原本断掉的线索就会重新咬合在一起。 论文里举了一个具体的案例:英国摇滚乐队 Oasis 当年是在曼彻斯特的 Boardwalk 俱乐部完成了首场演出。 直接提问模型 Oasis 在哪里办了第一场演出,模型当场失忆。 但当模型被允许在推理期生成中间思维链,先联想到乐队早期在曼彻斯特的地下音乐场景,记忆的闸门被瞬间推开,锁在参数里的正确答案随之浮现。 大模型的准确率瓶颈,早已悄然发生了位移。 它不再单纯取决于预训练阶段塞进了多少海量语料。 更关键的齿轮,在于推理阶段有没有给模型留出构建联想路径的计算空间。 如果只有庞大的参数仓库,却没有激活记忆的思考机制,扩容只是在制造一个更巨大的知识迷宫。 真正决定模型智力上限的,从来不只看它背下了多少信息。 关键在于现实的提问偏离了课本的标准语境时,它能不能用思考为自己重新搭出一座找到真相的桥。
引用 / CITATIONS
No citations exported.
导出 / EXPORT
订阅 · SUBSCRIBE
新的深度解读发布时,会在每周简报里送到你邮箱。