---
id: "mb-20260901-8e9eb4"
kind: "deep"
title: "当大模型出现幻觉、给出错误回答的时候，几乎所有工程团队的第一反应都是：模型缺了这部分知识"
topic: "当大模型出现幻觉、给出错误回答的时候，几乎所有工程团队的第一反应都是：模型缺了这部分知识"
source_type: "generated"
status: "published"
generated_at: "2026-09-01 21:17:25"
frame_type: ["知识存取不对称与推理期联想唤醒机制（空货架 vs", "机制"]
legal_anchor_count: 0
transcript_citation_count: 0
---

# 当大模型出现幻觉、给出错误回答的时候，几乎所有工程团队的第一反应都是：模型缺了这部分知识

当大模型出现幻觉、给出错误回答的时候，几乎所有工程团队的第一反应都是：模型缺了这部分知识。
行业通用的药方也非常固定：继续扩大训练数据、堆大模型参数，或者外挂一套检索增强生成系统。
但如果知识从一开始就躺在模型的脑子里呢？
如果它答错的那些事实，有接近九成以上其实早已被塞进了参数深处？
如果它只是在被提问的那一瞬间，找不到打开记忆仓库的钥匙？
2026 年，来自 Google Research 与以色列理工学院 Technion 的研究团队，用一项严密的研究打破了这种传统共识。
他们在 arXiv 上发表的论文编号是 2602.14080。
研究团队搭建了一个名为 WikiProfile 的评测基准，从中抽取了 2150 个维基百科事实，在 13 个主流大模型上跑了超过 400 万次响应测试。
结果展现了一个极度反常识的现实。
像 GPT-5 和 Gemini 3 这类前沿模型，对测试事实的参数编码率已经达到了 95% 到 98%。
也就是说，参数仓库里的货架几乎是满的。
但在没有给予额外思考时间的直接问答中，这些模型却有 26% 到 34% 的已存事实根本无法直接提取。
研究者把这种现象拆解为两台截然不同的机器：空货架与丢钥匙。
空货架代表模型在预训练时压根没见过这条数据，仓库里本来就没有。
丢钥匙代表模型早已完成了精确记忆，只要给它当年的原文上文，它能一字不差地续写出来。
但只要提问换了一种句式、或者从反向角度发问，提取通道就会当场中断。
很多团队以为只要把模型做大，这个问题就会自然消失。
实验数据给出了完全相反的答案。
当研究者把 Gemma 3 模型从 10 亿参数一路扩展到 270 亿参数时，空货架的比例确实从 85% 断崖式下跌到了 23%。
但丢钥匙的比例却一路飙升，直接冲到了 40% 的峰值。
无脑堆大参数规模，解决的是仓库的仓储容量，解决不了取货通道的堵塞。
模型吞下的记忆越多，被困在参数深处的沉睡知识反而越庞大。
真正能把这批失落记忆唤醒的，是推理期的思考时间。
在这项实验中，只要允许模型在输出最终答案前调用推理算力展开思考，就能成功找回 40% 到 65% 原本直接提取失败的事实。
这就像人类心理学上的舌尖现象。
一个熟悉的名字明明就在嘴边，直接逼你立刻说出来，大脑往往一片空白。
但只要给你几秒钟去回想相关的场景、地点和关联人物，原本断掉的线索就会重新咬合在一起。
论文里举了一个具体的案例：英国摇滚乐队 Oasis 当年是在曼彻斯特的 Boardwalk 俱乐部完成了首场演出。
直接提问模型 Oasis 在哪里办了第一场演出，模型当场失忆。
但当模型被允许在推理期生成中间思维链，先联想到乐队早期在曼彻斯特的地下音乐场景，记忆的闸门被瞬间推开，锁在参数里的正确答案随之浮现。
大模型的准确率瓶颈，早已悄然发生了位移。
它不再单纯取决于预训练阶段塞进了多少海量语料。
更关键的齿轮，在于推理阶段有没有给模型留出构建联想路径的计算空间。
如果只有庞大的参数仓库，却没有激活记忆的思考机制，扩容只是在制造一个更巨大的知识迷宫。
真正决定模型智力上限的，从来不只看它背下了多少信息。
关键在于现实的提问偏离了课本的标准语境时，它能不能用思考为自己重新搭出一座找到真相的桥。

_Rendered by mubei-terminal._
