{"id":"mb-20260901-8e9eb4","kind":"deep","title":"当大模型出现幻觉、给出错误回答的时候，几乎所有工程团队的第一反应都是：模型缺了这部分知识","summary":"当大模型出现幻觉、给出错误回答的时候，几乎所有工程团队的第一反应都是：模型缺了这部分知识","body":"当大模型出现幻觉、给出错误回答的时候，几乎所有工程团队的第一反应都是：模型缺了这部分知识。\n行业通用的药方也非常固定：继续扩大训练数据、堆大模型参数，或者外挂一套检索增强生成系统。\n但如果知识从一开始就躺在模型的脑子里呢？\n如果它答错的那些事实，有接近九成以上其实早已被塞进了参数深处？\n如果它只是在被提问的那一瞬间，找不到打开记忆仓库的钥匙？\n2026 年，来自 Google Research 与以色列理工学院 Technion 的研究团队，用一项严密的研究打破了这种传统共识。\n他们在 arXiv 上发表的论文编号是 2602.14080。\n研究团队搭建了一个名为 WikiProfile 的评测基准，从中抽取了 2150 个维基百科事实，在 13 个主流大模型上跑了超过 400 万次响应测试。\n结果展现了一个极度反常识的现实。\n像 GPT-5 和 Gemini 3 这类前沿模型，对测试事实的参数编码率已经达到了 95% 到 98%。\n也就是说，参数仓库里的货架几乎是满的。\n但在没有给予额外思考时间的直接问答中，这些模型却有 26% 到 34% 的已存事实根本无法直接提取。\n研究者把这种现象拆解为两台截然不同的机器：空货架与丢钥匙。\n空货架代表模型在预训练时压根没见过这条数据，仓库里本来就没有。\n丢钥匙代表模型早已完成了精确记忆，只要给它当年的原文上文，它能一字不差地续写出来。\n但只要提问换了一种句式、或者从反向角度发问，提取通道就会当场中断。\n很多团队以为只要把模型做大，这个问题就会自然消失。\n实验数据给出了完全相反的答案。\n当研究者把 Gemma 3 模型从 10 亿参数一路扩展到 270 亿参数时，空货架的比例确实从 85% 断崖式下跌到了 23%。\n但丢钥匙的比例却一路飙升，直接冲到了 40% 的峰值。\n无脑堆大参数规模，解决的是仓库的仓储容量，解决不了取货通道的堵塞。\n模型吞下的记忆越多，被困在参数深处的沉睡知识反而越庞大。\n真正能把这批失落记忆唤醒的，是推理期的思考时间。\n在这项实验中，只要允许模型在输出最终答案前调用推理算力展开思考，就能成功找回 40% 到 65% 原本直接提取失败的事实。\n这就像人类心理学上的舌尖现象。\n一个熟悉的名字明明就在嘴边，直接逼你立刻说出来，大脑往往一片空白。\n但只要给你几秒钟去回想相关的场景、地点和关联人物，原本断掉的线索就会重新咬合在一起。\n论文里举了一个具体的案例：英国摇滚乐队 Oasis 当年是在曼彻斯特的 Boardwalk 俱乐部完成了首场演出。\n直接提问模型 Oasis 在哪里办了第一场演出，模型当场失忆。\n但当模型被允许在推理期生成中间思维链，先联想到乐队早期在曼彻斯特的地下音乐场景，记忆的闸门被瞬间推开，锁在参数里的正确答案随之浮现。\n大模型的准确率瓶颈，早已悄然发生了位移。\n它不再单纯取决于预训练阶段塞进了多少海量语料。\n更关键的齿轮，在于推理阶段有没有给模型留出构建联想路径的计算空间。\n如果只有庞大的参数仓库，却没有激活记忆的思考机制，扩容只是在制造一个更巨大的知识迷宫。\n真正决定模型智力上限的，从来不只看它背下了多少信息。\n关键在于现实的提问偏离了课本的标准语境时，它能不能用思考为自己重新搭出一座找到真相的桥。","topic":"当大模型出现幻觉、给出错误回答的时候，几乎所有工程团队的第一反应都是：模型缺了这部分知识","frame_type":["知识存取不对称与推理期联想唤醒机制（空货架 vs","机制"],"citations":[],"channel_note":"","identity_notice":"","source_type":"generated","status":"published","generated_at":"2026-09-01 21:17:25","legal_anchor_count":0,"transcript_citation_count":0}