深度解读AI 与大模型generatedpublished

单步 98% 却端到端崩塌:北邮 LogiMed-RoB 揭开医学大模型误差复合效应

误差复合效应机制

98.88% 的高分,在同一张医学考卷上,断崖式跌到了 45.13%。 几个主流开源模型,甚至一路跌到了接近 0%。 arXiv 刚刚上线了一篇来自北京邮电大学的重磅评测论文。 黄佳裕、唐子晨团队把十个全球顶尖大模型,拉进了循证医学的最深处。 860 篇真实随机对照试验,14,820 次逻辑查询。 接受拷问的名单里,有 Gemini 3.1 Pro、Claude Sonnet 4.5、GPT 5.1。 也有 DeepSeek V3.2、Llama 4 和 Qwen3。 各大商业实验室过去两年都在宣称,自己的医学 AI 跑分已经达到人类专家水平。 但这篇论文撕开了跑分榜单底下最危险的一层遮羞布。

为什么同一个模型,单看每一个问题能答对 98.88%, 一旦把整条推理链条串起来,合格率就会腰斩甚至直接归零? 为什么模型连关键证据都没找对,却能神奇地猜中最终结论; 而把满分证据清清楚楚摆在它眼前,它反而有高达 40% 的概率给出错误判断?

这台击穿所有顶尖 AI 的机器,叫误差复合效应。 要理解它,得先看懂现代循证医学最严密的一道防火墙:考克兰偏倚风险评估(Cochrane RoB 2.0)。 这套由全球临床专家打磨了数十年的金标准,从来不靠直觉打分。 它是一棵严密的有向无环决策树。 整套逻辑被切成了严格的三层: 最底层,是 22 个具体的引导性事实问题。 比如受试者分组是否隐藏,临床试验有没有做到对医生和患者双盲。 中间层,是领域推理。 必须严格根据上一层事实的真假,像逻辑门电路一样,推导各个维度的偏倚风险。 最顶层,是全局聚合。 严格遵守最差原则:只要有一个环节存在高风险,整项试验的结论就必须全盘降级。 在传统的黑盒测试里,大模型只需要在考卷末尾勾选一个最终标签。 就像一个根本没看病历的考生,凭着直觉蒙对了选择题。 但当研究团队用分层逻辑一致性框架去逐层白盒核验时, 隐藏在黑盒内部的齿轮彻底卡死了。

第一层齿轮,是逻辑链条的乘法坍塌。 在单点的事实问答上,Gemini 3.1 Pro 展现了极强的指令遵循能力,准确率高达 98.88%; DeepSeek V3.2 也达到了 92.01%。 但在 10 个具有前置依赖的临床分支路径上,微小的误差开始发生乘法级放大。 第一步出现轻微偏差,第二步就会忽略前置约束,第三步整个逻辑分支彻底脱轨。 哪怕每一个单步看似都接近满分, 经过多层级联推导之后,顶尖模型的端到端一致性也从 98.88% 骤降到 45.13%。 Meta 的 Llama 3.3 70B,在单点准确率还有 68.18% 的情况下,端到端完整一致性直接清零。 Qwen3 32B 和 Llama 4 Maverick,也一路暴跌到 1% 至 2% 的冰点。

第二层齿轮,是更荒谬的先验盲猜机制。 论文团队设计了一套严格的证据真实度检验。 结果发现了一个令人脊背发凉的现象: 在根本没有从文献中检索出有效文本证据的情况下,模型的盲猜率最高达到了 48.28%。 接近一半的所谓正确答案,完全脱离了眼前这篇医学论文的具体内容。 模型只是在调用预训练权重里的统计概率,在黑盒深处凭空蒙中了一个合理的结果。 相反,当研究人员把人类专家标注的金标准证据原原本本送入上下文时, 模型的推理失败率依然高达 18.63% 到 40.05%。 即便是在顶尖闭源模型里,面对满分证据依然推错结论的比例也普遍超过四分之一。 在限定专家证据的实验里,模型的准确率甚至比检索混乱上下文时还反常地下降了 2.84 个百分点。 这就是论文揭示的神谕证据悖论: 模型并没有在执行临床推导,它只是在参数的概率迷宫里寻找模式匹配的捷径。

商业公司习惯用黑盒跑分向市场兜售 AI 的全能。 在很多静态单步选择题里,漂亮的高分制造了一种模型已经具备临床推理能力的假象。 但商业展示可以只看结果,真实世界的人命却完全系于推导过程的严丝合缝。 循证医学之所以要设立考克兰这样繁琐严苛的逻辑梯级, 就是为了剔除任何一个靠巧合蒙混过关的侥幸。 当一个系统靠着完全脱轨的推理碰巧猜中答案, 一旦被推进临床,它只会是一枚无法预测的定时炸弹。 当整个行业都在终点线为标签准确率鼓掌时, 真正决定病人生死的,恰恰是那个在黑盒深处走错了一步却无人知晓的逻辑断点。 机器可以不知疲倦地吐出各种疾病的统计概率。 但如果它无法在一条严密的因果链条上保持清醒, 我们交付给算法的,究竟是对生命的救治,还是一场披着高科技外衣的掷骰子?

引用 / CITATIONS

No citations exported.

同领域解读 / AI & LLMS

查看全部「AI 与大模型」解读 →

导出 / EXPORT

订阅 · SUBSCRIBE

每周一封独立、不受审查的科技与 AI 深度评论,周一发出。带出处,可核查。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情