---
id: "mb-20260912-eb3bfe"
kind: "deep"
title: "单步 98% 却端到端崩塌：北邮 LogiMed-RoB 揭开医学大模型误差复合效应"
topic: "单步 98% 却端到端崩塌：北邮 LogiMed-RoB 揭开医学大模型误差复合效应"
source_type: "generated"
status: "published"
generated_at: "2026-09-12 20:38:00"
frame_type: ["误差复合效应", "机制"]
legal_anchor_count: 0
transcript_citation_count: 0
---

# 单步 98% 却端到端崩塌：北邮 LogiMed-RoB 揭开医学大模型误差复合效应

98.88% 的高分，在同一张医学考卷上，断崖式跌到了 45.13%。
几个主流开源模型，甚至一路跌到了接近 0%。
arXiv 刚刚上线了一篇来自北京邮电大学的重磅评测论文。
黄佳裕、唐子晨团队把十个全球顶尖大模型，拉进了循证医学的最深处。
860 篇真实随机对照试验，14,820 次逻辑查询。
接受拷问的名单里，有 Gemini 3.1 Pro、Claude Sonnet 4.5、GPT 5.1。
也有 DeepSeek V3.2、Llama 4 和 Qwen3。
各大商业实验室过去两年都在宣称，自己的医学 AI 跑分已经达到人类专家水平。
但这篇论文撕开了跑分榜单底下最危险的一层遮羞布。

为什么同一个模型，单看每一个问题能答对 98.88%，
一旦把整条推理链条串起来，合格率就会腰斩甚至直接归零？
为什么模型连关键证据都没找对，却能神奇地猜中最终结论；
而把满分证据清清楚楚摆在它眼前，它反而有高达 40% 的概率给出错误判断？

这台击穿所有顶尖 AI 的机器，叫误差复合效应。
要理解它，得先看懂现代循证医学最严密的一道防火墙：考克兰偏倚风险评估（Cochrane RoB 2.0）。
这套由全球临床专家打磨了数十年的金标准，从来不靠直觉打分。
它是一棵严密的有向无环决策树。
整套逻辑被切成了严格的三层：
最底层，是 22 个具体的引导性事实问题。
比如受试者分组是否隐藏，临床试验有没有做到对医生和患者双盲。
中间层，是领域推理。
必须严格根据上一层事实的真假，像逻辑门电路一样，推导各个维度的偏倚风险。
最顶层，是全局聚合。
严格遵守最差原则：只要有一个环节存在高风险，整项试验的结论就必须全盘降级。
在传统的黑盒测试里，大模型只需要在考卷末尾勾选一个最终标签。
就像一个根本没看病历的考生，凭着直觉蒙对了选择题。
但当研究团队用分层逻辑一致性框架去逐层白盒核验时，
隐藏在黑盒内部的齿轮彻底卡死了。

第一层齿轮，是逻辑链条的乘法坍塌。
在单点的事实问答上，Gemini 3.1 Pro 展现了极强的指令遵循能力，准确率高达 98.88%；
DeepSeek V3.2 也达到了 92.01%。
但在 10 个具有前置依赖的临床分支路径上，微小的误差开始发生乘法级放大。
第一步出现轻微偏差，第二步就会忽略前置约束，第三步整个逻辑分支彻底脱轨。
哪怕每一个单步看似都接近满分，
经过多层级联推导之后，顶尖模型的端到端一致性也从 98.88% 骤降到 45.13%。
Meta 的 Llama 3.3 70B，在单点准确率还有 68.18% 的情况下，端到端完整一致性直接清零。
Qwen3 32B 和 Llama 4 Maverick，也一路暴跌到 1% 至 2% 的冰点。

第二层齿轮，是更荒谬的先验盲猜机制。
论文团队设计了一套严格的证据真实度检验。
结果发现了一个令人脊背发凉的现象：
在根本没有从文献中检索出有效文本证据的情况下，模型的盲猜率最高达到了 48.28%。
接近一半的所谓正确答案，完全脱离了眼前这篇医学论文的具体内容。
模型只是在调用预训练权重里的统计概率，在黑盒深处凭空蒙中了一个合理的结果。
相反，当研究人员把人类专家标注的金标准证据原原本本送入上下文时，
模型的推理失败率依然高达 18.63% 到 40.05%。
即便是在顶尖闭源模型里，面对满分证据依然推错结论的比例也普遍超过四分之一。
在限定专家证据的实验里，模型的准确率甚至比检索混乱上下文时还反常地下降了 2.84 个百分点。
这就是论文揭示的神谕证据悖论：
模型并没有在执行临床推导，它只是在参数的概率迷宫里寻找模式匹配的捷径。

商业公司习惯用黑盒跑分向市场兜售 AI 的全能。
在很多静态单步选择题里，漂亮的高分制造了一种模型已经具备临床推理能力的假象。
但商业展示可以只看结果，真实世界的人命却完全系于推导过程的严丝合缝。
循证医学之所以要设立考克兰这样繁琐严苛的逻辑梯级，
就是为了剔除任何一个靠巧合蒙混过关的侥幸。
当一个系统靠着完全脱轨的推理碰巧猜中答案，
一旦被推进临床，它只会是一枚无法预测的定时炸弹。
当整个行业都在终点线为标签准确率鼓掌时，
真正决定病人生死的，恰恰是那个在黑盒深处走错了一步却无人知晓的逻辑断点。
机器可以不知疲倦地吐出各种疾病的统计概率。
但如果它无法在一条严密的因果链条上保持清醒，
我们交付给算法的，究竟是对生命的救治，还是一场披着高科技外衣的掷骰子？

_Rendered by mubei-terminal._
