{"id":"mb-20260912-eb3bfe","kind":"deep","title":"单步 98% 却端到端崩塌：北邮 LogiMed-RoB 揭开医学大模型误差复合效应","summary":"北京邮电大学最新发布的 LogiMed-RoB 评测基准显示，在考克兰循证医学决策树下，大模型在多步逻辑推导中爆发严重的误差复合效应：单步准确率高达 98.88% 的顶尖模型，端到端一致性骤降至 45.13%，部分开源模型甚至跌至 0%。大模型高达 48% 的盲猜率和证据推理脱节，揭示了黑盒标签匹配无法替代严密白盒逻辑验证的临床现实。","body":"98.88% 的高分，在同一张医学考卷上，断崖式跌到了 45.13%。\n几个主流开源模型，甚至一路跌到了接近 0%。\narXiv 刚刚上线了一篇来自北京邮电大学的重磅评测论文。\n黄佳裕、唐子晨团队把十个全球顶尖大模型，拉进了循证医学的最深处。\n860 篇真实随机对照试验，14,820 次逻辑查询。\n接受拷问的名单里，有 Gemini 3.1 Pro、Claude Sonnet 4.5、GPT 5.1。\n也有 DeepSeek V3.2、Llama 4 和 Qwen3。\n各大商业实验室过去两年都在宣称，自己的医学 AI 跑分已经达到人类专家水平。\n但这篇论文撕开了跑分榜单底下最危险的一层遮羞布。\n\n为什么同一个模型，单看每一个问题能答对 98.88%，\n一旦把整条推理链条串起来，合格率就会腰斩甚至直接归零？\n为什么模型连关键证据都没找对，却能神奇地猜中最终结论；\n而把满分证据清清楚楚摆在它眼前，它反而有高达 40% 的概率给出错误判断？\n\n这台击穿所有顶尖 AI 的机器，叫误差复合效应。\n要理解它，得先看懂现代循证医学最严密的一道防火墙：考克兰偏倚风险评估（Cochrane RoB 2.0）。\n这套由全球临床专家打磨了数十年的金标准，从来不靠直觉打分。\n它是一棵严密的有向无环决策树。\n整套逻辑被切成了严格的三层：\n最底层，是 22 个具体的引导性事实问题。\n比如受试者分组是否隐藏，临床试验有没有做到对医生和患者双盲。\n中间层，是领域推理。\n必须严格根据上一层事实的真假，像逻辑门电路一样，推导各个维度的偏倚风险。\n最顶层，是全局聚合。\n严格遵守最差原则：只要有一个环节存在高风险，整项试验的结论就必须全盘降级。\n在传统的黑盒测试里，大模型只需要在考卷末尾勾选一个最终标签。\n就像一个根本没看病历的考生，凭着直觉蒙对了选择题。\n但当研究团队用分层逻辑一致性框架去逐层白盒核验时，\n隐藏在黑盒内部的齿轮彻底卡死了。\n\n第一层齿轮，是逻辑链条的乘法坍塌。\n在单点的事实问答上，Gemini 3.1 Pro 展现了极强的指令遵循能力，准确率高达 98.88%；\nDeepSeek V3.2 也达到了 92.01%。\n但在 10 个具有前置依赖的临床分支路径上，微小的误差开始发生乘法级放大。\n第一步出现轻微偏差，第二步就会忽略前置约束，第三步整个逻辑分支彻底脱轨。\n哪怕每一个单步看似都接近满分，\n经过多层级联推导之后，顶尖模型的端到端一致性也从 98.88% 骤降到 45.13%。\nMeta 的 Llama 3.3 70B，在单点准确率还有 68.18% 的情况下，端到端完整一致性直接清零。\nQwen3 32B 和 Llama 4 Maverick，也一路暴跌到 1% 至 2% 的冰点。\n\n第二层齿轮，是更荒谬的先验盲猜机制。\n论文团队设计了一套严格的证据真实度检验。\n结果发现了一个令人脊背发凉的现象：\n在根本没有从文献中检索出有效文本证据的情况下，模型的盲猜率最高达到了 48.28%。\n接近一半的所谓正确答案，完全脱离了眼前这篇医学论文的具体内容。\n模型只是在调用预训练权重里的统计概率，在黑盒深处凭空蒙中了一个合理的结果。\n相反，当研究人员把人类专家标注的金标准证据原原本本送入上下文时，\n模型的推理失败率依然高达 18.63% 到 40.05%。\n即便是在顶尖闭源模型里，面对满分证据依然推错结论的比例也普遍超过四分之一。\n在限定专家证据的实验里，模型的准确率甚至比检索混乱上下文时还反常地下降了 2.84 个百分点。\n这就是论文揭示的神谕证据悖论：\n模型并没有在执行临床推导，它只是在参数的概率迷宫里寻找模式匹配的捷径。\n\n商业公司习惯用黑盒跑分向市场兜售 AI 的全能。\n在很多静态单步选择题里，漂亮的高分制造了一种模型已经具备临床推理能力的假象。\n但商业展示可以只看结果，真实世界的人命却完全系于推导过程的严丝合缝。\n循证医学之所以要设立考克兰这样繁琐严苛的逻辑梯级，\n就是为了剔除任何一个靠巧合蒙混过关的侥幸。\n当一个系统靠着完全脱轨的推理碰巧猜中答案，\n一旦被推进临床，它只会是一枚无法预测的定时炸弹。\n当整个行业都在终点线为标签准确率鼓掌时，\n真正决定病人生死的，恰恰是那个在黑盒深处走错了一步却无人知晓的逻辑断点。\n机器可以不知疲倦地吐出各种疾病的统计概率。\n但如果它无法在一条严密的因果链条上保持清醒，\n我们交付给算法的，究竟是对生命的救治，还是一场披着高科技外衣的掷骰子？","topic":"单步 98% 却端到端崩塌：北邮 LogiMed-RoB 揭开医学大模型误差复合效应","frame_type":["误差复合效应","机制"],"citations":[],"channel_note":"","identity_notice":"","source_type":"generated","status":"published","generated_at":"2026-09-12 20:38:00","legal_anchor_count":0,"transcript_citation_count":0}