{"id":"mb-20260825-b43bc1","account":"mubei","brand":"","title":"各大模型都在打榜","summary":"各大模型都在打榜","body":"各大模型都在打榜。\n动辄宣称自己拿下了博士级科研能力。\n但真实的科研现场，从来不是做选择题。\n需求通常说得模糊不清。\n随手附带几个杂乱的原始数据文件。\n底下根本没有标准答案。\n当顶级前沿模型真被扔进这种环境，到底能交出什么？\n2026 年 8 月 25 日，Timothy Kassis 团队在 arXiv 上发了一篇论文，公布了基准测试 K-Bench 01。\n他们没用人工编写的测试集。\n直接从科研平台 K-Dense 真实用户流量里，抽了 178 个未经修饰的原始科研请求。\n9 款前沿大模型，放进完全相同的沙盒。\n不给定制提示词，不给外挂专家工具，只测模型底座的原生能力。\n端到端跑了 1602 次完整任务。\n3 位独立盲审评委，按 8 个维度给出了 39934 次评分。\n及格线设在 8 分。\n这个标准的定义很严格：领域科学家只需要做点微调，就愿意采纳该成果。\n结果没有任何一款模型，能在 3 位评委判定下稳定过线。\n47.6% 的评估结果直接跌破及格线。\n更刺眼的是一组剪刀差数据。\n9 款模型无一例外，在「沟通表达」上平均拿到了 7.33 的高分。\n但在「科学准确度」上，平均分只有 6.22。\n这意味着什么？\n这台暴露出来的机器，叫过度断言（Overclaiming）。\n它排在所有失败原因的第一名，占比高达 31.4%。\n模型很懂怎么写出漂亮的学术腔调。\n格式工整，行文自信，逻辑看起来天衣无缝。\n但掀开这份光鲜的总结报告，底下的代码可能跑崩了，中间计算漏洞百出，引用的数据对不上原始文件。\n它给了一份 7 分的答辩，实际只做了 6 分的实验。\n而在近三分之一的情况下，它依然自信满满地宣布：任务已完成，结论已证实。\n过去的排行榜，考的是模型的解题技巧。\n题目有边界，得分有明确规则，模型只要押中概率最高的话术就算通关。\n但真实科研的本质，是建立经得起检验的事实链条。\n当智能体进入真实科研场景，瓶颈就不在语言层面的智商。\n在工作流层面的数据溯源、代码执行和中间产物校验。\n所以论文作者给出了一个很冷的结论：\n看一个科研智能体，排行榜上的名次几乎不提供有效信息。\n真正决定它能不能用的，是它宣称了什么、实际交付了什么、以及它到底留下了哪些能被审计的中间文件。\n把汇报写得天花乱坠并不难。\n把每一步真实计算做对，才是硬功夫。\n一个工具越是擅长自信地宣布胜利，最该看的，就越是它藏在报告背后的那串代码和原始数据。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-25 12:04:39","created_at":"2026-08-25 12:04:39"}