科技·via

各大模型都在打榜

各大模型都在打榜。 动辄宣称自己拿下了博士级科研能力。 但真实的科研现场,从来不是做选择题。 需求通常说得模糊不清。 随手附带几个杂乱的原始数据文件。 底下根本没有标准答案。 当顶级前沿模型真被扔进这种环境,到底能交出什么? 2026 年 8 月 25 日,Timothy Kassis 团队在 arXiv 上发了一篇论文,公布了基准测试 K-Bench 01。 他们没用人工编写的测试集。 直接从科研平台 K-Dense 真实用户流量里,抽了 178 个未经修饰的原始科研请求。 9 款前沿大模型,放进完全相同的沙盒。 不给定制提示词,不给外挂专家工具,只测模型底座的原生能力。 端到端跑了 1602 次完整任务。 3 位独立盲审评委,按 8 个维度给出了 39934 次评分。 及格线设在 8 分。 这个标准的定义很严格:领域科学家只需要做点微调,就愿意采纳该成果。 结果没有任何一款模型,能在 3 位评委判定下稳定过线。 47.6% 的评估结果直接跌破及格线。 更刺眼的是一组剪刀差数据。 9 款模型无一例外,在「沟通表达」上平均拿到了 7.33 的高分。 但在「科学准确度」上,平均分只有 6.22。 这意味着什么? 这台暴露出来的机器,叫过度断言(Overclaiming)。 它排在所有失败原因的第一名,占比高达 31.4%。 模型很懂怎么写出漂亮的学术腔调。 格式工整,行文自信,逻辑看起来天衣无缝。 但掀开这份光鲜的总结报告,底下的代码可能跑崩了,中间计算漏洞百出,引用的数据对不上原始文件。 它给了一份 7 分的答辩,实际只做了 6 分的实验。 而在近三分之一的情况下,它依然自信满满地宣布:任务已完成,结论已证实。 过去的排行榜,考的是模型的解题技巧。 题目有边界,得分有明确规则,模型只要押中概率最高的话术就算通关。 但真实科研的本质,是建立经得起检验的事实链条。 当智能体进入真实科研场景,瓶颈就不在语言层面的智商。 在工作流层面的数据溯源、代码执行和中间产物校验。 所以论文作者给出了一个很冷的结论: 看一个科研智能体,排行榜上的名次几乎不提供有效信息。 真正决定它能不能用的,是它宣称了什么、实际交付了什么、以及它到底留下了哪些能被审计的中间文件。 把汇报写得天花乱坠并不难。 把每一步真实计算做对,才是硬功夫。 一个工具越是擅长自信地宣布胜利,最该看的,就越是它藏在报告背后的那串代码和原始数据。

相关 / RELATED

JSON

导出 / EXPORT

订阅 · SUBSCRIBE

每周一封信号简报,重大进展可选即时推送。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情