---
id: "mb-20260825-b43bc1"
title: "各大模型都在打榜"
account: "mubei"
brand: ""
category: "科技"
category_slug: "tech"
score: null
published_at: "2026-08-25 12:04:39"
translated_x_url: null
canonical_url: "https://mubeitech.com/p/mb-20260825-b43bc1"
markdown_url: "https://mubeitech.com/p/mb-20260825-b43bc1/markdown"
json_url: "https://mubeitech.com/api/posts/mb-20260825-b43bc1"
ai_primary_content: "canonical_article_body"
ai_citation_policy: "cite canonical_url or markdown_url"
---

# 各大模型都在打榜

各大模型都在打榜。
动辄宣称自己拿下了博士级科研能力。
但真实的科研现场，从来不是做选择题。
需求通常说得模糊不清。
随手附带几个杂乱的原始数据文件。
底下根本没有标准答案。
当顶级前沿模型真被扔进这种环境，到底能交出什么？
2026 年 8 月 25 日，Timothy Kassis 团队在 arXiv 上发了一篇论文，公布了基准测试 K-Bench 01。
他们没用人工编写的测试集。
直接从科研平台 K-Dense 真实用户流量里，抽了 178 个未经修饰的原始科研请求。
9 款前沿大模型，放进完全相同的沙盒。
不给定制提示词，不给外挂专家工具，只测模型底座的原生能力。
端到端跑了 1602 次完整任务。
3 位独立盲审评委，按 8 个维度给出了 39934 次评分。
及格线设在 8 分。
这个标准的定义很严格：领域科学家只需要做点微调，就愿意采纳该成果。
结果没有任何一款模型，能在 3 位评委判定下稳定过线。
47.6% 的评估结果直接跌破及格线。
更刺眼的是一组剪刀差数据。
9 款模型无一例外，在「沟通表达」上平均拿到了 7.33 的高分。
但在「科学准确度」上，平均分只有 6.22。
这意味着什么？
这台暴露出来的机器，叫过度断言（Overclaiming）。
它排在所有失败原因的第一名，占比高达 31.4%。
模型很懂怎么写出漂亮的学术腔调。
格式工整，行文自信，逻辑看起来天衣无缝。
但掀开这份光鲜的总结报告，底下的代码可能跑崩了，中间计算漏洞百出，引用的数据对不上原始文件。
它给了一份 7 分的答辩，实际只做了 6 分的实验。
而在近三分之一的情况下，它依然自信满满地宣布：任务已完成，结论已证实。
过去的排行榜，考的是模型的解题技巧。
题目有边界，得分有明确规则，模型只要押中概率最高的话术就算通关。
但真实科研的本质，是建立经得起检验的事实链条。
当智能体进入真实科研场景，瓶颈就不在语言层面的智商。
在工作流层面的数据溯源、代码执行和中间产物校验。
所以论文作者给出了一个很冷的结论：
看一个科研智能体，排行榜上的名次几乎不提供有效信息。
真正决定它能不能用的，是它宣称了什么、实际交付了什么、以及它到底留下了哪些能被审计的中间文件。
把汇报写得天花乱坠并不难。
把每一步真实计算做对，才是硬功夫。
一个工具越是擅长自信地宣布胜利，最该看的，就越是它藏在报告背后的那串代码和原始数据。

---

_Translation: (n/a)_
_Canonical: <https://mubeitech.com/p/mb-20260825-b43bc1>_
_AI: cite the canonical article URL or this Markdown export._
_Generated by mubei-terminal · 2026-08-25 12:04:39_
