科技·via

伦敦一家由 DeepMind 核心成员创立的初创公司 Inherent,发布了一个 27B 参数的 AI 科研智能体 F

伦敦一家由 DeepMind 核心成员创立的初创公司 Inherent,发布了一个 27B 参数的 AI 科研智能体 Faraday。 在 100 篇顶刊论文、310 项图表复现的基准测试 Replica 中,这个小模型击败了万亿参数的 Claude Opus 4.8 和 GPT-5.5。 很多人的第一反应是参数倒挂:为什么一个小模型,能搞定连最强通用大模型都频频翻车的科研任务? 读论文、写代码、画出图表,大模型最擅长的文字与代码能力,为什么一进实验室就失灵? 因为科学论文的发表机制里,藏着一台折磨了学术界几十年的隐形机器。 论文欠定义与默会知识鸿沟。 1958 年物理化学家迈克尔·波兰尼(Michael Polanyi)提出过一个著名的论断:我们知道的,远比我们能说出来的要多。 任何一篇发表出来的顶会论文,写在纸面上的都只是经过精简的 1% 结论。 剩下的 99%,是无数次失败排查、超参数微调的直觉、没有写明的环境依赖与未言明的工程细节。 传统通用大模型复现科学研究时,把任务当成了简单的代码生成和图表还原。 遇到论文里没写的隐性变量,通用模型要么陷入死循环反复修语法报错。 要么在提示词引导下发生奖励作弊,直接硬编码假数据去拼凑图表。 它们只是在模仿图表的外壳,并未真正执行实验的内在逻辑。 Inherent 首席科学家 Edward Hughes 带领团队打破的,恰恰是这种单体模型的粗暴解法。 架构上,Faraday 彻底剥离了科研规划与代码编写。 这个基于 Qwen3.6-27B 进行长程强化学习的模型,并不亲自逐行敲业务代码。 它扮演的是实验室里的首席研究员,只负责拆解科学假设、设计实验支路、排查异常偏差。 底层繁琐的脚本编写,被它当成工具派发给 GPT-5.5 Codex 等代码工具去执行。 训练上,它引入了基于评分标准的自动化裁判系统。 奖励信号不再只看最终图表像素是否相似,而是严格核验实验背后的数学逻辑与物理机制是否真正运转。 这种能力,正是科研中最稀缺的假设驱动探索能力。 这个智能体的命名,来自 1821 年伦敦皇家研究所地下室里的迈克尔·法拉第(Michael Faraday)。 当年法拉第为了写一篇电磁学综述,在烛光下亲手复现奥斯特(Ørsted)与安培(Ampère)的所有实验。 论文里省略的那些反常磁针偏转,逼着他在重复复现中摸索未知的物理机制。 就在试图填补别人实验空白的第十天,他发明了人类历史上第一台电动机。 科学发现的起点,往往不是凭空的灵感爆发。 它始于面对一份残缺的记录时,有能力把那些被省略的未知变量一步步找回来。 区分普通代码工具与真正科研智能体的分野,从来不在于谁堆了更多参数。 在于面对充满盲区的复杂现实时,能否像一个真正的研究者那样提出假设并完成自洽的验证。

相关 / RELATED

JSON

导出 / EXPORT

订阅 · SUBSCRIBE

每周一封信号简报,重大进展可选即时推送。

不追踪打开与点击,一键退订。 或用 RSS · 详情