深度解读AI 与大模型generatedpublished

当 OpenAI 和 Anthropic 还在沙盒里争论谁的模型更容易越狱

全量因果预计算与连锁不平衡解耦机制

当 OpenAI 和 Anthropic 还在沙盒里争论谁的模型更容易越狱。 当大语言模型在几千亿美元的循环融资里狂欢。 Google DeepMind 悄悄甩出了一份 1 PB 大小的数据库。 它把人类基因组里所有可能的 90 亿种单碱基突变,全部提前预测了一遍。 这个数据库叫 AlphaGenome Atlas。 全球任何一个生物医学研究员,打开浏览器就能免费查到每一个突变的分子后果。 这就引出了一个反常识的问题。 人类 DNA 一共只有 30 亿个碱基对。 为什么会有 90 亿种突变可能? 更关键的是: 2003 年人类基因组计划就已经耗资 30 亿美元,把这 30 亿个字母全部测完。 为什么随后二十多年,现代医学依然被癌症和罕见病困在原地? 拥有了完整的代码清单,为什么我们还是解不开疾病的因果? 真正挡住医学界的,是一堵叫作连锁不平衡的因果高墙。 以及一套被称为全量因果预计算的全新机器。 很多人以为 DNA 都在直接制造蛋白质。 事实恰恰相反。 在人类 30 亿对碱基里,真正负责编码蛋白质的区域只有不到 2%。 剩下的 98%,曾经被早期学者草率地叫作垃圾 DNA。 它们根本不是垃圾。 它们是整套生命系统的中央调控面板。 启动子、增强子、剪接信号。 它们负责指挥那 2% 的蛋白质:在什么器官生产,在什么时刻开机,以多大剂量表达。 过去二十年,医学界找病因主要靠全基因组关联分析(GWAS)。 GWAS 可以在人群里找出哪一段 DNA 和疾病相关。 但它带来了一个巨大的瓶颈。 在染色体上,相邻的基因片段往往是一整块打包遗传的。 这就是生物学上的连锁不平衡。 当分析工具提示某个区域和疾病高度相关时,里面往往同时捆绑着成百上千个突变。 谁是真正引发疾病的因果突变? 谁只是搭便车被连带遗传的无辜乘客? 关联分析只能告诉你相关,无法告诉你因果。 医学界过去唯一的办法,是在实验室里用细胞培养皿一个一个去试。 但人类 30 亿个碱基,每个碱基有 3 种变异可能。 整整 90 亿种突变。 哪怕一天在实验室验证一个,测完也需要两千多万年。 面对罕见病患者报告里密密麻麻的非编码突变,医生过去只能在黑暗中盲猜。 DeepMind 改变了整个游戏规则。 它没有扔出一个需要极高算力门槛的模型让医生去排队推理。 它用庞大的计算资源,直接把这 90 亿种突变的所有分子后果提前跑完。 DNA 的变异如何影响 RNA 剪接? 如何改变染色质开放程度? 如何打乱基因表达? 所有分子尺度的扰动,被预先计算成一个 1 PB 的因果图谱。 再把这个庞大网络,压缩成一个数字: AVI 评分。 评分越高,代表这个突变对分子机制的破坏力越大。 原本需要在实验室试错几千年的大海捞针,被降维成了一次几毫秒的查表。 这个机制落地的速度极其惊人。 GREGoR 联盟与博德研究所的 Laura Covill 和 Anne O'Donnell-Luria,拿它去查困扰团队多年的疑难病例。 患者患有罕见的严重儿童癫痫性脑病。 在 DNM1 基因的深层非编码区,过去发现过一个变异,但没人知道它到底有没有致病性。 查表结果显示,这个位点的 AVI 评分极高。 它在非编码区制造了一个错误的剪接位点,导致生成的蛋白质被异常拉长。 后续的实验室验证证明,预测完全准确。 困扰多年的医学悬案,在一次查表之后,因果链条被彻底打通。 今年各大科技巨头的资本开支已经飙升到每年近两千亿美元。 很多人每天都在争吵大模型会不会是一场自我循环的融资泡沫。 不少企业把算力用来生成营销文案和聊天机器人。 但算力真正的分水岭,发生在它接触到物理世界底层规则的时刻。 在文本世界里堆叠参数,是在人类已有的文字碎片里做概率拼接。 在生物分子的因果空间里做全量预计算,是在强行读懂自然界运行了三十亿年的底层机器指令。 从耗费几千万年的暴力穷举,变成毫秒级的精准因果查表。 工具形态的跃迁,正在把现代医学从相关性的迷雾里拉出来。 生命最深处那 98% 的控制面板,第一次被完整画成了一张可以按图索骥的地图。

引用 / CITATIONS

No citations exported.

同领域解读 / AI & LLMS

查看全部「AI 与大模型」解读 →

导出 / EXPORT

订阅 · SUBSCRIBE

每周一封科技与 AI 深度解读,周一发出。不受审查,带出处,可核查。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情