2026 年 9 月 8 日,DeepMind 创始人 Demis Hassabis 发了一条推文
2026 年 9 月 8 日,DeepMind 创始人 Demis Hassabis 发了一条推文。 他说,AlphaFold 绘制了蛋白质宇宙,现在,AlphaGenome Atlas 开始绘制整个人类基因组。 这台新工具,把人类 DNA 上所有 90 亿种可能的单字母突变,从头到尾预计算了一遍。 很多人以为这只是 AlphaFold 的升级版,是另一个更庞大的结构预测模型。 甚至有人欢呼,医学终于要攻克所有遗传病了。 但只要退后一步看,一个刺眼的问题就会浮现出来。 人类早在 2003 年就完成了人类基因组计划,把 30 亿个碱基对全部测序完毕。 如果二十三年前人类就已经把整本生命天书完完整整抄写下来了,为什么全球科学家还会被困在原地二十几年? 为什么 90 亿这个数字,会成为生命科学二十年来跨不过去的终极死结? 要看懂这 90 亿次预计算到底掀翻了什么,得先看清那台让现代医学原地踏步二十年的底层机器。 很多人以为,我们的 DNA 整条长链都在直接制造蛋白质。 真实情况恰好颠覆了这个认知。 在人类基因组的 30 亿对碱基里,真正负责编码蛋白质的外显子,仅仅占了大概 2%。 剩下的 98%,曾经被早期遗传学家草率地称为垃圾 DNA。 但人体没有多余的废件。 那 2% 的蛋白质是灯泡、齿轮和马达。 剩下的 98%,是整部人体机器庞大而隐秘的控制面板。 启动子、增强子、沉默子、RNA 剪接位点。 它掌管着整套调控网络: 哪个基因在哪个器官里启动? 在什么时候通电? 以多大功率运转? 这就是为什么肝细胞和脑细胞拥有完全相同的 DNA,却长成截然不同的器官。 全靠这 98% 的控制开关在实时调度。 致命的矛盾就爆发在这里。 过去二十年,全球医学界耗资数百亿美元开展全基因组关联分析。 大家去测几十万人的全基因组,试图找出致病元凶。 结果让所有人倒吸一口凉气。 人类 90% 以上的常见复杂疾病,比如糖尿病、精神分裂症、心血管病、自体免疫疾病,相关的遗传变异,根本不在那 2% 的蛋白质零件里。 它们全部密密麻麻地落在那 98% 的控制面板上。 既然变异位置找到了,为什么我们依然造不出药、治不好病? 因为统计学撞上了一堵无法穿透的因果墙。 过去的关联分析,给出的仅仅是相关性。 它只能告诉你:生这种病的人,在染色体某个遥远的位置上,字母 A 出现的频率异常高。 但因为人类基因在世代遗传中是整段整段捆绑打包的,这叫连锁不平衡。 一个真正致命的异常字母旁边,往往严密包裹着成千上万个搭便车的正常字母。 哪一个是真正短路的开关? 哪一个只是恰好路过的无辜路人? 统计学完全分不出来。 更绝望的是,控制面板根本不讲局部逻辑。 在细胞核的三维空间里,DNA 链条会扭曲、折叠成复杂的空间回路。 一个位于几十万个碱基之外、看似身处基因沙漠的字母突变,折叠过来,恰好直接按死了关键基因的启动子。 要在真实的生物实验室里把因果关系测清楚,唯一的办法是湿实验。 拿培养皿、细胞系和基因编辑工具,一个字母一个字母去改,再去测分子的变化。 人类单倍体基因组有 30 亿个碱基,每个位置有 3 种替换可能,全部单字母突变一共有 90 亿种。 一个顶尖实验室一年测几十个就已经是极限。 要把 90 亿种可能在几百种人体细胞里测一遍,需要几万年,耗资是天文数字。 这就是二十年来现代医学的真实困境。 手里握着堆积如山的关联数据,却面对着 98% 的因果黑箱束手无策。 DeepMind 这次砸碎的,正是这堵卡了人类二十年的因果墙。 今年 1 月,Žiga Avsec 带领的团队在 Nature 上发表了 AlphaGenome 的底层网络。 他们把模型的上下文窗口直接拉长到了 100 万个碱基。 让 AI 在单碱基的极高精度下,同时看清跨越百万碱基的远端调控与空间折叠。 模型跳过了单点分散评测的弯路,在一套统一架构里,端到端预测包括染色质空间三维构象、RNA 剪接、组蛋白修饰在内的 27000 种分子表型。 它在芯片里重建了基因调控的物理语法。 到了 9 月 8 日,他们直接把这套能力推向了终极应用。 不等科学家一个一个去申请算力排队计算。 DeepMind 用庞大的集群,把人类基因组所有 90 亿种可能的单字母突变,全部预先计算了一遍。 产出的预计算数据库足足有 1 PB 大小,也就是 AlphaGenome Atlas。 他们把浩瀚的分子预测,压缩成了一个单一的变异影响指标:AVI 分值。 长达几万年的实验室穷举试错,被生生折叠成了一张静态的查表字典。 医生和科学家不再需要拿着相关性去猜谜。 输入患者突变的坐标,这张表直接告诉你这个字母在三维空间里会不会破坏开关、破坏哪种开关。 这种从统计相关到因果预计算的跳跃,威力在第一批临床验证中就显露了出来。 Broad 研究所的团队用这套图谱,去重新审查那些多年悬而未决的严重疑难病患。 过去在蛋白质编码区翻遍了都没找到原因的癫痫性脑病儿童,被系统一键定位。 问题正出在 DNM1 基因附近一个过去被所有人视作噪音的非编码异常剪接突变上。 困扰临床团队数年的谜题,在一次查表里落下了帷幕。 埃克塞特大学的研究团队调出英国生物样本库 54000 名参与者的全基因组数据,顺着图谱一扫,直接挖出了一大批过去从未被发现的复杂性状调控靶点。 商业与科学的交界处,永远运转着现实的利益齿轮。 这套 1 PB 的图谱对非商业的学术研究完全免费开放。 但一旦进入制药研发与商业转化,大门便设立了收费闸口: 必须通过 Google Cloud 购买商业牌照。 二十三年前的人类基因组计划,是由多国科学家共同推进的全球公共科学行动,数据完全属于人类公共领域。 而今天绘制生命暗物质因果底座的关键工具,已经沉淀为商业科技巨头的云端护城河。 更关键的是,预计算图谱并不是万能解药。 芯片里的全量前向预测,给出的是高度可信的分子因果假说。 它能帮人类在 90 亿次噪音里瞬间锁定那几颗致命子弹。 但子弹打在真实的活体组织里会引发怎样复杂的级联反应,依然需要真实的生理学去交卷。 真正的科学分水岭,从来不是在旧跑道上把速度提高一倍。 二十三年前,人类拿到了全基因组那张 30 亿个字母的说明书,却在 2% 的零件目录里困了二十年。 当那 98% 的控制开关被第一次全量预计算成一张查表字典。 生命科学才真正跨过了从观察相关到理解因果的门槛。 拿到零件清单只是第一步。 看懂整栋大楼里错综复杂的电线,人类才算真正开始读懂生命这台机器。
引用 / CITATIONS
No citations exported.
同领域解读 / BIO & MEDICINE
导出 / EXPORT
订阅 · SUBSCRIBE
每周一封科技与 AI 深度解读,周一发出。不受审查,带出处,可核查。