把人体 DNA 里的字母挨个敲错一遍,整整有九十亿种可能
把人体 DNA 里的字母挨个敲错一遍,整整有九十亿种可能。 要是靠全世界顶尖实验室在试管里逐个培养、逐个做实验,至少需要几千万年。 在 2026 年 9 月,这九十亿种改写生命的分子后果,被一台机器提前全部算完了。 生成的数据集整整有 1 个 PB。 这个体积,是 2022 年轰动全球的 AlphaFold 蛋白质数据库的三十多倍。
为什么要大费周章去算这九十亿个字母? 二十多年前,人类基因组计划宣布完成测序的时候,全世界都以为拿到了生命的终极天书。 可真到了临床一线,医生们立刻被泼了一盆冷水。 整个人类基因组包含三十多亿对碱基, 真正负责编码蛋白质外显子的区域,仅仅占了区区百分之二。 剩下的百分之九十八,在过去长达几十年的时间里,因为看不懂具体功能,被医学界直接打上了一个轻蔑的标签:垃圾 DNA。
后来 AlphaFold 横空出世,一口气预测了两亿多个蛋白质的三维折叠结构; 随后发布的 AlphaMissense,又给这百分之二编码区里的七千多万个错义突变标出了致病概率。 生命大厦的积木砖块,确实被摸清了。 但医学的困局并没有解开。 当一个孩子患上原因不明的严重癫痫或者罕见发育迟缓, 医生把他的全基因组测了个底朝天, 结果发现绝大多数基因突变,根本不在那百分之二的蛋白质积木里。 它们密密麻麻地分布在那百分之九十八的所谓垃圾区域中。 在医院的基因诊断报告上,这类突变统统被标注为同一行字:意义未明变异。 翻译过来就是:我们能看到这里的字母写错了,但它到底会不会要命,没人知道。
那百分之九十八的非编码区域,到底在干什么? 这百分之九十八不是死板的建筑材料,它们是整套生命系统的控制面板。 里面藏着数不清的启动子、增强子、沉默子和剪接位点。 它们像复杂的调度电路,在不同的人体器官和细胞里,精准决定着每个基因何时开机、何时关机、以多大的马力运转。
既然是总控制台,过去为什么破解不了? 因为生命的调控网络不是线性的。 一个远在一百万个碱基对之外的开关,在三维空间里通过染色质环弯折过来,才能扣上目标基因的启动钥匙。 过去的计算模型在这里撞上了两难困境: 要么视野太窄,根本看不到一百万个碱基之外的远端开关; 要么分辨率太粗,看得见远处的全景,却分辨不出脚下一个字母的细微置换。 在湿实验室里做实验更不现实。 三十亿个碱基位置,每个位置有三种替换可能,九十亿个变异挨个筛查,人类根本等不起这个时间。
DeepMind 的破解思路彻底换了方向。 他们不再等病人拿着突变去门诊排队,也不等实验室逐个去碰运气。 他们直接用自研的序列到功能模型 AlphaGenome,在整个人类参考基因组 hg38 上,搞了一场史无前例的全基因组计算机饱和诱变。 这是一套混合神经网络架构。 它把擅长提取多尺度图像特征的 U-Net,和擅长捕捉超长距离关联的 Transformer 强行咬合在一起。 这让模型在跨越一百万个碱基对的超大视野下,依然死死锁住单碱基级别的高清分辨率。 它同时推演转录组、染色质可及性、组蛋白修饰等十一种基因调控维度。 机器没有停留在猜测蛋白质结构。 它在硅基世界里,把整个人类基因组的九十亿种单字母变异,以及上亿个基因插入与缺失,全部预先模拟了一遍。 整整 1 个 PB 的庞大矩阵被直接算了出来。 每一个变异,都附带了跨越数百种人类和不同组织细胞的平均两万七千个分子预测标量。
可是,整整 1 个 PB 的生冷矩阵,一个一线医生怎么看得懂? 总不能在病床前翻几百页的原始张量。 这就是系统里的关键齿轮:AlphaGenome 变异影响评分,也就是 AVI 分数。 这套系统把复杂的调控预测、进化保守性以及蛋白质功能丧失指标,直接浓缩成每个变异专属的一个综合分值。 更关键的是,它给每个分值都配上了归因解释。 它会明确告诉研究者:这个变异之所以危险,是因为它破坏了剪接位点,还是打碎了转录因子结合的基序。
这套预计算的字典,到底准不准? 外部顶尖机构拿到数据后,立刻做了残酷的实战检验。 波士顿博德研究所 Broad Institute 的 Laura Covill 和 Anne O’Donnell-Luria,在未解罕见病项目里排查一例难治性癫痫性脑病患儿。 长期以来,所有常规测序都找不到病因。 当他们用 AVI 分数扫描全基因组时,一个位于 DNM1 基因深部内含子里的未知变异,瞬间被标上了最高危险预警。 AlphaGenome 给出了冷峻的分子归因: 这个深藏在非编码垃圾区里的单个字母替换,在脑组织中制造出了一个隐蔽剪接位点。 它诱导细胞的剪接机器把一段多余的代码缝进了信使 RNA,让神经蛋白平白多出了十三个氨基酸,毁掉了蛋白功能。 随后的细胞功能筛选,精准印证了机器的推演。 困扰医学界多年的未解悬案,就这么被一个预计算的数字给敲开了。
在英国埃克塞特大学,Gareth Hawkes 调取了英国生物样本库 UK Biobank 中五万四千多名参与者的全基因组数据。 借助这套预计算图谱,团队把非编码区突变与血液循环蛋白之间的关联检出率,一口气提升了百分之二十二。 他们顺藤摸瓜锁定了与衰老密切相关的 PLA2G7,以及掌管细胞氧气感知的 EGLN1。 单单挑出模型预测最具破坏性的前百分之一非编码突变,就在人类基因组上锁定了十九个与身体质量指数相关的全新调控靶区。
这是否意味着生命密码已经被彻底终结? 技术论文里划出了极其清晰的红线。 这台机器目前仍然存在明显的盲区: 非多聚腺苷酸化的核糖核酸未被覆盖,部分小众细胞类型的训练数据依然缺失。 DeepMind 在免责声明里反复强调: 它是一份辅助研究的分子效应图谱,绝对不能作为临床诊断的独立判据。
但它彻底改写了人类探索生物学的底层范式。 过去一个世纪,我们探索生命如同在茫茫黑夜的大海里打捞针头。 每碰到一个突变,都要耗费数年时间在培养皿里盲目试错。 如今,整整九十亿个字母可能引发的惊涛骇浪,被提前浓缩进了一张可以随时检索的数字地图里。 人类第一次不再盲目等待未知的变异降临。 在疾病暴发之前,生命总控制台上的每一个开关,已经被提前放到了聚光灯下。
引用 / CITATIONS
No citations exported.
同领域解读 / BIO & MEDICINE
导出 / EXPORT
订阅 · SUBSCRIBE
每周一封科技与 AI 深度解读,周一发出。不受审查,带出处,可核查。