测出一个人完整的基因组序列,现在只要几百美元
测出一个人完整的基因组序列,现在只要几百美元。 但拿到那张写满 30 亿个字母的化验单,全世界最好的遗传学家也只能摇头。 因为其中整整 98% 的内容,人类根本不知道是干什么用的。 过去三十年,生物学界管这 98% 叫“垃圾 DNA”,或者叫基因暗物质。 能看懂的,只有剩下的 2%。 那是负责编码蛋白质的区域。 四年前拿下诺贝尔奖的 AlphaFold,解决的就是这 2% 的蛋白质三维结构。 那剩下的 98% 呢? 它们不制造蛋白质,也不直接构成细胞骨架。 难道大自然真在每个人的细胞核里塞满了无用的冗余? 答案恰恰相反。 如果那 2% 的蛋白质是零件,这 98% 就是整台机器的操作系统。 它布满了启动子、增强子和剪接位点,控制着所有零件的开关: 哪个基因在什么时候启动,在心肌细胞还是脑神经表达,开启三分钟还是开启一整天。 人类绝大多数复杂疾病、罕见病,以及衰老和代谢异常,出问题的开关几乎全藏在这 98% 里面。 既然开关都在这里,为什么过去三十年解不开? 因为试错成本是无穷大。 人类基因组有 30 亿个碱基对,每一个位置换成另外三种碱基,对应 90 亿种单字母突变。 要靠湿实验室一个位点一个位点做细胞敲除和功能验证,把全世界科学家的寿命加在一起也做不完。 病人去医院查出非编码区突变,临床报告单上往往只能印下一行字:意义未明的变异。 这是遗传学里最绝望的草堆捞针。 Google DeepMind 拿出来的解法极其暴力。 他们没有等病人一个个得病再去化验。 他们用算法把人类基因组里全部 90 亿种可能的单字母突变,全量预计算了一遍。 这就是今天上线的 AlphaGenome Atlas。 一个整整 1PB 体积的全基因组突变效应图谱。 这个数据库的体量,是当年 AlphaFold 蛋白质数据库的三十多倍。 把 90 亿个突变算一遍,怎么让临床医生用得上? AlphaGenome 对每一个突变都会输出上万个分子调控预测。 如果直接扔给医生一万个生化指标,跟不给没有任何区别。 DeepMind 的核心动作,是把这上万个维度的生化预测压缩成一个数字:AVI 分数。 它把 AlphaGenome 预测非编码区调控的能力,和 AlphaMissense 预测蛋白质突变的能力融合成一个综合指标。 分数越高,代表这个单字母变异对分子功能的破坏越大,致病概率越高。 90 亿个突变的庞大草堆,被这个分数直接排出了优先级。 除了给数字,系统还把这个分数背后的机制拆开展示。 它会标明到底是因为破坏了剪接位点,改变了染色质的可及性,还是打碎了转录因子的结合基序。 它指出哪里坏了,也把零件卡死的过程一并写明。 这套前置计算在真实世界里好不好用? 学术界给出了两份验证证据。 第一份是罕见病突破。 布罗德研究所(Broad Institute)联手罕见病联盟 GREGoR,重新筛查久未确诊的儿童脑病患者。 他们用 AVI 分数去排查以往被忽略的非编码突变,立刻锁定了 DNM1 基因的一个微小变异。 这个基因直接关联小儿癫痫性脑病。 过去临床测序之所以漏掉,就是因为这个变异藏在非编码区。 AlphaGenome 准确算出了它会诱导出一个错误的剪接位点,导致后续蛋白质异常拉长。 实验室随后进行的分子筛查,证实了这个推论。 原本无解的致病位点,在算法库里直接对号入座。 第二份证据来自群体遗传学。 英国埃克塞特大学的霍克斯(Gareth Hawkes)博士,把图谱套进英国生物样本库(UK Biobank)5.4 万人的全基因组测序数据中。 在过去,海量良性突变形成的统计噪音,会彻底盖过罕见致病变异的微弱信号。 霍克斯用图谱的分子预测对数据进行分层,直接多找出了 22% 以前根本无法被检出的非编码遗传关联。 顺着这些信号,团队锁定了控制衰老相关蛋白 PLA2G7 和氧气感知蛋白 EGLN1 的调控开关,并定位了与体重指数相关的 19 个关键遗传区域。 从下围棋的 AlphaGo,到预测蛋白质结构的 AlphaFold,再到今天标注 90 亿个突变的 AlphaGenome。 背后的科学范式彻底变了。 过去生物学研究是先有患者、再猜假设、再耗费几年去湿实验里盲人摸象。 现在是把整个系统的所有可能状态提前算透,做成一张带索引的完整坐标图。 大自然留在人类基因组里的密码依然复杂。 但这本 30 亿字母的生命之书,第一次有了一份标注着每一处印刷错误后果的详尽勘误表。
引用 / CITATIONS
No citations exported.
同领域解读 / BIO & MEDICINE
导出 / EXPORT
订阅 · SUBSCRIBE
每周一封科技与 AI 深度解读,周一发出。不受审查,带出处,可核查。