{"id":"mb-20260908-0a344f","kind":"deep","title":"人类把自己的 30 亿个基因字母全测出来了，结果发现 98% 根本看不懂","summary":"人类把自己的 30 亿个基因字母全测出来了，结果发现 98% 根本看不懂","body":"人类把自己的 30 亿个基因字母全测出来了，结果发现 98% 根本看不懂。\n既然看不懂，人为什么还能活着？\n因为剩下的那 2%，才是造蛋白质的。\n骨头、肌肉、血管、内脏，全靠这 2% 的图纸造出来。\n至于剩下的 98% 呢？\n过去几十年的医学教科书，给它起了一个简单粗暴的名字：垃圾 DNA。\n垃圾能占九成八？\n怎么可能。\n那 98% 根本就不是垃圾。\n那是整套生命系统的控制电网。\n那 2% 的图纸出问题，很好查。\n零件尺寸写错了，造出来的蛋白质就会畸变，在显微镜下就能测到。\n但如果在 98% 的控制电网里，一个字母变了呢？\n没有任何蛋白质畸变。\n但某个关键基因，可能在神经元发育到第 3 个月的时候，突然被按下了静音键。\n或者在人活到 40 岁的时候，某个致癌开关被悄悄拧开。\n一线医生拿患者的血液去做全基因测序，只能看到满屏幕的变异字母。\n能不能把这些未知变异，一个个在实验室里测出来？\n算一笔账就绝望了。\n人类基因组有 30 亿个字母。\n每个位置有 3 种变异的可能。\n相乘一下，整整 90 亿种单字母突变。\n就算把全世界所有的分子生物学实验室拉过来，挨个在细胞里做诱变实验，花上几百年、砸进几百亿美金，也根本测不完。\n这就是为什么无数罕见病患者做完全基因测序，拿到的诊断报告上全是八个大字：意义未明的变异。\n医生知道孩子病了，也知道基因里有变异，但就是不知道哪一个字母才是真凶。\n这个死结怎么解？\nGoogle DeepMind 刚刚干了一件很绝的事。\n它不等实验室慢慢做实验了。\n它直接用 AI，把人类基因组里全部 90 亿种可能的单字母突变，在硅基里从头到尾预演了一遍。\n整整 90 亿个突变，全部分析完毕。\n预测出来的分子效应，做成了一个 1PB 容量的开源数据库：AlphaGenome Atlas。\n1PB 是什么概念？\n名震全球、破解了几乎所有已知蛋白质结构的 AlphaFold 数据库，数据规模还不到它的三十分之一。\n它到底是怎么算出来的？\n核心是今年年初发表在《自然》杂志上的基础模型 AlphaGenome。\n以前的算法，视线只能覆盖几十或者几百个字母的局部。\n但在非编码区，一个控制开关可能在一百万个字母之外，通过 DNA 链条的三维折叠，跨越遥远距离去控制另一个基因。\nAlphaGenome 把单次分析的视野，直接拉到了一百万个碱基对。\n它不只看突变本身，它看的是这个突变会不会改变染色质的松紧、会不会破坏剪接信号、会不会让转录因子彻底无法结合。\n为了让临床医生能直接查，DeepMind 把各个维度的分子破坏力，压缩成了一个直观指标：AVI 评分。\n这个评分把非编码区的开关破坏，和编码区的蛋白质受损，统一折算成一个危险分值。\n这套纯靠 AI 推演出来的东西，真的准吗？\nBroad 研究所的研究员立刻拿去啃硬骨头。\n他们手里有一批多年查不出病因的严重癫痫脑病患儿。\n以前查外显子，2% 的蛋白质图纸完好无损；测全基因组，98% 的非编码区里全都是统计噪音。\n研究员把数据放进这套系统。\n算法直接在 DNM1 基因的非编码区，标出了一个罕见的高危突变。\n模型直接给出了具体的物理过程：这个单字母突变制造了一个虚假的剪接位点，细胞在处理 RNA 时被误导，强行拼出了一段异常延长的畸形蛋白质。\n研究团队回实验室做细胞实验验证，结果完全吻合。\n困扰医学界多年的未解罕见病，就这样被揪出了物理机制。\n群体遗传学也迎来了同样的冲击。\n英国埃克塞特大学的学者 Gareth Hawkes，把这套图谱套到了英国生物样本库 5.4 万人的全基因组数据上。\n以前因为罕见非编码变异的样本太少，做统计关联时全被当成背景噪音过滤掉了。\n但把突变按照预测的分子效应分组之后，隐藏在噪音深处的有效遗传关联，直接多出了 22%。\n与衰老相关的 PLA2G7 蛋白、控制细胞感知氧气的 EGLN1 蛋白，背后的调控突变全被定位了出来。\n面对几亿个影响体重指数的复杂非编码变异，模型直接锁定了破坏力排名前 1% 的突变，把摸索范围缩窄到了 19 个具体区域。\n看出这台机器颠覆了什么吗？\n过去两百年，实验生物学的路径是正向试错：\n临床发现病人，找到未知变异，然后科学家进实验室花几年时间猜它到底是干什么的。\n绝大多数变异因为太耗时、太昂贵，只能永远躺在未解档案里。\n现在，这个流程被彻底倒过来了。\n它把大自然穷举给人类的 90 亿种突变可能性，在算力世界里全部预先算成了一本查表字典。\n从“遇到病例再去猜机制”，变成了“先算出全部机制，等病例来查表”。\n二十三年前，人类耗资三十亿美元、用了十三年时间，终于测出了人类基因组的全部字母。\n但读出字母，不等于读懂生命的指令。\n把 30 亿个字母印在纸上的前二十年，人类更像是一个刚学会按顺序辨认字母的孩子，茫然地捧着一本看不懂的天书。\n从围棋的穷举，到蛋白质折叠，再到如今 90 亿个开关的分子推演。\n当算力把生命底层的物理和化学规则暴力重构了一遍，那本被锁在 98% 黑暗里的天书，才算真正被翻开了第一行。","topic":"人类把自己的 30 亿个基因字母全测出来了，结果发现 98% 根本看不懂","frame_type":["全突变预计算查表化","机制"],"citations":[],"channel_note":"","identity_notice":"","source_type":"generated","status":"published","generated_at":"2026-09-08 17:14:08","legal_anchor_count":0,"transcript_citation_count":0}