---
id: "mb-20260908-0a344f"
kind: "deep"
title: "人类把自己的 30 亿个基因字母全测出来了，结果发现 98% 根本看不懂"
topic: "人类把自己的 30 亿个基因字母全测出来了，结果发现 98% 根本看不懂"
source_type: "generated"
status: "published"
generated_at: "2026-09-08 17:14:08"
frame_type: ["全突变预计算查表化", "机制"]
legal_anchor_count: 0
transcript_citation_count: 0
---

# 人类把自己的 30 亿个基因字母全测出来了，结果发现 98% 根本看不懂

人类把自己的 30 亿个基因字母全测出来了，结果发现 98% 根本看不懂。
既然看不懂，人为什么还能活着？
因为剩下的那 2%，才是造蛋白质的。
骨头、肌肉、血管、内脏，全靠这 2% 的图纸造出来。
至于剩下的 98% 呢？
过去几十年的医学教科书，给它起了一个简单粗暴的名字：垃圾 DNA。
垃圾能占九成八？
怎么可能。
那 98% 根本就不是垃圾。
那是整套生命系统的控制电网。
那 2% 的图纸出问题，很好查。
零件尺寸写错了，造出来的蛋白质就会畸变，在显微镜下就能测到。
但如果在 98% 的控制电网里，一个字母变了呢？
没有任何蛋白质畸变。
但某个关键基因，可能在神经元发育到第 3 个月的时候，突然被按下了静音键。
或者在人活到 40 岁的时候，某个致癌开关被悄悄拧开。
一线医生拿患者的血液去做全基因测序，只能看到满屏幕的变异字母。
能不能把这些未知变异，一个个在实验室里测出来？
算一笔账就绝望了。
人类基因组有 30 亿个字母。
每个位置有 3 种变异的可能。
相乘一下，整整 90 亿种单字母突变。
就算把全世界所有的分子生物学实验室拉过来，挨个在细胞里做诱变实验，花上几百年、砸进几百亿美金，也根本测不完。
这就是为什么无数罕见病患者做完全基因测序，拿到的诊断报告上全是八个大字：意义未明的变异。
医生知道孩子病了，也知道基因里有变异，但就是不知道哪一个字母才是真凶。
这个死结怎么解？
Google DeepMind 刚刚干了一件很绝的事。
它不等实验室慢慢做实验了。
它直接用 AI，把人类基因组里全部 90 亿种可能的单字母突变，在硅基里从头到尾预演了一遍。
整整 90 亿个突变，全部分析完毕。
预测出来的分子效应，做成了一个 1PB 容量的开源数据库：AlphaGenome Atlas。
1PB 是什么概念？
名震全球、破解了几乎所有已知蛋白质结构的 AlphaFold 数据库，数据规模还不到它的三十分之一。
它到底是怎么算出来的？
核心是今年年初发表在《自然》杂志上的基础模型 AlphaGenome。
以前的算法，视线只能覆盖几十或者几百个字母的局部。
但在非编码区，一个控制开关可能在一百万个字母之外，通过 DNA 链条的三维折叠，跨越遥远距离去控制另一个基因。
AlphaGenome 把单次分析的视野，直接拉到了一百万个碱基对。
它不只看突变本身，它看的是这个突变会不会改变染色质的松紧、会不会破坏剪接信号、会不会让转录因子彻底无法结合。
为了让临床医生能直接查，DeepMind 把各个维度的分子破坏力，压缩成了一个直观指标：AVI 评分。
这个评分把非编码区的开关破坏，和编码区的蛋白质受损，统一折算成一个危险分值。
这套纯靠 AI 推演出来的东西，真的准吗？
Broad 研究所的研究员立刻拿去啃硬骨头。
他们手里有一批多年查不出病因的严重癫痫脑病患儿。
以前查外显子，2% 的蛋白质图纸完好无损；测全基因组，98% 的非编码区里全都是统计噪音。
研究员把数据放进这套系统。
算法直接在 DNM1 基因的非编码区，标出了一个罕见的高危突变。
模型直接给出了具体的物理过程：这个单字母突变制造了一个虚假的剪接位点，细胞在处理 RNA 时被误导，强行拼出了一段异常延长的畸形蛋白质。
研究团队回实验室做细胞实验验证，结果完全吻合。
困扰医学界多年的未解罕见病，就这样被揪出了物理机制。
群体遗传学也迎来了同样的冲击。
英国埃克塞特大学的学者 Gareth Hawkes，把这套图谱套到了英国生物样本库 5.4 万人的全基因组数据上。
以前因为罕见非编码变异的样本太少，做统计关联时全被当成背景噪音过滤掉了。
但把突变按照预测的分子效应分组之后，隐藏在噪音深处的有效遗传关联，直接多出了 22%。
与衰老相关的 PLA2G7 蛋白、控制细胞感知氧气的 EGLN1 蛋白，背后的调控突变全被定位了出来。
面对几亿个影响体重指数的复杂非编码变异，模型直接锁定了破坏力排名前 1% 的突变，把摸索范围缩窄到了 19 个具体区域。
看出这台机器颠覆了什么吗？
过去两百年，实验生物学的路径是正向试错：
临床发现病人，找到未知变异，然后科学家进实验室花几年时间猜它到底是干什么的。
绝大多数变异因为太耗时、太昂贵，只能永远躺在未解档案里。
现在，这个流程被彻底倒过来了。
它把大自然穷举给人类的 90 亿种突变可能性，在算力世界里全部预先算成了一本查表字典。
从“遇到病例再去猜机制”，变成了“先算出全部机制，等病例来查表”。
二十三年前，人类耗资三十亿美元、用了十三年时间，终于测出了人类基因组的全部字母。
但读出字母，不等于读懂生命的指令。
把 30 亿个字母印在纸上的前二十年，人类更像是一个刚学会按顺序辨认字母的孩子，茫然地捧着一本看不懂的天书。
从围棋的穷举，到蛋白质折叠，再到如今 90 亿个开关的分子推演。
当算力把生命底层的物理和化学规则暴力重构了一遍，那本被锁在 98% 黑暗里的天书，才算真正被翻开了第一行。

_Rendered by mubei-terminal._
