DeepMind发布AlphaGenome Atlas:预测人类基因组90亿种单碱基变化的可能影响
新数据集覆盖100万个字母长度的DNA读取,规模超AlphaFold数据库30倍,并在癫痫病例中帮助锁定此前难以诊断的致病变异。
AI解读:DeepMind这次把问题反过来解决了:以前想知道某个基因变异有没有影响,得一个个去查AI模型,现在他们直接把人类基因组里大约90亿种单碱基变化的预测结果全部算好、存好,做成一个开放的研究工具。
这个工具真正有价值的地方在于,它覆盖了基因组里98%不编码蛋白质的区域。过去我们很难读懂这些区域的变化,而大多数疾病相关的变异恰恰藏在这里。现在每个变异平均附带约2.7万个预测值,能告诉你它到底影响哪个组织的基因开关,还是改变了基因剪接。
对于科研人员来说,这相当于把搜索范围大幅收窄。文章里的癫痫病例就是一个例证:一个孩子测了全基因组都没找到病因,用这个图谱把候选基因排到最前面,再结合预测的机制,才最终锁定了过去在血液样本里查不出来的脑特异性变异。
不过得说清楚:这是研究工具,不是诊断工具。DeepMind自己也强调,它只能作为证据链的一环。而且评估模型训练用的是一种间接方法(把人群里罕见的变异当作可能有害),虽然测试表现不错,但天然有局限。真要用于临床判断,还得靠医生和实验验证。
Google DeepMind发布了AlphaGenome Atlas,一个预测人类基因组中约90亿种可能单碱基变化影响的数据库。据The Decoder报道,该数据集规模达1 PB,是AlphaFold蛋白质结构数据库的30倍以上,基于2025年推出的AI模型AlphaGenome构建。
模型与预测内容
AlphaGenome模型每次读取100万字母长度的DNA序列,预测基因被读取的强度、调控蛋白能否结合DNA,以及基因转录本的剪接方式。此前,用户需要逐个查询单个变异的预测结果,而现在这些结果已预先计算完成。
根据论文,每个变异平均附带约27,000个预测值。该工具对基因组中约98%非编码蛋白质的区域意义最大。这些区域像开关和旋钮,决定基因在不同组织中的活性时间,是多数疾病相关变异所在之处,也是最难解读的部分。
简化评分AVI与局限
为便于日常使用,DeepMind开发了AlphaGenome Variant Impact Score (AVI),将数千个预测值归结为单一数字。AVI结合AlphaGenome预测、蛋白质模型AlphaMissense及两个衡量DNA位点跨进化保守性的指标,使用18个输入特征,相比基准工具CADD(150多个特征)更精简。
由于几乎没有任何变异能确定是否有害,团队使用间接方法训练:将群体中极罕见的变异视为可能有害,常见变异视为可能无害,因为有害突变传代较少。论文称,尽管训练间接,在已临床分类的变异测试中,AVI超越了现有工具,尤其在非编码区域表现更好。
AlphaGenome存在局限:它不了解所有细胞类型,且无法捕捉通过其他调控蛋白数量产生的效应。DeepMind表示,图谱和AVI属于研究工具,只能作为诊断证据链中的一环。
应用案例与可用性
GREGoR联盟的一个案例展示了实际用途。一名患有严重癫痫的儿童在基因组测序后仍未获诊断。AVI将DNM1基因中此前归类为意义不明的变异推至候选列表首位,AlphaGenome预测也提供了机制:该变异在剪接过程中产生错误位点,使蛋白质增加13个氨基酸。
这仅发生在只在脑中表达的基因版本中,因此此前的血液样本检测未发现问题。实验室实验证实了预测,专家建议将其归类为可能致病。回溯联盟其他已解决案例,AVI在29.5%的病例中将致病基因排在前50位,而CADD为12.5%。
图谱还支持群体研究。埃克塞特大学Gareth Hawkes利用图谱在54,000多名英国生物银行参与者的数据中,仅分组预测行为一致的变异,比传统筛选方式多发现22%的非编码变异与血液蛋白水平关联。此外,预测结果还衍生了2,601个重复出现的短DNA序列模式,即调控蛋白结合的基因组“词汇”。