DNA通常被比喻为一本关于蛋白质合成乃至生命本身的说明书。部分DNA区域——即基因——负责编码蛋白质,但绝大多数DNA是非编码DNA,它们之中有些功能未知,有些则对基因活性的调控至关重要。这些调控元件的相互作用十分复杂,在不同细胞与组织中的效应也可能不同,有些还能影响基因组中距离很远的基因。不列颠哥伦比亚大学的基因组学家Carl de Boer指出,了解DNA变化如何影响这种调控“是理解大多数疾病的基础”。
因此,研究人员希望弄清人类基因组中每一种可想象的小型变异可能对基因调控产生什么影响。谷歌DeepMind为此开发了人工智能工具AlphaGenome,于2025年首次公布,并在今年1月发表Nature论文披露更多细节,同时以非商业用途形式公开模型。AlphaGenome能比较原始DNA序列和变异后的序列,预测变异可能对基因表达及其他调控活动产生的影响。但此前研究者需要自行挑选想测试的变异、编写代码并运行这个计算量很大的模型。
如今DeepMind提前完成了这项繁琐工作。9月8日,DeepMind宣布建成并公开发布AlphaGenome Atlas——一个利用AlphaGenome模型预先计算的在线数据库,覆盖参考人类基因组中全部90亿种可能的单碱基替换。Atlas为科学家提供了更容易使用的界面,无需编写代码或亲自运行AlphaGenome模型,并加入了备受期待的单数值影响评分功能,让用户一眼判断某个变异是否可能具有重要意义。
DeepMind科学副总裁Pushmeet Kohli表示:“理解我们的DNA是一项巨大挑战,理解这种生命语言可以解锁很多事物。”
不过AlphaGenome预测存在重要局限。许多疾病与多个遗传变异相关;尽管AlphaGenome会考察变异周围约100万碱基对的相对较长DNA片段,但一些被称为增强子的DNA序列可以在非常远的距离上调控基因,有时超出模型视野,其效应难以预测。DeepMind基因组学负责人Žiga Avsec表示,即便存在这些限制,Atlas仍可帮助科学家筛选可能性并优先安排用于验证预测的实验室实验,从而加速基础生物学、疾病研究和治疗开发。
不列颠哥伦比亚大学的de Boer没有参与DeepMind项目,近期还帮助建立了用于更好比较这类计算模型的框架。他说:“看起来他们为人们制作了一个有用的资源。”尽管他认为AlphaGenome是“该领域的领先模型”,但也指出它“非常慢且计算密集”。Atlas可以让没有最新硬件的人受益,也能减少许多人重复运行相同模拟的需要。该数据库对非商业研究免费开放,并可能进行商业授权。
整个参考人类基因组约有30亿个碱基对,每个位置有3种可能的单核苷酸替换,因此Atlas共包含90亿种变异,完整数据集约为1 PB。Avsec说,项目启动时“在计算上似乎不可能”,早期估算显示团队需要将计算速度提高80倍才能在合理时间内完成。为此团队综合运用模型蒸馏、GPU内核优化以及消除冗余计算等技术,才实现在这一规模上的突破。
AlphaGenome和Atlas建立在DeepMind多年工作之上:2020年AlphaFold从氨基酸序列预测蛋白质三维结构;2023年AlphaMissense预测了7100万种可能改变蛋白质的变异是良性还是致病。与Atlas相似,这两个项目的预测结果也都通过公共数据库开放。
科研人员可在Atlas中查询单个变异并查看模型的预测细节,包括11种不同类型的输出。但最醒目的是单数值影响评分,这一评分本质上是对预测中多个维度的简化。de Boer提醒,评分“有明显用处,但也很可能被轻易误读——我们谈论的是一个非常复杂的系统,牵涉很多变动因素。”