把人类基因组里每一个可能的单碱基改动都预先算了一遍:DeepMind 发布 1PB 的 AlphaGenome Atlas

9 月 8 日,Google DeepMind 发布 AlphaGenome Atlas:用 2025 年的 AlphaGenome 模型,把人类基因组中全部 90 亿种单核苷酸变异的分子影响预先算完,产出约 1PB 数据,体量是 AlphaFold 数据库的 30 多倍(人类基因组约 30 亿个碱基对,每个位置有三种可能的替换),另外还覆盖了 1 亿多个已观察到的短插入与缺失。配套推出 AVI 分数,把 AlphaGenome 与 AlphaMissense 的输出合成一个同时覆盖编码区与非编码区的统一扰动排序,并附特征归因和 2500 多个 motif 解释高分从何而来。早期验证由 Broad Institute、埃克塞特大学和 Stowers Institute 参与:找到一个已验证的 DNM1 剪接变异,并在 5.4 万多份 UK Biobank 基因组中多找出 22% 的非编码关联。非商业网页门户免费开放,API 在 GitHub 上,商业使用走 Google Cloud「即将推出」且未公布价格;官方明确该输出不替代专业医疗建议、未获批临床使用。

变化不在精度,在于把模型换成了查表

模型本身不是新的——AlphaGenome 去年就发布了。这次做的事是把它跑完:不等研究者提问,先把所有可能的问题算一遍存起来。 这条路 DeepMind 走过一次。AlphaFold 数据库把蛋白质结构预测从「你得自己跑」变成「你直接查」,之后的用法就不一样了。基因组这边的摩擦更明显:一位外部研究者的评价是 AlphaGenome 是这个领域领先的模型,但「非常慢、非常吃算力」。也就是说,能不能用它此前很大程度上取决于你有没有算力。Atlas 把这道门槛移到了 Google 这边,顺带也省掉了全世界重复跑同一批模拟的浪费。 每个变异给出的不是一个数,而是数千项预测——从影响附近基因在哪些组织里表达,到 DNA 折叠之后的染色质形态。

AVI 分数解决的是「看不过来」

预测多了会有新问题:一个变异对应几千个数据点,研究者根本排不出优先级。AVI 分数是为这个设的——把 AlphaGenome 和 AlphaMissense 的输出合成一个统一的扰动信号,编码区和非编码区放在同一把尺子上比,附带特征归因和 2500 多个 motif 说明为什么这个变异分高。 非编码区那部分是重点。过去的变异解读工具在编码区做得比较成熟,非编码区一直是弱项,而 UK Biobank 那组结果——5.4 万多份基因组里多找出 22% 的非编码关联——正好落在这个弱项上。DNM1 那个剪接变异则是另一类证据:已被验证的罕见病相关变异,说明它在具体病例上也能定位到东西。

该怎么用它,以及别怎么用

先说边界,官方自己写得很清楚:输出不能替代专业医疗建议,未获批用于临床。这不是免责套话——Atlas 给的是**预测**和**排序**,不是实验证据,也不是诊断。合理的用法是拿它做筛选和优先级排序,把有限的湿实验资源投到最可能有结果的变异上,之后仍然要做验证。 再说可及性的另一半。非商业网页门户免费,API 在 GitHub 上,还做成了 Google Antigravity 的 agent skill;但商业使用要走 Google Cloud,「即将推出」,价格没公布。对学术实验室这是一份直接可用的公共资源,对想把它嵌进产品的公司,最关键的那个数字还没出来。这也是 AlphaFold 数据库那套打法留下的老问题:免费的是查表,收费的往往是把查表接进你自己的流程。

via: Google DeepMind 官方博客Nature 报道IEEE Spectrum 报道MarkTechPost 技术解读