DeepMind 把 SynthID 水印做进 AI 设计的蛋白质:合成出来的分子照样能结合靶点,也照样能被检出

Google DeepMind 于 9 月 30 日发布 SynthID Bio,把原本用于图片、音频和文本的 SynthID 水印扩展到合成生物学,相关论文《Function-preserving watermarking of AI-generated proteins》同日发表于《Nature》。它的做法是:在设计蛋白质序列时轻微引导氨基酸的选择,在预测三维结构时微调原子坐标,从而嵌入一个肉眼和常规分析看不出、但可用授权软件检测的统计信号。团队用 AlphaProteo 配合加了水印的 ProteinMPNN 设计结合蛋白,委托 Adaptyv Bio 做湿实验,针对 VEGF-A、新冠病毒刺突蛋白受体结合域和 PD-L1 三个靶点测试,带水印设计在命中率、结合亲和力和序列多样性上与无水印版本相当,DeepMind 称这是首批带水印且具备生物功能的蛋白结合剂。序列水印在蛋白质被实际合成后仍可检测;结构水印则通过微调 AlphaFold 3 的扩散网络写进模型权重,只作用于预测坐标。DeepMind 还与斯坦福大学和 Arc Institute 合作,把水印加进 Evo 2 设计的噬菌体基因组,早期培养实验显示噬菌体仍有功能。代码、权重和实验数据已向研究者开放。

为什么蛋白质需要水印

DNA 合成公司把客户提交的序列变成真实分子之前,会拿它去比对已知病原体和毒素的数据库。这套筛查默认一个前提:陌生的序列多半来自尚未研究过的天然生物。AI 蛋白设计打破了这个前提,它能做出和任何已知序列都不像、功能却可能相近的分子。

SynthID Bio 给出的思路是:与其试图证明一条陌生序列是安全的,不如让守规矩的模型给自己的产出签个名。筛查方检测到水印,就知道这条序列来自一个内置了安全措施的模型;公共数据库收录时,AI 设计的条目也能自己「报出身份」,不会被误当成天然序列,污染后续研究。

难点在于不能改坏功能

图片上的水印改几个像素无伤大雅,蛋白质改一个氨基酸就可能折叠失败。这次论文最重要的结果,是在三个真实靶点上用湿实验证明:加了水印的结合蛋白,结合能力和不加水印的几乎一样。

需要分清两种水印:序列水印跟着分子走,蛋白质合成出来后仍能测;结构水印只存在于预测出来的三维坐标里,真实的蛋白质分子在溶液中不断运动,不会保留一组固定坐标,所以合成后就无从检测。

它管不住的情况

DeepMind 自己把它定位为概念验证,也是多层防护中的一层,而不是解决方案。它只能标记主动使用水印的模型的输出:有人换用不带水印的模型,或者对序列重新设计,水印就可能消失;没有水印也不能说明一条序列是天然或安全的。要真正用于 DNA 合成筛查和数据库,还需要合成公司、数据库和模型开发方协调采用标准。

边界说明:实验结果来自 DeepMind 博客与《Nature》论文;噬菌体实验为早期结果;开源各部分的具体许可以官方仓库为准。

via: Google DeepMind 官方博客、Google 官方博客、Nature 论文、Nature 新闻