为什么蛋白质需要水印
DNA 合成公司把客户提交的序列变成真实分子之前,会拿它去比对已知病原体和毒素的数据库。这套筛查默认一个前提:陌生的序列多半来自尚未研究过的天然生物。AI 蛋白设计打破了这个前提,它能做出和任何已知序列都不像、功能却可能相近的分子。
SynthID Bio 给出的思路是:与其试图证明一条陌生序列是安全的,不如让守规矩的模型给自己的产出签个名。筛查方检测到水印,就知道这条序列来自一个内置了安全措施的模型;公共数据库收录时,AI 设计的条目也能自己「报出身份」,不会被误当成天然序列,污染后续研究。
难点在于不能改坏功能
图片上的水印改几个像素无伤大雅,蛋白质改一个氨基酸就可能折叠失败。这次论文最重要的结果,是在三个真实靶点上用湿实验证明:加了水印的结合蛋白,结合能力和不加水印的几乎一样。
需要分清两种水印:序列水印跟着分子走,蛋白质合成出来后仍能测;结构水印只存在于预测出来的三维坐标里,真实的蛋白质分子在溶液中不断运动,不会保留一组固定坐标,所以合成后就无从检测。
它管不住的情况
DeepMind 自己把它定位为概念验证,也是多层防护中的一层,而不是解决方案。它只能标记主动使用水印的模型的输出:有人换用不带水印的模型,或者对序列重新设计,水印就可能消失;没有水印也不能说明一条序列是天然或安全的。要真正用于 DNA 合成筛查和数据库,还需要合成公司、数据库和模型开发方协调采用标准。
边界说明:实验结果来自 DeepMind 博客与《Nature》论文;噬菌体实验为早期结果;开源各部分的具体许可以官方仓库为准。