苹果公开 SimpleDesign:端到端完成蛋白质序列与结构协同设计
苹果研究团队发布 SimpleDesign 模型,跳过先训练分词器、再训练生成模型的多阶段流程,直接基于超过 200 万个序列与结构配对做端到端训练,在协同设计、结构生成与序列生成基准上取得有竞争力的结果,但目前仅限计算评估。
作者:核流编辑 · 栏目:系统
苹果研究人员公布了新模型 SimpleDesign,把去年 SimpleFold 那套用通用架构替代复杂专用设计的思路,从蛋白质结构预测推进到了蛋白质设计:同时生成氨基酸序列和对应的三维结构。 现有蛋白质协同设计模型大多分两段训练:先训练自编码器把结构压成潜空间里的离散表示,再在这一表示上训练生成模型。SimpleDesign 省掉中间层,直接在数据空间里端到端训练,学习对象是成对的氨基酸序列与三维坐标。相比两段式流程需要的分词与潜空间对齐,这条路径的额外训练环节更少。 训练方式与验证边界 论文给出的训练语料超过 200 万个序列与结构的配对,主要来自 AFESM 数据集(由 AlphaFold 数据库的预测结构加额外样本组成)。训练时同时遮盖序列中的氨基酸、给结构加噪声,并调整两侧破坏程度:序列基本完整、结构破坏严重时,任务接近折叠预测;结构基本完整、序列大面积遮盖时,接近反向折叠;两边都部分破坏时,模型学的就是协同设计。论文称 SimpleDesign 在协同设计、结构生成与序列生成三类基准上都有竞争力,生成的序列质量不逊于多数多模态竞品。 边界也很明确:所有结果都停在计算评估层面,生成的蛋白质没做过实验测试,能否真实折叠、具备功能或安全性,目前都没有实验结论。研究团队强调,这些数字是计算基准上的表现,不构成对真实生物系统行为的结论;论文的架构、训练细节与基准结果都已公开,可按文末链接查阅。 参考资料 Apple Machine Learning Research:SimpleDesign: A Joint Model for Protein Sequence and Structure Codesign 9to5Mac:Apple researchers unveil SimpleDesign, a new AI model for protein design