SimpleDesign:直接在数据空间训练的蛋白质序列与结构联合生成模型

研究团队提出单阶段端到端训练的多模态蛋白质设计模型,在超200万序列-结构对上训练,并开发Mixture-of-Transformer架构处理两种模态。

AI解读:蛋白质设计通常分两步:先用自编码器把序列和结构压缩成潜在表示,再在这个表示上训练生成模型。SimpleDesign的团队认为这个多阶段流程并非必需,转而直接在原始数据空间用单一目标函数训练——序列用交叉熵,结构用回归。模型的核心是Mixture-of-Transformer架构,让两种模态各有专门的处理路径,但仍通过全局自注意力保持跨模态关联。对研究蛋白质工程和药物发现的人来说,这意味着少了一个需要调优的中间步骤,训练流程更简单,且论文称在超过200万对序列-结构上训练后,联合设计和无条件生成指标都不错。不过,实际效果能否应用到真实蛋白质设计,还要看独立复现和下游实验验证。

苹果机器学习研究团队(作者含Jiarui Lu, Yuyang Wang, Yizhe Zhang等)在论文中提出SimpleDesign,一个直接在数据空间训练的多模态蛋白质设计模型,跳过了常见的两阶段自编码器加潜在空间生成流程。该论文已发表于《Transactions on Machine Learning Research》(TMLR),2026年8月刊出。

信息来源