DuaDeep-SeqAffinity:仅用氨基酸序列预测抗体-抗原结合亲和力,无需三维结构

该序列模型在AbRank基准上达到 0.683 的Pearson相关和 0.895 的排序AUC,显著优于单分支消融模型。

AI解读:传统上预测抗体与抗原的结合强度,往往需要解析蛋白质的三维结构,这一过程既昂贵又耗时,很多蛋白质难以结晶,限制了高通量筛选。DuaDeep-SeqAffinity提出只用氨基酸序列就能完成预测,把抗原和抗体的重链、轻链作为三条独立输入,分别用冻结的ESM-2语言模型嵌入,再经过Transformer和CNN并行分支后融合,目的是保留CDR区等局部关键信号。在序列不重叠的AbRank数据划分上,模型的Pearson相关为 0.683,排序AUC为 0.895,且优于单分支版本。这意味着抗体筛选的人员无需等待结构解析,直接对有序列的候选抗体进行预筛,加快先导抗体发现。但要注意,性能数字来自AbRank基准及其特定划分,实际应用效果可能因数据而异,最终仍需湿实验验证。

arXiv论文(编号 2512.22007)介绍了一种名为DuaDeep-SeqAffinity的序列深度学习方法,可直接从抗体和抗原的一级氨基酸序列预测结合亲和力,不需要已解析的三维结构。

模型在AbRank基准的序列非重叠划分上取得Pearson相关 0.683、R² 0.460、配对排序AUC 0.895,据论文称显著优于单分支消融版本(配对t检验,p < 0.05)。

三流解耦设计

抗原与抗体重链、轻链被处理为三个独立流,每条流用冻结的ESM-2蛋白质语言模型嵌入,再分别通过并行的Transformer和卷积神经网络分支,最后进行后期融合。

该论文将该解耦设计描述为旨在保留局部互补决定区(CDR)信号,而单一编码器可能稀释这些局部信息。

评估与解释性分析

注意力图和基于梯度的显著性分析显示,模型优先关注CDR环和候选表位残基。

论文据此认为该方法可作为一种可扩展、无结构要求的高通量抗体筛选工具,但这些结论基于论文作者在arXiv摘要中的描述。

信息来源