综述:机器学习辅助定向进化五年进展有限,多数方法忽略DNA合成成本

arXiv新论文回顾五年研究,指出多数机器学习辅助定向进化方法以“找到最优蛋白”为目标、忽略DNA合成成本,限制了实际应用。

AI解读:这篇arXiv论文解释了为什么机器学习没能像改变其他蛋白质工程领域那样改变定向进化:多数研究者追求的是“找到最优蛋白质”,而实际实验受时间和资源限制,只需要“找到够用的蛋白质”。作者Wittmann以DNA合成为例——几乎所有现有方法都不把合成成本算进优化目标,导致算法设计出的方案可能很好,但做一轮实验的成本太高,根本无法落地。对从事蛋白质工程、尤其是用ML辅助进化的团队来说,这意味着评估一个新方法时要看它是否把实验预算、合成费用这些现实约束纳入考量,而不只是模型精度。作者也指出近五年已有少数例外工作开始朝这个方向调整,老思路和重新定义目标并不冲突。

9 月 2 日提交至arXiv的论文(编号 2609.03046)回顾了过去五年机器学习辅助定向进化(MLDE)领域的发展,认为该领域进展有限的原因是研究目标与实际需求脱节。

目标错位阻碍应用

作者Bruce J. Wittmann在论文中提出,过去五年机器学习已推动许多蛋白质工程学科进步,但定向进化例外。他对自己早前合著的一篇观点文章进行了反思,认为一个主要原因在于:MLDE研究者的目标是“识别最优蛋白质”,而定向进化更广义的目标是“在时间和资源限制下识别足够的蛋白质”。

Wittmann以DNA合成成本为例,指出几乎所有现有MLDE方法都没有将这一成本纳入考量,导致无论底层模型能力多强,所提策略的实际适用性都有限。

  • 论文还讨论了近期该总体趋势之外的例外工作,强调过去五年ML辅助蛋白质工程工作与重新定义MLDE目标并不相互排斥。

信息来源