NVIDIA与Anthropic集成BioNeMo Agent Toolkit,在Claude Science中实现蛋白质结构预测

该工作流将MSA搜索、OpenFold3和Boltz-2容器化微服务接入Claude Science,使代理能够针对单体与复合物运行结构预测;两个模型在有MSA输入时接口置信度显著提高。

AI解读:这条新闻的关键在于:NVIDIA把自家的生物计算模型封装成AI代理能直接调用的技能,并与Anthropic的Claude Science打通。过去科学家要手动处理蛋白质结构预测中的多序列比对(MSA)、运行折叠模型、比对结果,每一步都可能因环境或API差异而卡住。现在代理能自动完成这些步骤,但真正重要的不是省事,而是结果可靠——测试案例中,没有MSA输入的复合物接口预测置信度(iPTM)在OpenFold3上从 0.85 跌到 0.14,Boltz-2上从 0.82 跌到 0.19,说明进化信息是模型预测蛋白质相互作用的基石。对结构生物学家而言,这意味着可以更快生成可验证的假设,但必须记住:这些是预测,不是实验证据;且部署需要至少约 700 GB存储空间和NVIDIA L40S或H100 GPU。当前只有少量工具被封装,适用范围有限,但若更多领域技能被加入,这类代理工作流可能成为实验室的标准分析工具。

NVIDIA与Anthropic合作,将NVIDIA BioNeMo Agent Toolkit集成到Anthropic的AI科学工作台Claude Science中,使AI代理能够发现、启动并调用BioNeMo NIM微服务,直接进行蛋白质结构预测。该教程由NVIDIA技术博客发布,作者Michelle Horton,发布日期未注明。

工作流与测试案例

本教程以Seh1蛋白(C1GY11)与其预测伙伴C1HCX1(来自Paracoccidioides lutzii真菌)为测试案例,该案例受Han、Tsenkov、Venanzi等人论文(bioRxiv, DOI: 10.64898/2026.03.27.714458)中Figure 4e启发。Seh1和Mio家族蛋白参与保守的营养感知机制。工作流包含三个阶段:使用MSA Search NIM为单链和物种配对序列生成多序列比对(MSA);使用OpenFold3 NIM预测单链和双链复合物;再用Boltz-2 NIM重复预测,并对每个模型独立评估。

教程中强调,MSA是关键输入。测试中,异源二聚体的接口预测置信度(iPTM)在使用MSA时OpenFold3为 0.85,Boltz-2为 0.82;不使用MSA时分别跌至 0.14 和 0.19,下降幅度为 0.72 和 0.63。五个样本紧密聚集(标准差 ≤ 0.006),表明差异一致。增加采样量(OpenFold3 diffusion_samples=5;Boltz-2五个样本、六次循环、200 步采样)不能替代进化信息的输入。此外,两种模型在给定比对时iPTM相差在 0.03 以内,显示了跨模型一致性。

  • OpenFold3对单体的预测也需要MSA:不含MSA时pLDDT从 82 降至 36;Boltz-2从序列单独折叠单体表现尚可(0.79 降至 0.73),但无法定位接口。

模型预测结果与验证

结构分析中,将Seh1从单体和复合物预测中叠加,核心Cα-RMSD在OpenFold3为 0.68 Å(313/384 残基),Boltz-2为 0.65 Å(307/384),显示伙伴蛋白并未重塑Seh1的WD40 β-螺旋桨结构,而是补全了其开口边缘。两个模型独立地将C1HCX1的 β-链簇(约残基 305-391)定位到Seh1的N端链(残基 1-29)和C端链(约残基 331-384),即WD40螺旋桨闭合的“魔术贴”位置,与论文中“三条 β 链”的观察一致。

教程明确警告,这些是预测结构,尽管两个独立模型收敛于同一局部几何形状,但C1GY11与C1HCX1的相互作用尚未经实验验证,不能视为真实生物学关联。该工作流的价值在于提供可复现、有证据支撑的假设生成方法。

  • 置信度指标应理解为模型内部的自信心:例如OpenFold3的复合置信度分数对单体重接口的权重较大,导致折叠良好的单体(pTM 0.82)在复合分数上仍可能得分偏低,仅在模型内比较,而不是跨模型比较。

部署要求与入门

教程部署需要一台带有NVIDIA L40S GPU或NVIDIA H100 GPU的工作站或云机器,并安装Claude Science。存储需求约为 700 GB:MSA Search NIM使用的UniRef30数据库约 490 GB(选择仅UniRef30配置文件,而非完整的 1.4 TB数据),Boltz-2和OpenFold3容器合计 30–40 GB。

在Claude Science中,用户选择“Customize > Compute > NVIDIA BioNeMo NIM > Connect”,从GitHub导入BioNeMo Agent Toolkit技能,添加NVIDIA API密钥,并连接本地端到端(使用主机GPU的Docker容器)。然后,代理根据提示下载并启动MSA Search、OpenFold3和Boltz-2的本地NIM容器,并对每个进行冒烟测试。

BioNeMo Agent Toolkit可在GitHub上获取,官方称其构建用于任何代理框架,内部基准显示BioNeMo技能将任务正确率从 60% 提高到 100%,并将token效率大致翻倍(该说法来自NVIDIA,属公司声明)。

  • 教程提供两个具体提示(prompt)示例,用于指导代理:一个用于创建MSA并保存元数据,另一个用于运行结构预测并保存所有置信度分数。

信息来源