多智能体框架Bioinfoysis在生物信息学基准测试BixBench上准确率达 82.4%

该框架将每次请求视为持久化的、以产物为锚定的分析运行,通过结构化交接防止过时证据被重用,在四个底层语言模型上将SeqQA2平均准确率从 27.81% 提升至 64.13%。

AI解读:生物信息学任务通常周期长且结论依赖中间数据,但现有大语言模型智能体往往只追求最终答案,把规划、工具调用和代码执行当作临时步骤,导致结果难以追溯和验证。Bioinfoysis的解决思路是把每次请求变成一个持久化的分析运行,所有中间产物(脚本、表格、图)都被记录并与负责的智能体和规划步骤绑定,每次重新规划时通过结构化交接防止用过时的证据。基准测试数据显示,它在BixBench上达到 82.4% 的准确率,并在四个底层模型上将两个问答任务的平均准确率分别提升了约 36 个百分点和 28 个百分点,说明提升主要来自系统框架而非模型本身。对于从事生信分析和工具开发的读者,这意味着可以在不更换大模型的前提下通过更严格的流程控制来提升自动化分析的可靠性,尤其适合需要审计的科研或临床场景。不过,论文只报告了基准分数,没有给出速度或实际部署成本,所以是否适合大规模应用还需结合自身数据和工作流测试。

来自多家机构的研究者发布了一份技术报告(arXiv:2609.03871),介绍名为Bioinfoysis的多智能体框架,用于长周期生物信息学分析。该框架将每次请求建模为持久化的、以产物为锚定的分析运行,结合全局规划与逐步的、证据驱动的重规划,并在BixBench基准上取得 82.4% 的准确率。

Bioinfoysis如何保证证据有效性

报告指出,现有大语言模型代理系统大多专注于生成最终答案,将规划、工具调用和代码执行视为瞬时交互,这种设计难以适用于需要将结论与数据、计算和中间证据保持关联的长周期生物信息学任务。

Bioinfoysis的规划器维护一份可执行的检查清单,并根据每次工作执行后返回的结构化交接来修订未完成步骤。这些交接将中间结果绑定到负责的智能体、检查清单步骤和计划生成,从而防止重规划后过时证据被静默重用。

系统中设有一个受控运行时,在生成的脚本、表格和图形被用于下游分析或报告之前对其进行验证。此外,系统提供角色特定上下文、持久内存和受管制的生物信息学技能,以支持长分析轨迹上的可靠执行。

基准测试结果:四项模型与两个任务

研究者分别在BixBench和LAB-Bench 2的两个问答轨道(SeqQA2、DbQA2)上评估了Bioinfoysis。

在BixBench上,Bioinfoysis取得了 82.4% 的准确率,论文称其为当前最先进水平。

跨四个底层语言模型,Bioinfoysis将SeqQA2上的平均准确率从 27.81% 提升至 64.13%,将DbQA2上的平均准确率从 3.13% 提升至 31.25%。

论文总结认为,可靠的生物信息学自动化不仅取决于模型能力,还取决于治理规划、执行、记忆和证据流的框架。作者提到,该工作的演示网站可通过论文链接访问。

信息来源