Bioinfoysis 技术报告
摘要
Bioinfoysis 是一个用于生物信息学的多代理框架,它使用持久化运行和基于工件的执行,在像 BixBench 和 LAB-Bench 2 这样的基准测试中实现最先进的准确性。
arXiv:2609.03871v1 公告类型:新
摘要:大型语言模型代理在生物信息学中显示出潜力,但大多数现有系统主要专注于生成最终答案,将规划、工具使用和代码执行视为短暂交互。这种设计不适合长程生物信息学任务,其中结论必须与支持它们的数据、计算和中间证据保持连接。我们引入 \textbf{Bioinfoysis},一个多代理框架,它将每个请求表示为一个持久化、基于工件的分析运行。Bioinfoysis 结合了全局规划和逐步、证据驱动的重新规划:规划者维护一个可执行检查清单,并在每次工作者执行后使用结构化交接修订待定步骤。这些交接将中间结果绑定到其负责的代理、检查清单步骤和计划生成,防止在重新规划后静默重用过时证据。受控运行时在将生成的脚本、表格和图形用于下游分析或报告之前对其进行验证,而特定角色的上下文、持久内存和治理的生物信息学技能支持在长分析轨迹上可靠执行。我们在 BixBench 和 LAB-Bench 2 的两个问答轨道上评估了 Bioinfoysis。在 BixBench 上,Bioinfoysis 实现了 82.4\% 的最先进的准确性。在四种基础语言模型中,Bioinfoysis 在 SeqQA2 上将平均准确性从 27.81\% 提高到 64.13\%,在 DbQA2 上从 3.13\% 提高到 31.25\%。这些结果表明,可靠的生物信息学自动化不仅依赖于模型能力,还依赖于管理规划、执行、内存和证据流的框架。我们希望 Bioinfoysis 的出现能在生物信息学社区的发展中发挥驱动和领导作用。我们的演示网站可以在 https://report.bioinfoysis.com/ 查看。
查看缓存全文
缓存时间: 2026/09/04 06:13
# 内容来源:https://arxiv.org/html/2609.03871
**Bioinfoysis 技术报告**
DeepAutonomy 团队
![[无标题图像]](https://arxiv.org/html/2609.03871v1/figures/github.png)
https://report.bioinfoysis.com/
![[无标题图像]](https://arxiv.org/html/2609.03871v1/figures/hf-icon.png)
https://huggingface.co/datasets/ZhangxinMath/Bixbench-Verify
大型语言模型代理在生物信息学领域展现出潜力,但现有系统大多侧重于生成最终答案,将规划、工具使用和代码执行视为短暂交互。这种设计并不适用于长周期生物信息学任务,因为结论必须与支撑它的数据、计算和中间证据保持关联。
我们推出 **Bioinfoysis**,一个多代理框架,将每个请求表示为持久的、基于工件的分析运行。Bioinfoysis 结合了全局规划与逐步、证据驱动的重新规划:规划器维护一个可执行清单,并在每个工作器执行后使用结构化的交接信息来修改待处理步骤。这些交接信息将中间结果与其负责的代理、清单步骤和计划生成版本绑定,防止过时的证据在重新规划后被静默重用。
受控运行时在生成脚本、表格和图形用于下游分析或报告之前对其进行验证,同时角色特定的上下文、持久记忆和受管理的生物信息学技能为长时间分析轨迹上的可靠执行提供了支持。
我们在 BixBench 以及 LAB-Bench 2 的两个问答赛道上对 Bioinfoysis 进行了评估。在 BixBench 上,Bioinfoysis 使用 Kimi-K2.6 达到了 82.4% 的最高准确率,使用 GPT-5.4-API 达到 79.0%,使用 DeepSeek-V4 达到 77.0%,使其成为我们比较中最强的生物信息学代理之一。在 LAB-Bench2 的 SeqQA2 和 DbQA2 赛道上,跨四个底层语言模型,Bioinfoysis 将平均准确率从 27.81% 提升至 64.13% (SeqQA2),从 3.13% 提升至 31.25% (DbQA2)。
这些结果表明,可靠的生物信息学自动化不仅取决于模型能力,还取决于管理规划、执行、记忆和证据流的框架。
我们希望 Bioinfoysis 的出现能在生物信息学社区的发展中发挥驱动和引领作用。我们的演示网站可在 https://report.bioinfoysis.com/ 查看。
---
### 目录
1. [引言](#1引言)
2. [架构](#2架构)
1. [系统概述](#21系统概述)
2. [框架](#22框架)
1. [编排层:自适应规划与执行](#221编排层自适应规划与执行)
2. [科学能力与执行层:工具与技能引导的生物信息学分析](#222科学能力与执行层工具与技能引导的生物信息学分析)
3. [可观测性层:运行证据、跟踪与评估](#223可观测性层运行证据跟踪与评估)
3. [代理基础设施](#3代理基础设施)
1. [持久运行与受控执行](#31持久运行与受控执行)
2. [角色特定上下文与持久记忆](#32角色特定上下文与持久记忆)
3. [基于工件的执行](#33基于工件的执行)
4. [跟踪、审计与恢复](#34跟踪审计与恢复)
4. [评估](#4评估)
1. [基准测试套件](#41基准测试套件)
2. [主要结果](#42主要结果)
1. [Bixbench 基准测试](#421bixbench-基准测试)
2. [Labbench2 基准测试](#422labbench2-基准测试)
3. [消融研究](#43消融研究)
5. [结论、局限性与未来工作](#5结论局限性与未来工作)
1. [局限性](#51局限性)
2. [未来工作](#52未来工作)
3. [结论](#53结论)
6. [参考文献](#参考文献)
7. [附录 A:作者列表与致谢](#附录-a作者列表与致谢)
8. [附录 B:扩展评估细节](#附录-b扩展评估细节)
1. [Bixbench 上的扩展评估](#b1bixbench-上的扩展评估)
2. [LAB-Bench 2 上的扩展评估](#b2lab-bench-2-上的扩展评估)
---
## 1 引言

生物信息学已成为现代生物学研究的重要组成部分[1]。许多科学问题无法再通过直接检查实验测量来解答。研究人员必须通过计算分析将原始数据转化为证据。随着生物数据集的持续增长,这一分析过程正变得越来越长且难以管理。
主要困难并不总是缺乏合适的算法。在许多情况下,所需的统计方法和软件工具已经存在。困难在于如何在完整的分析中正确应用它们。每个决策都依赖于之前的步骤:对一列的解释决定了数据的处理方式;预处理过程决定了哪种统计模型是合适的;该模型的结果决定了可以得出什么生物学结论。因此,早期的小错误可能会影响整个分析,而不会使最终结果明显出错。
大型语言模型(LLM)和代理使这一瓶颈更加明显[2, 3, 4, 5, 6, 7]。一方面,它们可以编写代码、总结生物学概念、调用工具并推理文献。另一方面,生物信息学工作流暴露了在普通问答中容易忽略的失败模式:模型可能选择不兼容的软件包,或生成一份看似合理但其证据无法追溯到所执行脚本的报告。对于科学用途来说,这种区别至关重要。最终答案只有在用户能询问它是如何产生的、使用了哪些数据和工具、以及执行是否可在错误后恢复或审计时才有用。
因此,生物信息学需要的行为更像受管理的执行框架系统,而非聊天界面。近期生物医学代理已在这方面取得重大进展。通用生物医学代理在广泛的研究领域中整合了科学推理、工具使用、代码执行和数据库访问[8, 9, 1]。更专业的系统则专注于遗传扰动实验设计、基因集解释和多代理生物信息学辅助[10, 11, 12]。BioMedAgent 进一步研究了用于生物医学数据分析的自进化工具工作流[13]。与此同时,BioCoder、BixBench 和 BioAgent Bench 等基准测试已将评估从静态知识回忆转向可执行代码和多步分析[14, 15, 16]。这些工作建立了一个重要前提:生物信息学代理不应仅仅回答问题,而应在数据、工具和方法上运行。
然而,长周期生物信息学分析需要一个系统层,将这些能力贯穿于整个任务生命周期。该系统必须决定哪个代理应该下一步行动,并保存后续步骤所需的状态。它必须控制代码执行位置,并将生成的文件与正确的任务关联。它必须在分析过程中暴露进度和故障。它还必须保留足够的信息,以便在直接对话结束后检查、恢复和评估分析。
代理框架、工具协议和多代理通信标准为这一层提供了重要的构建模块[17, 18, 7, 19, 20],但它们本身并未定义如何组织一个完整的生物信息学分析。我们将这个外围系统称为 **生物信息学框架**。它是执行层,通过协调规划、代理路由、运行时状态、工具访问、工作空间、中间结果、工件和报告,将模型输出转化为受管理的科学过程。因此,系统的质量不仅取决于它是否返回正确答案,还取决于通往该答案的路径是否可以**执行、检查、恢复和验证**。
本报告介绍了 **Bioinfoysis**,一个用于长周期生物信息学分析的多代理生物信息学框架。给定一个自然语言目标和一组输入文件,Bioinfoysis 会创建一个持久运行,并将请求转换为可执行清单。Bioinfoysis 构建在多项能力之上,以支持这一长周期过程:
- **协调的多代理分析**:Bioinfoysis 围绕共享的清单和工作流状态组织分析。由于这些代理在相同的分析状态下运行,它们的输出贡献于一个连续的工作流,而非一系列独立的对话。
- **基于证据和技能引导的生物信息学执行**:Bioinfoysis 将生物学知识检索与可执行的生物信息学程序连接起来。在计算之前,代理可以搜索网络、查询科学资源,并使用检索增强生成来获取方法指导和生物学证据。在计算过程中,基础工具提供诸如检查文件、推断表结构、检查样本重叠、搜索数据库以及在沙箱中执行代码等操作。生物信息学技能[21]将这些操作组织成特定任务的分析程序。
- **角色特定上下文与持久记忆**:Bioinfoysis 为每个代理构建专注的上下文,而非将完整分析历史重复插入提示。它结合了最近的运行摘要、相关工件、结构化步骤结果和先前保留的事实,并根据代理的角色和当前清单步骤向其呈现不同的视图。长工具输出存储在可检索标识符后,允许提示使用摘要,同时保留对原始内容的访问。运行完成后,选定的结论、证据引用和工件会转换为结构化的长期记忆,并可在后续运行的相关任务中检索。
- **结构化交接与工件连续性**:完成清单步骤后,代理会生成结构化交接信息,包含其执行状态、主要结论、支持证据、引用、生成的工件和过程摘要。每个交接信息都与其负责的代理、相应的清单步骤以及生成该交接时完整计划的版本相关联。后续代理可以继续基于明确的结果和文件,而非从对话文本中重建之前的工作。当生成新的完整计划时,早期计划版本的记录不会作为有效结果返回给活动计划中的步骤。
- **基于跟踪的审计与评估**:每个 Bioinfoysis 运行都链接到一个结构化跟踪,记录模型和工具活动、执行状态、延迟、令牌使用、成本、检索摘要和对生成工件的引用。运行级审计记录进一步将最终答案与其输入文件、命令、技能、工具、输出和运行时环境连接起来。通过将这些跟踪与基准分数和自动评估器结合,Bioinfoysis 支持跨模型和框架配置的比较,并帮助将故障定位到分析的特定阶段。
我们在 **BixBench** 上评估了 Bioinfoysis,这是一个包含现实世界计算生物学场景的基准测试,要求代理探索数据集、执行多步分析并解释开放式生物学结果[15]。Bioinfoysis 使用 Kimi-K2.6 达到 82.4% 的准确率,使用 GPT-5.4-API 达到 79.0%,使用 DeepSeek-V4 达到 77.0%,使其在我们比较中成为最强的生物信息学代理之一。我们进一步在 LAB-Bench2 的 SeqQA2 和 DbQA2 赛道上评估了该系统。跨四个模型系列,Bioinfoysis 将 SeqQA2 的平均准确率从 41.65% 提升至 69.69%,将 DbQA2 的准确率从 3.13% 提升至 27.60%。这些跨模型和任务类型的持续改进表明,可靠的生物信息学性能不仅取决于底层 LLM,还取决于外围框架能否正确解释和路由任务、维护上下文和记忆、执行工具和技能、保存中间工件,并在生成答案前验证结果。
总之,我们的结果将 Bioinfoysis 定位为超越工具增强的语言模型:它为长周期生物信息学分析提供了持久且可检查的执行框架。通过将规划决策、计算操作、中间证据和最终结论连接在一个统一的运行记录中,Bioinfoysis 使复杂分析更易于验证、恢复和扩展。更广泛地说,这项工作表明,实现可靠的计算生物学 AI 系统的进步,将同样依赖于代理框架和科学执行基础设施的设计,以及基础模型本身的进步。
---
## 2 架构
### 2.1 系统概述
Bioinfoysis 是一个用于长周期生物信息学分析和科学报告生成的多代理框架。图 2 展示了 Bioinfoysis 框架。其目的不仅仅是将语言模型连接到一组工具。相反,它管理如何将开放式请求转换为计划、如何针对生物数据和外部证据执行该计划,以及如何将生成的计算组装成可以针对基础文件进行检查的报告。
每个请求都表示为一个具有明确输入、工作流状态、中间结果和最终交付物的持久运行。因此,主要系统对象是分析过程本身,而非最终的聊天消息[22, 23, 24, 25, 26, 27]。
该框架由三个相互作用的层组成:用于多代理规划和基于清单执行的**编排层**[28, 29, 30, 31];用于代理特定工具、生物信息学技能管理和隔离代码执行、工件验证的**科学能力与执行层**;以及用于跟踪、分析事实和**可观测性层**……相似文章
BixBench3:前沿AI智能体现在可以复现约48%的真实计算生物学研究工作流程
本文介绍BixBench3,一个用于评估AI代理在计算生物学任务上的基准,表明前沿LLMs可以复现约48%的真实研究工作流程,但在处理大型数据集和顺序步骤方面存在困难。
BioInsight: 交互式生物医学知识发现的多智能体编排
BioInsight 是一个多智能体系统,通过结构化工件和确定性引用规范化来组织疾病特定证据,将静态生物医学报告转化为交互式、以证据为中心的界面。
基准测试生物学 AI 智能体:ML@B 与 LatchBio 的合作
加州大学伯克利分校机器学习团队(ML@B)与 LatchBio 合作,对其 AI 智能体在空间转录组工作流程中的性能进行了基准测试,评估其自动化复杂生物信息学任务的能力。
GeneBench-Pro 介绍
OpenAI 推出 GeneBench-Pro,这是一个研究级基准,旨在测试 AI 代理在计算生物学中进行需要大量判断的分析的能力,涵盖基因组学、定量生物学和转化医学。
Terminal-Bench-Science: 在科学研究工作流中评估AI智能体
Terminal-Bench-Science是一个由斯坦福大学研究人员开发的基准,用于评估AI智能体在真实科学研究工作流中的表现,旨在推动科学领域AI能力的提升。