"Excuse me, may I say something..." CoLabScience,一个用于生物医学发现和大语言模型-专家协作的主动型AI助手

arXiv cs.CL 论文

摘要

CoLabScience介绍了一个用于生物医学研究的主动型大语言模型助手,它使用PULI(正无标签学习干预)这一新颖的强化学习框架,在科学讨论中自主进行干预,决定何时以及如何提供上下文感知的见解。该工作还包括BSDD,一个新的基准数据集,由基于PubMed文章的模拟研究对话和干预点组成。

arXiv:2604.15588v1 公告类型:新 摘要:将大语言模型(LLMs)集成到科学工作流中为加速生物医学发现提供了令人兴奋的机遇。然而,LLMs的被动特性(仅在被提示时才作出响应)限制了它们在需要远见卓识和自主参与的协作环境中的有效性。在本研究中,我们介绍CoLabScience,一个主动型大语言模型助手,通过及时的、上下文感知的干预来增强AI系统与人类专家之间的生物医学协作。我们方法的核心是PULI(正无标签学习干预),一个用强化学习目标训练的新颖框架,通过利用团队的项目提案以及长短期对话记忆,决定何时以及如何在流式科学讨论中进行干预。为了支持这项工作,我们引入了BSDD(生物医学流式对话数据集),一个新的基准测试,包含基于PubMed文章的模拟研究讨论对话和干预点。实验结果表明,PULI在干预精度和协作任务有用性方面都明显优于现有基线,突出了主动型LLMs作为智能科学助手的潜力。
查看原文
查看缓存全文

缓存时间: 2026/04/20 08:28

# "请问,我可以说点什么吗……" CoLabScience,一个用于生物医学发现和大语言模型-专家协作的主动式AI助手

源链接:https://arxiv.org/html/2604.15588

Yang Wu♣\\clubsuitJinhong Yu♣\\clubsuitJingwei Xiong♡\\heartsuit Zhimin Tao♢\\diamondsuitXiaozhong Liu♣\\clubsuit

♣\\clubsuitWorcester Polytechnic Institute, Worcester, MA, USA
♡\\heartsuitUniversity of California, Davis, CA, USA
♢\\diamondsuitJiangsu University, Zhenjiang, Jiangsu, China

\{ywu19, jyu7, xliu14\}@wpi\.edu jwxxiong@ucdavis\.edujsutao@ujs\.edu\.cn

###### 摘要

将大语言模型(LLM)集成到科学工作流程中为加速生物医学发现带来了令人兴奋的机会。然而,LLM的被动特性——只在被提示时才做出响应——限制了其在需要远见和自主参与的协作设置中的有效性。在本研究中,我们介绍了CoLabScience,一个主动式LLM助手,旨在通过及时、上下文感知的干预来增强AI系统与人类专家之间的生物医学协作。我们方法的核心是PULI(正-无标签学习干预框架),一个用强化学习目标训练的新颖框架,通过利用团队的项目提案以及长期和短期对话记忆,来确定何时以及如何在流式科学讨论中进行干预。为了支持这项工作,我们引入了BSDD(生物医学流式对话数据集),一个新的基准,包含从PubMed文章衍生的模拟研究讨论对话和干预点标注。实验结果表明,PULI在干预精度和协作任务效用上都明显优于现有基线,突出了主动式LLM作为智能科学助手的潜力。111https://github\.com/YANGWU001/CoLabScience

## 1 介绍

见图1
**图1:生物医学协作中的被动式和主动式LLM比较。** 传统的被动式LLM(左)只在被提示后才做出响应,而主动式LLM(右)监控进行中的讨论,识别贡献领域相关见解的机会,并无需明确提示就能进行及时和上下文感知的建议干预。

大语言模型(LLM)的最近发展已经推动了科学研究的进步,使生物医学领域的加速发现成为可能。特别是,现有工作已经探索了它们在药物重新定位、疾病诊断和临床问题回答等任务中的潜力。尽管取得了这些成功,当前的模型主要在被动范式下运作,仅在收到研究人员的明确提示时才做出响应。这种交互模式严重限制了它们在协作设置中的有效性,其中缺乏主动干预会导致关键见解和机会的遗失。

为了应对这些局限,我们提议支持生物医学研究的LLM应该向主动参与演进:持续追踪进行中的讨论,理解新兴的上下文,并自主识别适当的贡献时刻——作为主动团队成员而不是被动工具集成到团队中。例如,如图1所示,传统的被动式LLM(仅在临床医生明确提示后被动响应),而主动式LLM追踪讨论,识别贡献PTEN相关见解的及时机会,并主动提出建议以推进科学进展,无需等待直接查询。

受主动参与需求的驱动,我们提出CoLabScience,一个新颖的AI助手,将LLM从被动工具转变为生物医学研究中的主动协作者。其核心是PULI(正-无标签学习干预),一个用强化学习训练的框架,用于确定何时以及如何在科学讨论期间进行干预。为了训练这个模型,我们构建了BSDD(生物医学流式对话数据集),一个模拟科学对话的集合,具有多个研究角色(例如,药理学家、临床医生),由LLM生成并以PubMed文献为基础。为了确保LLM衍生标签的可靠性并降低幻觉风险,我们采用了稀疏标注策略,其中只有最有价值的干预点被标注为正例,而所有其他点保持无标签。通过利用CoLabScience的协调器从正-无标签(PU)数据中识别可靠的负例干预,我们采用了两层方法:使用组相对策略优化(GRPO)训练一个小型Observer LLM以确定何时进行干预,并使用监督学习微调一个大规模Presenter LLM以生成适当的干预内容。这种架构通过高效的Observer模型实现实时对话监控,只在需要干预时调用计算昂贵的Presenter模型。来自两个模型的奖励信号被整合以训练强化学习协调器,实现端到端的训练循环。

通过融入项目提案(即项目目标、数据集和背景知识)和双尺度对话记忆,其中长期记忆保留关键的先前见解,短期记忆捕捉不断演变的对话上下文,CoLabScience主动提供科学有根据的干预,无需明确提示。

本文的贡献可以总结如下三点:

- **我们提出了CoLabScience**,一个主动式LLM助手,通过上下文感知的干预来支持高效的生物医学研究协作。与被动式LLM不同,CoLabScience通过利用项目上下文和对话历史,自主确定在进行中的研究讨论中何时以及如何进行干预。

- **我们引入了BSDD**,一个新的开放基准,包含以PubMed文章为基础并用主动干预标签标注的模拟生物医学研究对话。BSDD为训练和评估未来的主动式科学助手提供了宝贵资源,推进了这一新兴领域的研究。

- **我们通过基于模拟的评估和人类评估**验证了CoLabScience的有效性。结果表明该模型具有强大的泛化能力和在多种LLM骨干网络上的鲁棒性。

## 2 相关工作

##### 作为科学助手的大语言模型

LLM的最近进展在生物医学研究中表现出前景,通过蛋白质结构预测、抗生素发现和药物重新定位。除了生物医学领域,Agent Laboratory和AI Scientist等系统从假设生成到报告自动化了研究管道,而Agentic Reasoning增强了多步推理。补充这些系统,RECODE-H通过多轮代码开发来评估人类-代理协作。然而,这些方法主要是被动的,而CoLabScience在进行中的科学讨论期间实现了上下文感知的及时干预。

##### 大语言模型中的主动能力

最近的工作通过结构化提示探索LLM的主动性,包括协作中的主动性、澄清寻求行为和在复杂任务中请求用户支持。VideoLLM-Online将其扩展到多模态流,训练模型确定最优的叙述时机。然而,这些方法依赖于手工制作的提示和固定逻辑,限制了自适应干预。相比之下,我们引入了一个可训练的强化学习机制,实现了上下文感知、对时间敏感的主动决策。

## 3 方法论

### 3.1 初步定义

我们基于多轮科学对话形式化了主动干预任务,其中每一轮对应一个团队成员的单个话语。设D=\{D1,D2,...,DM\}\\mathcal\{D\}=\\\{D^\{1\},D^\{2\},\\ldots,D^\{M\}\\\}表示独立多轮对话的集合。每个对话Di=\{d1i,d2i,...,dNii\}D^\{i\}=\\\{d^\{i\}\_\{1\},d^\{i\}\_\{2\},\\ldots,d^\{i\}\_\{N\_\{i\}\}\\\}由Ni个轮次组成,这些轮次从一个固定的项目提案Ci\\mathcal\{C\}^\{i\}生成,该提案定义了研究目标、背景知识和相关数据集。我们将所有对话轮次聚合到一个正-无标签(PU)干预训练集中:\{d1,d2,...,dN\},\\\{d\_\{1\},d\_\{2\},\\ldots,d\_\{N\}\\\},其中N=∑i=1MNiN=\\sum\_\{i=1\}^\{M\}N\_\{i\}是候选轮次的总数。PU训练集包含u个无标签轮次U=\{d1,...,du\}U=\\\{d\_\{1\},\\ldots,d\_\{u\}\\\},其干预必要性未知,以及(N−u)(N\-u)个标注的正例轮次P=\{du\+1,...,dN\}P=\\\{d\_\{u\+1\},\\ldots,d\_\{N\}\\\}。基于PU数据集,我们的任务是联合学习(1)何时干预,使用Observer HφH\_\{\\phi\},以及(2)如何干预,使用Presenter GψG\_\{\\psi\}。为了便于两个LLM的训练,我们引入了一个强化学习框架,其中协调器模型Fθ\\mathcal\{F\}\_\{\\theta\}从无标签数据中识别潜在的正例和负例。为了增强理解和清晰度,表1中提供了符号汇总。

表1:符号。

见图2
**图2:PULI框架的说明。** 协调器为每个无标签对话轮次决定是否干预或保持沉默。无声轮次用作负例通过GRPO训练更新Observer以学习干预时机,而干预轮次增强正数据以改进Presenter以生成适当的干预内容。Observer和Presenter协作提供奖励以在端到端训练过程中优化协调器。

### 3.2 PULI机制

在本部分,我们介绍了PULI机制,使用正-无标签数据集联合学习何时以及如何在多轮科学对话中进行干预。框架概述如图2所示。

#### 3.2.1 多轮对话状态

对于每个无标签干预轮次dn∈Ud\_\{n\}\\in U在本地对话步骤t,我们构造了一个上下文化记忆Mt(dn)\\mathcal\{M\}\_\{t\}\(d\_\{n\}\),包含三个组成部分:(1)项目提案C(dn)C\(d\_\{n\}\),指定研究目标、背景和数据信息;(2)短期记忆MtS(dn)\\mathcal\{M\}\_\{t\}^\{S\}\(d\_\{n\}\),捕捉当前话语及其两个最近的前驱词;(3)长期记忆MtL(dn)\\mathcal\{M\}\_\{t\}^\{L\}\(d\_\{n\}\),总结到步骤t为止的累积会议见解。记忆构造定义为:

MtS(dn)\\displaystyle\\mathcal\{M\}\_\{t\}^\{S\}\(d\_\{n\}\)=\{dnt−2,dnt−1,dnt\},\\displaystyle=\\\{d\_\{n\}^\{t\-2\},d\_\{n\}^\{t\-1\},d\_\{n\}^\{t\}\\\},\(1\)

MtL(dn)\\displaystyle\\mathcal\{M\}\_\{t\}^\{L\}\(d\_\{n\}\)=\{∅,ift=0,Γ\(Mt−1L\(dn\)∪Mt−1S\(dn\)\),ift\>0,\\displaystyle=

Mt(dn)\\displaystyle\\mathcal\{M\}\_\{t\}\(d\_\{n\}\)=\[C\(dn\),MtS\(dn\),MtL\(dn\)\]\.\\displaystyle=\[C\(d\_\{n\}\),\\mathcal\{M\}\_\{t\}^\{S\}\(d\_\{n\}\),\\mathcal\{M\}\_\{t\}^\{L\}\(d\_\{n\}\)\]

对于初始步骤其中t<2t<2,我们在MtS(dn)\\mathcal\{M\}\_\{t\}^\{S\}\(d\_\{n\}\)中省略不可用的索引,例如,M0S(dn)=\{dn0\}\\mathcal\{M\}\_\{0\}^\{S\}\(d\_\{n\}\)=\\\{d\_\{n\}^\{0\}\\\}和M1S(dn)=\{dn0,dn1\}\\mathcal\{M\}\_\{1\}^\{S\}\(d\_\{n\}\)=\\\{d\_\{n\}^\{0\},d\_\{n\}^\{1\}\\\}。这种设计确保短期记忆在所有时间步都格式良好,而长期记忆通过LLM汇总器Γ(·)\\Gamma\(\\cdot\)递归压缩早期轮次以防止过度记忆积累。

为了获得强化学习状态,我们通过Observer HφH\_\{\\phi\}和Presenter GψG\_\{\\psi\}处理记忆输入Mt(dn)\\mathcal\{M\}\_\{t\}\(d\_\{n\}\),并提取它们的最终隐藏表示以构造状态嵌入Sn:

Sn=Concat\(ΨHφ\(Mt\(dn\)\),Ω\(ΨGψ\(Mt\(dn\)\)\)\),S\_\{n\}=\\text\{Concat\}\\left\(\\Psi\_\{\\mathcal\{H\}\_\{\\phi\}\}\\left\(\\mathcal\{M\}\_\{t\}\(d\_\{n\}\)\\right\),\\Omega\\left\(\\Psi\_\{\\mathcal\{G\}\_\{\\psi\}\}\\left\(\\mathcal\{M\}\_\{t\}\(d\_\{n\}\)\\right\)\\right\)\\right\),\(2\)

其中ΨHφ(·)\\Psi\_\{\\mathcal\{H\}\_\{\\phi\}\}\(\\cdot\)和ΨGψ(·)\\Psi\_\{\\mathcal\{G\}\_\{\\psi\}\}\(\\cdot\)分别表示Hφ\\mathcal\{H\}\_\{\\phi\}和Gψ\\mathcal\{G\}\_\{\\psi\}的最后隐藏层表示,Concat(·,·)\\text\{Concat\}\(\\cdot,\\cdot\)表示串联运算符。为了确保Observer和Presenter最后隐藏层表示之间的维度一致性,我们引入了一个可学习的线性投影器Ω(·)\\Omega\(\\cdot\),将ΨGψ(Mt(dn))\\Psi\_\{\\mathcal\{G\}\_\{\\psi\}\}\\left\(\\mathcal\{M\}\_\{t\}\(d\_\{n\}\)\\right\)投影到Observer的维度。

相似文章

LLM-AutoSciLab:通过主动实验实现闭环科学发现

arXiv cs.LG

LLM-AutoSciLab是一个闭环框架,利用LLM迭代生成假设、选择信息量大的实验并优化机制,在物理和生物学基准测试上相比之前的静态方法实现了更高的准确性和样本效率。

CausaLab: 面向AI科学家的可扩展交互式因果发现环境

Hugging Face Daily Papers

CausaLab 是一个可扩展的环境,用于评估LLM智能体在交互式因果发现中的表现,同时衡量预测准确性和对潜在因果机制的忠实复现。实验揭示了预测与机制复现之间的差距,突显了当前LLM智能体作为实验性因果推理者的局限性。

FirstResearch: 面向LLM科学发现代理的可审计问题形成框架

arXiv cs.AI

FirstResearch 引入了一个结构化框架,用于LLM科学发现代理,该框架生成一份研究问题证书,包含原始定义、假设、机制、可证伪假设和失败更新规则,使得所提出的研究问题在执行前可被审查。使用LLM评估者的初步评估表明,以证书为中心的方法在可审计性和得分方面优于基线系统。