标签
本文提出了一种上下文增强的多跳问答训练框架,表明结合上下文图与知识图谱并使用强化学习可以提高生物医学领域的性能。
本文介绍了BioCheck Agent,这是一个基于LLM的智能体,使用RL增强的智能搜索生成结构化的生物医学事实核查报告,与基础模型相比,显示出更高的准确性和更低的幻觉率。
AstraZeneca介绍了Research Assistant,这是一个内部基于LLM的多智能体系统,让科学家通过聊天方式探索生物医学数据,具备证据溯源和引用链接,已部署给15,000名内部用户。
本文介绍了马蹄蟹血液在检测药物安全性方面的重要作用、捕捞马蹄蟹对环境的影响,以及礼来公司转向使用实验室制造的替代品从而无需再使用蟹血。
本文介绍了THBKG,一个时间异构生物医学知识图谱,涵盖11万实体和1110万条边,带有逐年证据时间戳,旨在仅使用决策时可用的证据来预测进入II期试验的靶点-疾病对是否会推进到III期。基于图谱的方法优于直接证据基线,尤其是在缺乏直接证据的配对中,作者将其作为持续更新的资源发布。
AIPOCH 发布了包含超过550个医学研究智能体技能的精选库,用于支持证据洞察、方案设计、数据分析和学术写作,并且兼容 Claude Code 和 Codex 等多个 AI 智能体平台。
本文对面向低资源阿拉伯字母语言的生物医学机器翻译中的跨语言迁移进行了系统研究,以阿拉伯语和波斯语作为枢轴语言。作者评估了LoRA适配器融合作为一种零数据迁移策略,并表明该策略对于达里语等亲缘关系较近的语言效果出乎意料地好。
一种名为FAIR GraphRAG的新型框架将FAIR数字对象与基于图的检索相结合,以增强面向语义数据分析的检索增强生成,提高了问答准确性并遵循FAIR原则,在生物医学数据集上进行了演示。
本文评估了 Claude Fable 5 在八个生物医学基准上的表现,发现尽管拒绝率很高(8-99.4%),但模型在回答时达到了卓越的准确率,突显了参与意愿是主要限制因素。
引入了漂移感知时间图重连(DATGR),动态更新生物医学文本图中的共现边,捕获语义漂移而无需完整重新训练。在BIOMRC上的评估表明,与静态基线相比,平均AUROC提升了0.066,同时保持了精确度。
本文研究了在生物医学领域对混合专家(MoE)模型进行领域特定专家剪枝对效用和事实可靠性的影响。研究发现,适度剪枝能保持领域内效用且不会立即导致可靠性下降,但极端剪枝会增加幻觉风险,且跨领域设置下的泛化能力会迅速恶化。
本文提出MedKGTab,一种知识注入框架,利用生物医学知识图谱扩展表格医疗数据中的跨域特征,通过生成高保真生物医学档案解决数据稀缺问题。
提出DDIAgents,一种机制条件化的多智能体框架,用于药物-药物相互作用预测,该框架动态地将相关生物医学知识路由到专门的专家智能体,并聚合它们的分析,优于现有的基于特征、基于图和基于LLM的方法。
一项新的基准论文OpenBioRQ揭示,AI代理很少捏造引用,但常常引用不支持其主张的论文,在生物医学语境中有15.9%的引用不匹配。
Hybrid-IR 提出了一种双路径检索框架,结合基于图的检索和稠密检索,并采用迭代推理来改进复杂医学问答,克服了现有RAG方法的局限性。在三个基准上的实验表明了其有效性。
OpenBioRQ 是一个包含12,553个未解决生物医学研究问题的新基准,用于测试智能体模型验证来源和避免虚假引用的能力。该基准揭示,当前模型经常链接到错误的论文,并在难题上出现智能体崩溃。
BioInsight 是一个多智能体系统,通过结构化工件和确定性引用规范化来组织疾病特定证据,将静态生物医学报告转化为交互式、以证据为中心的界面。
TxBench-PP是一个用于评估AI代理在小分子临床前药理学任务上表现的基准测试。在16种模型-框架配置中,最佳系统仅达到59.3%的准确率,表明仍有很大的改进空间。