证据太多,时间太少:通过多目标证据推理从文本到可操作的建议

arXiv cs.AI 论文

摘要

SCEPTER是一个框架,通过结合PubMed检索、PubMedBERT排序、大语言模型声明提取、矛盾检测和帕累托最优声明选择,将临床病例描述转化为基于证据的建议,实现了192:1的压缩比,同时保持了较高的证据多样性。

arXiv:2607.22574v1 公告类型:新 摘要:基于证据的临床决策要求专家识别、评估和综合相关科学文献。然而,针对复杂临床病例的PubMed搜索通常会返回数百篇论文,在时间有限的情况下无法手动审阅。本研究提出SCEPTER(单病例证据驱动的PubMed到推荐推理器),这是一个将临床病例描述转化为基于证据的建议的框架。SCEPTER结合了PubMed检索、PubMedBERT语义排序、基于大语言模型(LLM)的声明提取、证据级别加权、矛盾检测、共识分析和多目标帕累托声明选择。该框架生成结构化的证据综合和基于证据的可操作建议。论文问答模块进一步支持对选定出版物的交互式探索。所提出的框架引入了多目标推理模型,将文献支持、矛盾分析和交互式文献查询整合到统一的临床决策支持流程中。在150个案例研究上的评估表明,该框架将平均576篇论文的搜索空间减少到53篇保留论文、7个帕累托最优声明和3条最终建议,对应192:1的总体压缩比。尽管进行了缩减,保留的证据保持了高多样性(熵=0.901)。消融研究表明,与传统排序方法相比,基于帕累托的选择增加了证据多样性和建议效用。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:25

# 证据太多,时间太少:通过多目标证据推理从文本到可操作建议

来源:https://arxiv.org/abs/2607.22574
查看 PDF(https://arxiv.org/pdf/2607.22574)

> 摘要:基于证据的临床决策要求专家识别、评估和综合相关科学文献。然而,针对复杂临床病例的 PubMed 搜索通常返回数百篇出版物,在时间限制下无法手动审查。本研究提出了 SCEPTER(单病例证据驱动的 PubMed 到推荐推理器),这是一个将临床病例描述转化为基于证据的建议的框架。SCEPTER 结合了 PubMed 检索、PubMedBERT 语义排序、基于大语言模型(LLM)的声明提取、证据级别加权、矛盾检测、共识分析和多目标 Pareto 声明选择。该框架生成结构化的证据综合和基于依据的可操作建议。论文问答模块进一步支持对选定出版物的交互式探索。所提出的框架引入了多目标推理模型,将文献支持、矛盾分析和交互式文献审查整合到一个统一的临床决策支持管道中。在 150 个案例研究上的评估表明,该框架将平均搜索空间从 576 篇论文减少到 53 篇保留论文、7 个 Pareto 最优声明和 3 条最终建议,对应总体压缩比为 192:1。尽管有这种缩减,保留的证据仍保持高多样性(熵=0.901)。消融研究显示,与传统排序方法相比,基于 Pareto 的选择提高了证据多样性和推荐效用。

## 提交历史

来自:Simona-Vasilica Oprea [查看电子邮件(https://arxiv.org/show-email/55e19940/2607.22574)]  
**[v1]** 2026 年 6 月 5 日,星期五,03:53:28 UTC(1,087 KB)

相似文章

将零散证据转化为生命科学发现决策

YouTube AI Channels

OpenAI 在 Codex 中推出的全新生命科学模型“GPT-Rosalind”通过协调多个专业子代理,将遗传学、转录组学、安全性和知识产权数据融合为单一证据支持的决策,自主对哮喘药物靶点进行排序。

Evidence-RL:迈向证据密集型视觉推理

Hugging Face Daily Papers

本文介绍了反事实证据解耦(CED),这是一种训练时方法,使视觉语言模型依赖具体的图像证据而非语言先验或捷径,从而提升跨基准的视觉推理grounding能力。

CalBrief:大型语言模型证据校准式科学简报的试点诊断基准

arXiv cs.CL

本文介绍了CalBrief——一个包含16个证据包和96个人工验证结论的试点诊断基准,用于评估大型语言模型是否能够生成证据校准的科学简报。研究发现,结构化组织能提升推理能力,但显式的强度校准策略过于保守,且这种保守性主要源于标签空间的扩展,而非信号注入。

MEDSYN: 复杂临床病例中多证据综合的多模态大语言模型基准测试

arXiv cs.CL

MEDSYN 是一个多语言多模态基准,用于评估多模态大语言模型(MLLMs)在复杂临床病例上的表现,每个病例最多包含 7 种不同的视觉证据类型。研究表明,虽然前沿模型在鉴别诊断生成方面与人类专家相当,但所有 MLLMs 在最终诊断选择中均存在显著差距,原因是异质临床证据综合能力不足。