人工智能代理起草转化影响摘要的真实世界评估

arXiv cs.CL 论文

摘要

本文对一种为临床学者起草转化影响摘要的人工智能代理进行了真实世界评估,结果显示,每位学者的工作人员时间从15小时减少到14分钟,可用率为81.7%。

arXiv:2607.16989v1 公告类型:新 摘要:引言。临床与转化科学奖(CTSA)项目必须记录其学者的研究影响,但手工整理每位学者的记录估计需要工作人员15小时,且无法扩展至整个队列。人工智能(AI)代理可以作为工具,跨平台和学科收集学者数据。 方法。我们构建了一个人在环中的AI代理,该代理为每位学者汇编一份带来源证据的档案,并起草一句式的转化科学效益模型(TSBM)影响摘要,供工作人员审阅。我们在一个CTSA中心的10名职业发展(KL2/K12)学者的影响报告工作流程中进行了评估。两名评估人员独立将所有507个结果编码为接受、编辑或拒绝;主要指标是全票可用率,即双方均接受或编辑的比例。 结果。两位评审员接受或编辑了代理结果的81.7%。每位评审员每名学者花费的中位时间为14分钟,取代了估计15小时的人工汇编。评审员间一致性中等(可用与拒绝决策的Cohen's kappa为0.43)。一项概况发现研究表明,代理的召回率接近人工搜索。代理的影响证据覆盖了所有四个TSBM领域,约三分之一的评审结果属于常规流程容易遗漏的非学术类别。评审员对综合准确性的评分为4.5(5分制),有用性为4.8。 结论。一个人在环中的AI代理可以作为学者影响记录的初稿作者,将工作人员从收集和撰写转变为审阅,使队列规模的影响报告成为可能。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:44

# 人工智能代理撰写转化影响摘要的真实世界评估
来源: https://arxiv.org/html/2607.16989
Mohammad Arvan, Amber E. Osterholt, Bailee Rue, Yuvaneswaren Ramakrishnan Sureshbabu, Krishna Riteshkumar Patel, Rebecca T. Feinstein, Bethany C. Bray, Niranjan S. Karnik
伊利诺伊大学芝加哥分校,芝加哥,伊利诺伊州,美国

###### 摘要

引言。临床与转化科学奖(CTSA)项目必须记录其学者的研究影响,但手工整理每位学者的记录估计需要工作人员15小时,并且无法推广到整个队列。人工智能(AI)代理可以作为一种工具,跨平台和学科收集学者数据。

方法。我们构建了一个人在环路的AI代理,为每位学者汇编一份包含来源证据的档案,并起草一句式的转化科学效益模型(TSBM)影响摘要,供工作人员审阅。我们在一个CTSA中心的影响报告工作流程中,针对10名职业发展(KL2/K12)学者进行了评估。两名评估人员独立将所有507项发现编码为“接受”、“编辑”或“拒绝”;主要指标是一致认可的可使用率,定义为双方都接受或编辑的部分占比。

结果。两位评审员接受或编辑了代理81.7%的发现。每位评审员每名学者花费的中位时间为14分钟,取代了估计15小时的手工汇编工作。评审员间一致性为中等(对可用与拒绝决策的Cohen's kappa为0.43)。一项档案发现研究发现代理的召回率接近人工搜索。代理的影响证据涵盖了全部四个TSBM领域,大约三分之一的已审阅发现属于常规流程容易遗漏的非学术类别。评审员对综合准确性的评分为4.5分,有用性为4.8分(满分5分)。

结论。人在环路的AI代理可以作为学者影响记录初稿的作者,将工作人员的工作从收集和撰写转变为审阅,使队列规模的影响报告变得可行。

*关键词*:人机协作;生成式AI代理;大型语言模型;工作流集成;研究影响评估

## 1 引言

美国国立卫生研究院(NIH)的职业发展(K)奖项支持从受训者向独立研究者的转变,提供受保护时间、指导和培训[9 (https://arxiv.org/html/2607.16989#bib.bib23)]。K奖获得者获得独立(R01级)资助的比率高于非K同行[22 (https://arxiv.org/html/2607.16989#bib.bib24)]。临床与转化科学奖(CTSA)项目通过机构职业发展资助将这种支持扩展到转化科学工作者,最初以KL2机制授予,最近作为K12项目[1 (https://arxiv.org/html/2607.16989#bib.bib26)]。与个人K奖不同,这些机制是机构资助,一个中心支持一批学者。

CTSA KL2学者随后进入富有成效的转化职业生涯。约78%的人在获奖后仍留在CTSA机构[25 (https://arxiv.org/html/2607.16989#bib.bib25)]。五年后,他们的发表优势超过其他导师制K奖获得者[23 (https://arxiv.org/html/2607.16989#bib.bib27)],其工作的被引频次约为普通NIH资助研究的两倍[21 (https://arxiv.org/html/2607.16989#bib.bib28)]。自2006年以来,Overton索引的政策文件也引用了超过3600篇KL2学者的出版物[21 (https://arxiv.org/html/2607.16989#bib.bib28)]。然而,学者的影响远不止于发表和资助,常规追踪并未涵盖其余部分。

评估学者是否成为独立研究者并将研究推向现实世界效益,需要一份完整的记录。独立进展留下了可索引的轨迹,包括资助、发表和晋升,FlightTracker等工具已经可以摄取这些信息[13 (https://arxiv.org/html/2607.16989#bib.bib29)]。现实世界影响则没有这样的轨迹,并且形式多样。转化科学效益模型(TSBM)将这种影响分为临床、社区、经济和政策效益[17 (https://arxiv.org/html/2607.16989#bib.bib1)]。非学术证据,如临床项目领导力、社区参与、成本或采纳数据以及政策采纳,都位于当前工具所依托的所有系统之外。

手动维护该记录难以规模化。学者最直接了解自己的成果,但对信息请求的回复率很低(我们中心内为11.9%),并且随时间推移而下降。学者还会在CTSA网络内外调动机构,每次调动都使追踪和联系学者变得更加困难。非学术证据需要在工作人员已查询的资助者、文献和机构系统之上,为每位学者增加开放式网络搜索。搜索到的内容随后必须撰写成一句式的TSBM影响摘要,每句陈述一项发现的转化效益。撰写涉及阅读出版物、资助和全部四个TSBM领域,目前没有工具能完成这种综合。随着每个新队列的加入,工作量不断增加,因为每次奖项结束后追踪仍会持续多年。

人工智能(AI)代理可以搜索和起草通常通过手动搜索和学者信息请求收集的材料。代理会搜索数据库和开放网络,追踪调动的学者,并根据收集到的证据起草每份摘要。这完全不需要学者回应请求。然而,承诺往往超过实际演示。很少有AI系统在其服务的工作流内部进行评估,因此很少能展示明确的成果[24 (https://arxiv.org/html/2607.16989#bib.bib11),4 (https://arxiv.org/html/2607.16989#bib.bib35)]。初稿只有在负责报告的工作人员能够验证和纠正它,且花费的精力少于自行汇编记录时才有帮助。这种情况是否成立,取决于工作流的特性,而非仅模型本身。

我们构建了这样一个代理,并在一个CTSA中心的影响报告工作流中,针对一个由10名KL2/K12学者组成的队列进行了评估。该代理从中心自身的记录开始,为每位学者汇编一份包含来源证据的档案,并为每项影响发现起草一句式的TSBM影响摘要。工作人员在每项发现进入记录前进行审阅。在评估中,两位工作人员独立审阅了代理提出的所有内容。一项*档案发现研究*还检查了代理的检索与人工搜索的对比。我们报告了工作人员保留了哪些、纠正了哪些以及审阅花费了多长时间,这些是工作流关注的结果。如果这种分工成立,工作人员的工作将从估计的每人15小时汇编记录转变为几分钟的审阅。

## 2 材料与方法

对于每位学者,我们的人工智能(AI)代理会汇编一份*证据档案*并据此起草影响摘要。档案及其摘要共同构成学者影响记录的初稿。档案是一个结构化的候选发现集合,每项发现都关联一个来源,并通过搜索学术数据库和开放网络收集。它涵盖多个领域,包括学者的身份、职业生涯、出版物、资助以及任何新闻或媒体报道。利用证据档案,代理会呈现非学术影响证据,例如临床项目领导力、社区参与、成本或采纳数据以及政策引用。每项影响发现还包括一个*影响摘要*,即一句陈述其转化效益的话,以转化科学效益模型(TSBM)[17 (https://arxiv.org/html/2607.16989#bib.bib1)]为框架。

该代理和评审员形成一种人机协作,即真实工作流中的分工(图1 (https://arxiv.org/html/2607.16989#S2.F1))。代理为评审员完成两项成本高昂的任务:收集和起草。对于每项发现,评审员接受、编辑或拒绝它,并且可以添加代理遗漏的发现。接受或拒绝很快,编辑需要更多精力,而添加是最费力的。因此,代理针对召回率进行了调优。它慷慨地提出建议,这样评审员拒绝多余的,但很少需要添加。对于每种发现类型,代理都会引用首选的权威来源,因此验证可以从该来源开始。

参见图注

图1: 代理如何收集证据。从一个*学者种子*(名称、机构以及中心已持有的任何资助记录)开始,代理查询公共学术和资助数据库(OpenAlex、PubMed、ORCID、ClinicalTrials.gov和美国国立卫生研究院(NIH)RePORTER)以及开放网络,读取记录并汇编成包含证据和一句式效益陈述的影响档案。随后,评审员对每项发现进行接受、编辑、拒绝或添加操作。

我们在伊利诺伊大学芝加哥分校的临床与转化科学中心(一个临床与转化科学奖(CTSA)中心)通过两项研究评估了该代理。第一项是*档案发现研究*,单独检查代理的检索,将其档案召回率与*纯人工*和*AI辅助*搜索进行比较。第二项是*审阅研究*,检查代理在实际使用中的情况,工作人员在其真实的报告工作流中基于代理的初稿工作,并通过*可用率*和努力程度对其审阅进行评分。两项研究都基于相同的10名KL2/K12学者。在*审阅研究*中,两位评审员独立对每项发现进行评分,以衡量他们的一致性。

### 2.1 代理设计

代理是一个系统,其中语言模型动态地指导自身过程和工具使用,保持对其任务完成方式的控制[3 (https://arxiv.org/html/2607.16989#bib.bib5)]。代理决定运行哪些搜索、调用哪些工具以及何时完成其研究。这种动态形式适合此任务,因为影响发现是开放式的,每位学者的记录需要不同的搜索。

代理从一个包含中心已持有的学者姓名、机构以及任何资助记录的*学者种子*开始。它将工作组织为*研究运行*(图2 (https://arxiv.org/html/2607.16989#S2.F2)),重复最多三次。一次运行包含三个阶段。*收集*阶段收集证据,*汇编*阶段将其写入档案部分和影响摘要,*批评*阶段标记需要修复的内容。代理返回影响记录的初稿,即一个结构化的档案加上每项影响发现的影响摘要。

我们将*收集*阶段限制在25轮,每轮规划下一个目标并为其搜索;当代理完成覆盖时,该阶段会提前结束。它通过数据接口直接查询五个研究数据库:OpenAlex、PubMed、ORCID、ClinicalTrials.gov和NIH RePORTER。它转向开放网络搜索以获取这些数据库未持有的证据,例如本地媒体和政策引用。最后,代理提交一份*覆盖报告*,标记档案的每个部分(已找到、确认不存在或搜索后为空);该报告是代理对其覆盖范围的自我说明。

一个双模型设计处理*收集*阶段检索到的内容。一个大型模型(gpt-5.1)规划搜索、推理证据并起草影响摘要。一个小型模型(gpt-5.4-mini)处理两项高容量的阅读子任务。它将检索到的每个网页提炼为代理询问的事实,并将每篇出版物的摘要修剪为其结果。对于其他所有工具结果,系统只保留档案所需的字段。只有这个修剪后的内容才能进入大型模型的上下文。代理还管理自己的上下文,在工作时不断将累积的发现合并到档案中,即使学者有很长的记录也能保持上下文较小。

提炼还限制了上下文投毒,因为页面上的对抗性文本被限制在小模型内,这是一种针对间接提示注入的缓解措施[2 (https://arxiv.org/html/2607.16989#bib.bib7)]。每个读取不可信内容的阶段都将其作为数据隔离,遵循 spotlighting 系列防御[14 (https://arxiv.org/html/2607.16989#bib.bib8)]。

我们为每种发现类型定义了权威来源。对于资助,首选来源是中心自身记录或NIH奖项的NIH RePORTER项目页面。对于任何基于论文的发现,它是论文的数字对象标识符(DOI)。对于试验,它是ClinicalTrials.gov记录。对于档案或媒体报道,它是学者自己的页面或新闻媒体的报道。这些来源偏好指导管道的每个阶段。

*汇编*阶段然后将收集到的证据转化为档案,一次一个部分。它最后编写四个影响部分,这样每个影响都可以引用档案中已有的证据。对于每项影响发现,它然后根据该证据起草一句式的影响摘要。起草提示包含少量示例[7 (https://arxiv.org/html/2607.16989#bib.bib9)],将影响与描述该影响的出版物区分开来。

一个独立的*批评*阶段结束每次运行。它读取已汇编的档案和运行的操作日志,并标记缺口、重复、矛盾和薄弱来源。操作日志使其能够区分真正的缺口和已经空手而归的搜索。代理会在下一次*研究运行*中修复标记的问题。重复运行遵循代理系统的评估器-优化器模式[3 (https://arxiv.org/html/2607.16989#bib.bib5)];*批评*是对抗性的,因此运行通常会使用全部预算而不是早期收敛。

一个*注册-修订*阶段针对从已发表的CTSA影响概况和TSBM文献中提取的76个基于源、人工撰写的效益陈述构建的语言特征,衡量每份起草摘要。它修改偏离此特征的草稿,使用可解释的特征(如句子长度)来指导编辑。我们将该阶段限制在三轮。

参见图注

图2: 代理的嵌套阶段。*收集*阶段在规划下一个目标与搜索五个研究数据库和网络之间交替(最多25轮)。代理从运行记录中汇编档案,一个独立的*批评*阶段标记缺口、重复、矛盾和薄弱来源。运行重复最多三次。然后一个*注册-修订*阶段(最多三轮)将起草的一句式影响摘要向TSBM目标风格收紧,之后再交由人类接受、编辑、拒绝或添加。

### 2.2 档案发现研究

我们评估了档案的发现,即标识学者的页面(机构主页、Google Scholar、ORCID、LinkedIn)。档案是基础,因为档案集确定了档案描述的是哪位学者。档案错误会级联到每篇出版物、每项资助、每个影响和每份摘要。它们也是最容易验证的,因为评审员一眼就能确认一个规范页面。队列中两个不重叠的五位学者子集分别由代理和一个人工分支(*纯人工*或*AI辅助*)搜索。在*纯人工*分支中,一个人在没有AI工具的情况下搜索开放网络和学术数据库。在*AI辅助*分支中,一个人使用具有网络搜索功能的通用AI聊天助手(LibreChat),并根据其来源验证每个建议。我们将代理和人工分支的档案发现汇集起来,并使用人工审查根据每个发现的来源进行验证[28 (https://arxiv.org/html/2607.16989#bib.bib6)]。因此,召回率是相对于这个汇集池而言的,所以一

相似文章

评估AI生成的癌症患者摘要

arXiv cs.CL

本研究采用双重评估框架,使用人类领域专家和LLMs作为评估者,评估面向癌症患者的AI生成摘要,重点关注医疗保健应用中的准确性、临床相关性和安全性。

自动化智能体评估的实证研究

arXiv cs.CL

本文介绍了 EvalAgent,这是一个通过编码领域专业知识来自动化 AI 智能体评估的系统,旨在解决标准编程助手在此任务中的局限性。此外,本文还提出了用于测试评估流程的基准 AgentEvalBench,并展示了在评估可靠性方面的显著提升。