Paper Pilot:一种面向应用科学中证据可追溯科学文稿生成的人机协同专家系统
摘要
Paper Pilot是一个面向证据可追溯科学文稿生成的人机协同专家系统,通过审批关卡和审计日志确保问责制并防止AI辅助研究工作流程中的伪造行为。
arXiv:2608.28596v1 公告类型:新
摘要:大型语言模型(LLM)代理正越来越多地嵌入科学工作流程中,用于文献分析、起草和审查。现有系统推进了自主发现和文稿生成,但未能解决当创意、方法、结果和主张通过AI辅助工作流程传播时,缺乏强制性人工批准或工件级可追溯性所带来的治理问题。本文提出了Paper Pilot,一种应用于科学中证据可追溯科学文稿生成的人机协同专家系统。它通过文稿所有者审批关卡、明确的不通过标准、主张分类、审计日志、咨询式LLM审查和证据锁定修订控制,将协同代理推理工程(CARE)方法论应用于文稿开发。该框架在从创意到主张的流程中定义了八个审批关卡,并区分了基于文献的主张和基于工件的主张,要求报告的数字和解释可追溯到已批准的证据;其系统提示公开发布,可在ChatGPT、Gemini、Claude或机构LLM环境中部署。作为首次实证验证,我们使用受控的、机械评分的基准(两个商业LLM、真实arXiv论文、无LLM评判)评估了引用接地层:在覆盖压力下,无门控的起草者捏造了高达25%的引用,并且从未标记证据缺口,而在Paper Pilot的证据锁定规则下,相同模型产生了零捏造引用,并将植入的缺口作为显式占位符显示出来。结果接地、修订和对抗性鲁棒性的初步结果指向相同方向;完整评估留待未来工作。Paper Pilot将LLM辅助写作定位为受控的人机决策支持过程,而非完全自主的作者流程。
查看缓存全文
缓存时间: 2026/09/01 12:26
# 面向应用科学领域、证据可追溯的科学论文生成人机协同专家系统 来源:https://arxiv.org/html/2608.28596 ###### 摘要 基于大型语言模型的智能体正越来越多地被整合到科学工作流程中,用于文献分析、假设生成、代码开发、结果解释、论文撰写及自动化审稿。现有系统在自主科学发现和自动化论文生成方面取得了进展;然而,当创意、方法、成果与主张在无需人类批准或缺乏制品级可追溯性的人工智能辅助工作流程中传播时,所引入的治理问题尚未得到充分解决。本文提出 *Paper Pilot*,一个面向应用科学领域、用于生成证据可追溯科学论文的人机协同专家系统。该系统通过引入论文作者审批关卡、明确的未通过标准、主张分类、审计日志、顾问式大型语言模型评审以及证据锁定修订控制,将协同智能体推理工程(CARE)方法论应用于论文开发。Paper Pilot 可通过 ChatGPT、Gemini、Claude 或任何机构级大型语言模型环境实现,其系统提示旨在通过 GitHub 开源发布。该框架在从创意到主张的全流程中定义了审批关卡,包括范围审批、文献审批、方法审批、证据审批、主张审批、审稿人否决、章节审批和最终发布。它还区分了基于文献的主张和基于制品的主张,要求报告的数字、图表、表格和解释必须保持对已批准证据的可追溯性。工作流程演示说明了该系统如何支持分章节论文撰写、缺口识别、主张分类、修订控制以及论文作者的监督。作为初步实证验证,我们使用受控、机械评分基准(两个商用大型语言模型、真实 arXiv 论文、arXiv-API 验证、无大型语言模型评判)评估了引文锚定层:在覆盖压力下,无关卡的生成器最多伪造了 25% 的引文且从未标记证据缺口,而相同的模型在 Paper Pilot 的证据锁定规则下产生的伪造引文为零,并将植入的缺口显式呈现为占位符。关于结果锚定、证据锁定修订和对抗鲁棒性的初步结果也指向同一方向,它们的完整评估——基于真实数据集和完整发布的提示——留待未来工作。所提出的框架将大型语言模型辅助写作定位为一个受控的人机决策支持过程,而非完全自主的写作流水线。 关键词:人机协同;专家系统;大型语言模型;科学写作智能体;证据可追溯性;人工智能辅助研究;审计日志;可复现计算;自动化审稿;决策支持 ## 1 引言 大型语言模型正日益被嵌入支持传统上由人类研究人员进行的科研活动的智能系统中,包括假设生成、文献分析、实验规划、代码开发、结果解释、论文撰写和自动化审稿。这一发展使人工智能辅助研究从孤立的任务自动化,转向日益集成的科学工作流程,其中多个智能体可能在知识生产和学术传播的各个阶段协同工作。近期系统展示了这一转变。*AI Scientist* 被提出作为一个端到端框架,能够生成研究创意、编写代码、执行实验、可视化结果、起草完整的科学论文,并应用模拟评审过程进行评估[5 (https://arxiv.org/html/2608.28596#bib.bib1)]。*AI Scientist-v2* 通过智能体树搜索、自主实验设计、论文生成和研讨会级论文提交,进一步推动了这一方向[15 (https://arxiv.org/html/2608.28596#bib.bib2)]。类似地,*InternAgent* 作为一个用于从假设生成到实验验证的自主科学研究的闭环多智能体框架被引入[3 (https://arxiv.org/html/2608.28596#bib.bib3)],而 *Agent Laboratory* 则展示了在整个研究过程中使用大型语言模型智能体作为研究助理[9 (https://arxiv.org/html/2608.28596#bib.bib4)]。与此同时,针对人工智能辅助科学写作和学术综合的专业系统也已出现。*PaperOrchestra* 通过多智能体写作框架,解决了将不受约束的预写作材料转化为可提交的 LaTeX 手稿的问题,并使用 *PaperWritingBench* 评估了这种能力[12 (https://arxiv.org/html/2608.28596#bib.bib5)]。*ARISE* 引入了一个智能体、由评分标准引导的迭代综述引擎,该引擎使用引文优先检索、引文键控记忆、专用写作智能体和审稿智能体来生成学术综述论文[13 (https://arxiv.org/html/2608.28596#bib.bib6)]。相关工作也强调科学智能体作为协作或生态系统级系统的重要性。*OmniScientist* 认为,科学发现不应仅被视为一个独立的搜索或优化问题,因为现实世界的科学依赖于协作机制、贡献归因、同行评审和结构化知识基础设施[10 (https://arxiv.org/html/2608.28596#bib.bib7)]。这些研究共同表明,基于大型语言模型的科学智能体正朝着更广泛地参与研究生命周期发展,包括知识生产和手稿生产。 尽管取得了这些进展,一个关键的控制问题仍未得到充分解决。现有系统通常包含人机交互、自动化审稿智能体或基于引文的写作机制,但它们并未在从创意生成到最终手稿主张的完整研究闭环中,定义一套标准化的、强制性的、端到端的人类审批关卡。在自主或半自主的科学工作流程中,未受支持的决策可能跨阶段传播:一个薄弱的研究想法可能导致无效的方法;无效的方法可能产生不可靠的代码或结果;不可靠的结果可能被转化为手稿主张;而手稿主张随后可能在没有充分证据支持的情况下被润色为出版就绪的语言。这种传播风险对于专家和智能系统尤为重要,因为此类系统的目的不仅在于生成输出,更在于支持现实领域中可靠的决策、可控的实施和可负责的管理。 对这种控制的需求与协同智能体推理工程(CARE)方法论一致,该方法论将智能体-大型语言模型开发视为一个有纪律的、阶段门控的工程过程,而非临时的提示迭代。CARE 通过可复用制品来指定智能体行为、锚定、工具编排和验证,并组织涉及主题专家、开发人员和基于大型语言模型的辅助智能体的三方工作流程[7 (https://arxiv.org/html/2608.28596#bib.bib11)]。在 CARE 中,辅助智能体将非正式的领域意图转化为结构化的、可审查的制品,并在定义的关卡由人类批准。这种以制品为导向、以审批为关卡的定位,为设计科学写作智能体提供了方法论基础,使其行为可规范、可测试、可维护且可审计。 基于此方法论,本文提出了 *Paper Pilot*,一个面向应用科学领域、用于生成证据可追溯科学论文的人机协同专家系统。Paper Pilot 将 CARE 方法论应用于科学生命周期,将论文作者视为负责批准、否决和发布决策的人类权威。该系统通过通用和面向领域的大型语言模型环境实现,其系统提示通过 GitHub 公开提供。在此实现中,大型语言模型智能体协助分章节撰写、文献锚定检查、主张分类、修订控制和缺口识别,而论文作者则保留对研究有效性、证据充分性、解释权和最终提交决定的权威。 除了缺少强制性审批关卡之外,第二个限制涉及分配给基于大型语言模型的审稿人或评判者的权威。一些系统使用审稿智能体或自动化评估机制来评估生成的想法、论文、图表或输出。*AI Scientist* 包含一个旨在近似人类论文评估的自动化审稿人[5 (https://arxiv.org/html/2608.28596#bib.bib1)],而 *CycleResearcher* 使用 *CycleReviewer* 作为迭代研究-审阅过程的一部分[14 (https://arxiv.org/html/2608.28596#bib.bib10)]。此类审稿智能体可以提高可扩展性并提供快速反馈,但它们也引发了未解决的问题:人类权威何时必须否决大型语言模型的判断、如何随时间检测审稿人偏差,以及如何审计自动化评估中的系统性偏差。因此,在 Paper Pilot 中,大型语言模型审稿人被视为顾问组件而非最终权威。它们的判断可以为手稿修订提供信息,但对科学主张、方法充分性、证据充分性和发布准备就绪的批准仍由论文作者负责。 第三个限制涉及证据到主张的可追溯性。基于引文的系统如 *ARISE* 提供了通过引文键控记忆和证据感知修订过程将学术陈述与检索到的文献关联的机制[13 (https://arxiv.org/html/2608.28596#bib.bib6)]。然而,科学手稿还包含无法仅通过文献引用完全验证的计算和分析主张。报告的数字、图表、表格、基准比较、消融研究发现和统计结论需要可追溯到运行级制品,包括代码版本、数据哈希值、随机种子、环境规范、执行日志、配置文件、中间输出和生成的图表。没有这种可追溯性,写作智能体可能会引入未经支持的指标、更改比较陈述,或以语言上看似合理但无法可复现锚定的方式总结实验结果。 Paper Pilot 通过形式化一个用于大型语言模型辅助论文开发的人机协同审批架构来解决这些差距。该框架在从创意到主张的流程中定义了八个论文作者审批关卡,包括范围审批、文献审批、方法审批、证据审批、主张审批、审稿人否决、章节审批和最终手稿发布。每个关卡都与明确的未通过标准、审计日志要求以及在何种条件下必须修订、拒绝或升级由大型语言模型生成或评审的内容相关联。该框架进一步将基于引文的写作扩展到基于制品的写作,要求报告的主张与文献证据、用户提供的结果或可检查的计算制品相关联。 所提出的框架旨在服务于 *Expert Systems with Applications* 所定位的应用型智能系统背景。它将科学论文生成概念化为一个决策支持工作流程,其中大型语言模型智能体执行起草、检查、检索、审阅和修订支持任务,而论文作者保留对科学有效性、方法充分性、证据充分性和最终主张的权威。这种定位不同于完全自主的论文生成系统,因为其目标不是将人类研究人员从循环中移除,而是定义人类判断必须在何处以及如何插入循环,以保持责任性、可复现性和科学完整性。 本文解决的研究问题如下: **RQ1.** 在应用科学写作的大型语言模型辅助下,哪些强制性的人类审批关卡、未通过标准和审计日志要求应管辖从创意到手稿主张的转变,以及如何将这些要求指定为一个可复用的专家系统工作流程? **RQ2.** 在审批关卡写作工作流程中,应如何定义大型语言模型审稿智能体与人类论文作者之间的权威边界?哪些类别的决策必须完全由人类作者保留? 本文的主要贡献有五个方面。 第一,引入 *Paper Pilot* 作为一种基于 CARE 的、面向应用科学领域、用于大型语言模型辅助科学论文生成的人机协同专家系统。 第二,定义了跨创意到主张流程的论文作者审批关卡模型。 第三,指定了用于控制人工智能生成内容在起草、审阅和修订阶段进展的未通过标准和审计日志要求。 第四,提出了一种制品级证据到主张的可追溯性机制和证据锁定修订过程,以防止未经支持的指标、不可验证的比较和未经批准的解释性主张进入手稿。 第五,通过在真实 arXiv 论文上的受控、无评判基准,首次对引文锚定层进行了实证验证(第5节 (https://arxiv.org/html/2608.28596#S5)),并提供了结果锚定、证据锁定修订和对抗鲁棒性的初步结果,以及用于其未来更完整评估的基准套件。 ## 2 相关工作 ### 2.1 基于大型语言模型的自主科学发现智能体 基于大型语言模型的科学智能体已被越来越多地提出,作为能够执行超越孤立文本生成的研究活动的系统。早期的智能体研究系统通常专注于有限的辅助任务,例如文献综述、创意构思、代码生成或分析支持。更近期的系统尝试将这些能力整合到包含假设生成、实验执行、手稿准备和自动化审阅的闭环科学工作流程中。*AI Scientist* 代表了这一轨迹最清晰的例子之一。它被设计为一个在机器学习领域实现全自动科学发现的框架,包括创意生成、代码编写、实验执行、可视化、论文撰写和模拟评审[5 (https://arxiv.org/html/2608.28596#bib.bib1)]。*AI Scientist-v2* 通过使用智能体树搜索进行自主科学发现和论文生成,进一步延伸了这一方向[15 (https://arxiv.org/html/2608.28596#bib.bib2)]。闭环科学自动化也通过更广泛的多智能体框架进行了探索。*InternAgent* 被提出作为一个统一的闭环多智能体框架,用于跨多个科学领域的自主科学研究,通过协调的智能体将假设生成与验证联系起来[3 (https://arxiv.org/html/2608.28596#bib.bib3)]。*OmniScientist* 进一步扩大了范围,认为人工智能科学家应嵌入一个共同演化的人机科学生态系统中,而非仅被视为孤立的优化系统。其设计强调了引文网络、协作协议、同行评审、贡献归因和结构化科学知识基础设施[10 (https://arxiv.org/html/2608.28596#bib.bib7)]。关于用于科学发现的智能体人工智能的综述研究同样表明,人工智能智能体正越来越多地被用于文献综述、假设生成、实验设计、数据分析和论文撰写等任务中。
相似文章
基于工作流归纳的多轮自主式科学文献搜索
本文介绍了PaperPilot,一个多轮文献搜索智能体,它构建可执行的有向无环图(DAG)搜索操作,并通过用户反馈优化工作流,在检索指标上相比基线模型取得了显著提升。
Prompt-to-Paper: 生物信息学的代理式AI系统
Prompt-to-Paper是一个多阶段多代理AI框架,用于自动化生物信息学稿件生成。它采用确定性检索增强生成、用于真实实验的自主编码代理以及八维质量评分器,以低成本生成可投稿格式的PDF,并实现了经过验证的质量提升。
PaperMentor:一种以人为本的多智能体写作辅导工具,面向Overleaf上的AI研究论文
PaperMentor是一种以人为本的多智能体写作助手,它集成了专家技能库和专门代理,能够在Overleaf上提供可操作的内联注释,在AI研究论文的可用性和相关性方面优于GPT-5.2。
迈向自动化科学评审:谷歌的Paper Assistant Tool
本文介绍了论文助手工具(PAT),这是一种用于深度科学评审的代理型AI框架,利用推理缩放技术识别数学错误及其他缺陷,在召回率上比零样本方法提升了34%。在STOC和ICML的试点部署表明,它能够在提交前捕捉关键错误,减轻人类审稿人的负担。
Humanly:一个可配置且可追溯的人机协作写作环境
Humanly是一个可配置的写作平台,记录写作过程以提供人机协作的可追溯证据,具有密封证书和异常检测等功能。