Spark-to-Paper:作为可组合技能的端到端研究论文生成
摘要
本文介绍了 Spark-to-Paper,一个端到端的研究论文生成系统,在编程助手中以十三个可组合技能实现,在减少伪造的同时实现了高引用有效性和图形可编辑性。
查看缓存全文
缓存时间: 2026/08/13 15:29
# Spark-to-Paper:作为可组合技能实现的端到端研究论文生成 来源:https://arxiv.org/html/2608.11924 Biao Wu^[隶属:Vast Intelligence Lab,悉尼科技大学]、Yiran Wang、Chris D Yan、Desan Dai、Liangwei Zheng、Jin Jiang、Jusheng Zhang、Wenhao Wang^[同等贡献,通讯作者] https://github.com/Spark-To-Paper-Skills/spark-to-paper-skills [email protected] ###### 摘要 将一个研究想法转化为一篇完整的论文,所需的能力远不止文本生成:系统必须检索文献、设计并执行实验、根据证据修正论断、生成可发表的图表,并在漫长的生成过程中保持一致性。我们提出 **Spark-to-Paper**,一个端到端研究论文生成系统,以现有编码助手内的十三个可组合技能实现,无需独立的智能体平台或编排服务。Spark-to-Paper 将基于模型的判断与可直接执行和检查的确定性操作分离开来。它进一步将实验规划与实验报告分离,从而在观察结果之前就明确所需证据,并根据测量结果修正稿件中的论断。为了提高长研究轨迹的可靠性,系统将确定性完整性检查与自我批判相结合,并限制了一种我们称之为**自我反驳循环**的故障模式——即重复实验持续否定原始研究目标。Spark-to-Paper 还通过程序化绘图为实验结果生成可编辑的矢量图,并通过基于代码的重建生成方法示意图。在八个受控研究主题中,Spark-to-Paper 实现了 99.5% 的引文有效性和 96.4% 的图表可编辑性。一项受控消融研究将捏造检测率从单遍草稿的 14% 提升到完整完整性与审阅栈的 92%,而对抗性审阅实现了 74% 的精确率。完整系统平均使用 1190 万 token,每篇手稿成本 8.1 美元,平均耗时 3.2 小时。这些结果表明,端到端研究论文生成可以在现有编码助手内实现为轻量级、可组合的工作流,同时保持实验证据在论断被接受、修订或放弃过程中的核心地位。 ## 1 引言 将一个研究想法转化为一篇完整的学术论文,需要的远不止生成文本。研究者必须识别相关文献、设计并运行实验、判断所得证据是否支持原始假设、在证据不支持时修正论断、生成可发表的图表,并在一个经历多个阶段演变的稿件中保持一致性。近期的一些自主研究智能体已开始自动化这一更广泛的过程,证明语言模型可以参与构思、实验、审阅和论文生成[13 (https://arxiv.org/html/2608.11924#bib.bib1),28 (https://arxiv.org/html/2608.11924#bib.bib2),20 (https://arxiv.org/html/2608.11924#bib.bib11),7 (https://arxiv.org/html/2608.11924#bib.bib12),27 (https://arxiv.org/html/2608.11924#bib.bib4)]。然而,这些系统通常作为独立应用实现,带有自己的编排层和支持基础设施。这使它们功能强大,但也与大量实际研究工作所在的编码环境相分离。与此同时,现代编码助手已经提供了研究自动化所需的许多基本能力:它们可以检查项目文件、执行代码、搜索信息、调用外部工具,并在长时间交互中修订工件[3 (https://arxiv.org/html/2608.11924#bib.bib29),2 (https://arxiv.org/html/2608.11924#bib.bib30)]。现有的基于技能的研究工具利用其中部分能力来完成文献检索、大纲拟定和手稿草拟等任务[26 (https://arxiv.org/html/2608.11924#bib.bib5)],但通常止步于完整的研究到论文流程。这引出一个简单的问题:端到端研究论文生成能否作为现有编码助手内的一组可复用技能来实现,而不是作为一个独立的自主研究平台? 我们提出 **Spark-to-Paper**,一个通过十三个可组合技能实现这一设计的系统。每个技能处理一个研究任务,如规划、文献检索、写作、审阅、图表生成或实验执行,而所有技能通过共享项目目录中的工件进行通信。编码助手根据当前项目状态决定每个技能应如何执行,而轻量级流水线仅指定任务的高层顺序。在每个技能内部,我们进一步将判断与执行分离:语言模型处理需要解释或推理的决策,而确定性程序处理可被明确执行和检查的操作。有三个组件对于将这一设计扩展到普通论文草拟之外尤为重要。 首先,Spark-to-Paper 将实验规划与实验报告分离。手稿所需的证据在观察结果之前就已明确,实验被执行以解决缺失的证据,由此产生的工件被用来修订论文中的论断。 其次,系统将确定性完整性检查与长时域自我批判相结合[21 (https://arxiv.org/html/2608.11924#bib.bib17),14 (https://arxiv.org/html/2608.11924#bib.bib20)]。我们还识别了一种我们称之为**自我反驳循环**的故障模式,即系统反复得出自身实验不支持原始研究目标的结论,并继续修正同一方向。Spark-to-Paper 限制了这一过程,将失败的轨迹记录为失败报告,并从新想法重新开始,而不是强迫每个研究方向都必须成功。 第三,图表流水线将定量图与解释性图分开。实验图直接从测量数据生成,而方法图首先使用图像生成模型设计,然后通过代码重建为可编辑的矢量 PDF。 我们通过受控实验、回顾性审计和定性案例研究来评估 Spark-to-Paper。在八个受控研究主题中,完整系统实现了 99.5% 的引文有效性和 96.4% 的图表可编辑性。在注入无支持论断的受控消融中,捏造检测率从单遍草稿的 14% 提升到完整完整性与审阅栈的 92%,而对抗性审阅对提出的问题达到 74% 的精确率。在我们的仪器化运行中,完整系统平均使用 1190 万 token,每篇手稿成本 8.1 美元,需要 3.2 小时的墙钟时间。我们报告这些测量结果以及先前系统的审计和披露成本,同时避免在底层工作量不同时进行直接价格等价比较。 我们的贡献有三方面: - • 我们介绍了 Spark-to-Paper,一个端到端研究论文生成系统,以现有编码助手内的十三个可组合技能实现,无需独立的智能体平台或编排服务。 - • 我们开发了用于证据基础的长时域研究生成的机制,包括预先承诺的实验设计、证据引导的论断修订、确定性完整性检查、从自我反驳循环中的受限恢复,以及代码重建的可编辑图表。 - • 我们提供了对最终研究工件的受控评估,包括引文有效性、捏造检测、图表可编辑性、审阅精确率、鲁棒性和生成成本,以及消融研究和系统行为与故障模式的定性分析。 ## 2 相关工作 表 1:与直接相关系统的定性能力比较,基于截至撰写本文时每个系统自身的公开文档(论文或仓库)。✓ 完整,⚫ 部分,– 未提供或未记录。 ### 2.1 自主端到端研究智能体 一系列不断增长的工作将整个研究循环(即构思、实验、写作,通常还包括自我审阅)作为独立自主系统运行。13 (https://arxiv.org/html/2608.11924#bib.bib1) 及其后继 28 (https://arxiv.org/html/2608.11924#bib.bib2) 生成、运行并撰写机器学习实验,并带有模拟审阅阶段;12 (https://arxiv.org/html/2608.11924#bib.bib3) 将其扩展为自我强化、人在环路的流水线,报告规模为数万行代码;15 (https://arxiv.org/html/2608.11924#bib.bib6) 和 7 (https://arxiv.org/html/2608.11924#bib.bib12) 面向长时间、多小时的自主运行中的开放式科学发现,并具有独立审计的陈述准确性; 图 1:与直接相关系统的定性定位,基于表 1 (https://arxiv.org/html/2608.11924#S2.T1) 的两个轴。坐标是作者根据每个系统公开文档所做的顺序评估,而非测量的基准。 8 (https://arxiv.org/html/2608.11924#bib.bib10) 和 20 (https://arxiv.org/html/2608.11924#bib.bib11) 同样将 LLM 驱动的实验循环与写作阶段配对。这些系统在广度上匹配或超过 Spark-to-Paper,特别是在自主提出并运行新实验方面,但每个系统都以独立应用的形式发布,通常是带有自己的编排服务器的专用代码库,在若干情况下还包括图数据库或集群调度器,而不是作为在现有编码助手内运行且无需额外服务的技能。 ### 2.2 轻量级的、基于技能的写作助手 第二条工作线停留在编码助手现有的技能或插件机制内,而不是发布独立应用。27 (https://arxiv.org/html/2608.11924#bib.bib4) 和 26 (https://arxiv.org/html/2608.11924#bib.bib5) 将文献检索、草拟和审阅分解为可组合步骤,与 Spark-to-Paper 的做法非常相似;5 (https://arxiv.org/html/2608.11924#bib.bib13) 和 10 (https://arxiv.org/html/2608.11924#bib.bib7) 分别自动化了一个更窄的切片,即基于网络的报告写作和单 GPU 实验迭代;4 (https://arxiv.org/html/2608.11924#bib.bib8) 直接综述了这一新兴类别。25 (https://arxiv.org/html/2608.11924#bib.bib9) 将一个自动化学术研究者与一个专门训练来批评它的自动审阅者配对,这是与 Spark-to-Paper 自身对抗性审阅阶段最接近的现有类比。然而,这些工具都没有端到端地运行真实实验,也没有生成可编辑的矢量图而不是嵌入式位图,而这两项能力正是本文贡献的核心。 ### 2.3 LLM 智能体、工具使用与自我批判 Spark-to-Paper 的内部机制借鉴了更广泛的智能体文献,但不是直接重新实现。其先推理后行动的分阶段结构遵循 30 (https://arxiv.org/html/2608.11924#bib.bib14) 的推理与行动交错模式;其使用外部工具(网络搜索、DOI 解析器、绘图库)来完成语言模型不应自行完成的任务,呼应了 19 (https://arxiv.org/html/2608.11924#bib.bib15) 和 17 (https://arxiv.org/html/2608.11924#bib.bib16);其精炼和审阅阶段以 21 (https://arxiv.org/html/2608.11924#bib.bib17) 和 14 (https://arxiv.org/html/2608.11924#bib.bib20) 的方式应用模型对自身输出的批判;其规划阶段在撰写任何散文之前将论文分解为大纲,与深思熟虑的多步推理方法精神一致[24 (https://arxiv.org/html/2608.11924#bib.bib18),29 (https://arxiv.org/html/2608.11924#bib.bib19)];其在技能调用之间的持久、基于文件的工作状态类似于 18 (https://arxiv.org/html/2608.11924#bib.bib21) 的记忆与反思架构,但在此处被调整为单个长期运行的文档,而不是模拟智能体社会。 ### 2.4 基础生成与引文完整性 促使 Spark-to-Paper 构建门控基础设施的担忧已有充分文献记载:当要求大语言模型就它们并未真正检索的文献进行写作时,它们以可测量的、不可忽视的概率捏造引文和事实论断[23 (https://arxiv.org/html/2608.11924#bib.bib22),9 (https://arxiv.org/html/2608.11924#bib.bib23),31 (https://arxiv.org/html/2608.11924#bib.bib24)]。检索增强生成是标准的缓解手段[11 (https://arxiv.org/html/2608.11924#bib.bib25),22 (https://arxiv.org/html/2608.11924#bib.bib26),6 (https://arxiv.org/html/2608.11924#bib.bib27)],而 Spark-to-Paper 的引文阶段最好被理解为这一模式的检索后验证实例,专门针对书目元数据而非段落级事实。其对表格结果的禁止捏造规则与另一相关但不同的文献领域相连接,即从结构化数据忠实地生成文本[16 (https://arxiv.org/html/2608.11924#bib.bib31)],在该领域中风险不是虚构的来源,而是虚构的数字。 总的来说,这一系列工作确立了 Spark-to-Paper 所处空间的两端:一端是自动化更多研究过程但需要长期基础设施的系统,另一端是保持无需基础设施但自动化其中更窄切片。将一个新系统定位在两个既有极点之间,宣称容易但证实更难,因为这会引发本文在其他地方恰恰反对的那种过度声明;表 1 (https://arxiv.org/html/2608.11924#S2.T1) 和图 1 (https://arxiv.org/html/2608.11924#S2.F1) 是我们让这种定位可对照每个被比较系统的公开文档进行检验的尝试,而不是将其留作修辞性声明。以下各节将从机制细节上证实这一定位,并在第 5 节 (https://arxiv.org/html/2608.11924#S5) 和第 7 节 (https://arxiv.org/html/2608.11924#S7) 中考察伴随这一设计的权衡。 ## 3 Spark-to-Paper Spark-to-Paper 是在现有编码助手内运行的十三个技能的集合。每个技能处理一个特定的研究任务,例如规划论文、检索文献、撰写和修订稿件、审阅论断、生成图表或运行实验。Spark-to-Paper 不是构建一个独立的智能体系统,而是利用编码助手现有的读取文件、执行代码、搜索信息和调用外部工具的能力。这些技能共享一个公共项目目录。每个技能读取迄今为止产生的工件,执行其任务,并将其输出写回项目。例如,规划技能产生论文蓝图,引文技能构建经过验证的参考文献列表,写作技能使用两者来生成稿件。后续技能对同一稿件、图表和实验输出进行操作。因此,项目文件在技能之间提供了简单的接口,并允许论文在整个流水线中演变。 在我们的实现中,Spark-to-Paper 在 Claude Code 内运行,使用 Claude 家族的模型[1 (https://arxiv.org/html/2608.11924#bib.bib28),3 (https://arxiv.org/html/2608.11924#bib.bib29),2 (https://arxiv.org/html/2608.11924#bib.bib30)]。该设计本身并不依赖于 Claude Code。一个具有检查项目文件、使用工具和执行代码等相当能力的编码助手可以支持相同的基于技能的设计。 **技能作为执行单元。** 一个技能定义了研究任务应完成什么、必须满足的约束、可以使用的工具以及应产生的工件。它并不规定完成任务所需的每一个推理步骤。相反,
相似文章
@tom_doerr: 将非结构化研究转化为可直接提交的LaTeX论文 https://github.com/Ar9av/PaperOrchestra…
PaperOrchestra 是一个面向编码智能体的可插拔技能包,能够通过五智能体流水线将非结构化研究材料转化为完整的LaTeX论文,在PaperWritingBench基准测试中均优于基线方法。
@XAMTO_AI: 20分钟捅出一篇能投顶刊的论文,这事儿现在真不是吹牛批。 https://github.com/brycewang-stanford/Auto-Empirical-Research-Skills… 以前做实证有多熬人你们心里都有数:选题、…
Stanford REAP and CoPaper.AI have released Auto-Empirical Research Skills (AERS), an open-source toolkit with over 23,000 agent skills that automates the entire empirical research pipeline for social sciences, from topic selection to journal submission.
Prompt-to-Paper: 生物信息学的代理式AI系统
Prompt-to-Paper是一个多阶段多代理AI框架,用于自动化生物信息学稿件生成。它采用确定性检索增强生成、用于真实实验的自主编码代理以及八维质量评分器,以低成本生成可投稿格式的PDF,并实现了经过验证的质量提升。
ArcDeck:叙事驱动的论文到幻灯片生成
ArcDeck 是一个多智能体框架,通过话语树和迭代智能体优化来建模逻辑流程,从而从学术论文生成演示幻灯片,性能优于直接摘要方法。该论文还引入了 ArcBench,这是一个新的基准测试,用于评估论文到幻灯片生成,强调叙事连贯性和逻辑结构。
@wsl8297: 用 AI 写论文最怕的不是写不出来,而是它看起来很完整,实际上研究空白、文献支撑、论证结构都站不住。Academic Paper Skills 解决的就是这个问题。 GitHub:https://github.com/lishix520/…
Academic Paper Skills 是一套用于 Claude Code 的论文写作技能框架,将写作流程分为策略和写作两个阶段,并内置文献支撑、审稿人模拟和质量检查等特性,帮助用户从研究想法生成初稿。