CoAuthorAI:面向科学书籍写作的人类参与系统
摘要
CoAuthorAI 是一种人类参与系统,融合检索增强生成与层级大纲,实现准确连贯的科学书籍写作,在评测中达到 98% 召回率和 82% 用户满意度。
arXiv:2604.19772v1 公告类型:新
摘要:大型语言模型(LLM)在科学写作中的应用日益广泛,但在书籍级任务中常出现结构不一致和引用不可靠的问题。我们提出 CoAuthorAI,一种人类参与写作系统,结合检索增强生成、专家设计的层级大纲以及自动参考文献链接。系统支持专家逐句迭代润色,确保连贯性与准确性。在 500 篇跨领域文献综述章节的评测中,CoAuthorAI 的最大软标题召回率达 98%;在 100 篇文章的人工评测中,生成内容满意度达 82%。由 CoAuthorAI 与 Kexin Technology 的 LUFFA AI 模型共同撰写的《AI for Rock Dynamics》一书已由 Springer Nature 出版。结果表明,系统化的人机协作可将 LLM 能力从文章扩展至整本专著,加速并提升科学出版的可靠性。
查看缓存全文
缓存时间: 2026/04/23 10:02
# CoAuthorAI:面向科学书籍写作的人类参与式系统 来源:https://arxiv.org/html/2604.19772 Yangjie Tian¹², Xungang Gu¹³, Yun Zhao¹, Jiale Yang¹, Lin Yang¹, Ning Li¹, He Zhang¹*, Ruohua Xu¹, Hua Wang², Kewen Liao³, Ming Liu³ ¹ 北京科信科技有限公司,北京 100012 ² 澳大利亚维多利亚大学可持续产业与宜居城市研究所,VIC 3011 ³ 澳大利亚迪肯大学信息技术学院,墨尔本,VIC 3125 [email protected], [email protected], [email protected] ###### 摘要 大语言模型(LLM)在科学写作中的应用日益增多,但在书籍级任务中常出现结构不一致、引用不可靠等问题。我们推出*CoAuthorAI*,一种人类参与式写作系统,融合检索增强生成、专家设计的层级大纲与自动引用链接,支持逐句精修,确保连贯性与准确性。在500 篇跨领域综述章节评估中,系统软标题召回率最高达 98%;在 100 篇文章的人工评测中,生成内容满意度达 82%。由 CoAuthorAI 与科信科技 LUFFA AI 模型共同完成的《Rock Dynamics 中的 AI》已由 Springer Nature 出版。结果表明,系统化的人机协作可将 LLM 能力从文章扩展至整书,实现更快速、可靠的科学出版。系统演示视频:https://youtu.be/PAWQz48tsdA ## 1 引言 科学写作至关重要,却复杂耗时。撰写书籍需广泛调研、严谨组织与多轮修订。大语言模型为加速并优化该流程提供新途径,从草稿生成到修改建议,均可为作者节省大量时间。 近期研究表明,ChatGPT、GPT-4、Claude 等 LLM 已重塑短篇科学文本生成,包括文献综述(Agarwal 等,2024;Wang 等,2024)、报告起草(Aljamaan 等,2024;Taylor 等,2022;Wang 等,2023)乃至章节写作(Schoenenberger,2023)。这些场景下,模型快速生成流畅文本,检索模块提供最新事实,显著提升生产力。然而,全自动生成常出现引用幻觉、事实错误与长文风格不一致等问题(Alkaissi & McFarlane,2023)。 为缓解上述缺陷,研究界采纳“人类参与式”(HITL)范式,将专家知识融入模型推理,用于规划、内容审查与最终确认(Hsu 等,2024;Agarwal 等,2024)。该范式结合人类(领域知识、批判性判断)与 LLM(语言流畅、快速起草)的互补优势,已成为高 stakes 科学通信的事实标准。 尽管短篇写作取得显著进展,长篇书籍的系统性开发仍显不足。现有原型如 BetaWriter 的全自动专著(Beta Writer,2019)与 Meta 的 Galactica 演示(Taylor 等,2022)展示了无持续专家监督下生成书稿的潜力与局限。实践中,大型出版商仍依赖劳动密集型编辑周期以维持连贯性、控制叙事深度并确保引用可追溯(Schoenenberger,2023)。由此引出一个关键问题:如何在牢牢掌握人类主导权的同时,将 LLM 辅助扩展至书籍级写作? 针对该挑战,我们提出 CoAuthorAI,一款面向科学书籍生成的生产级 HITL 系统。贡献如下: 1. 设计*模块化架构*,融合检索增强生成、专家设计的层级大纲与自动引用链接,实现章节级生成、句子级可追溯。 2. 实现*交互式反馈循环*,支持专家逐轮精修大纲、重生成章节并核验引用,全面掌控风格、深度与准确性。 3. 探索 LLM 与领域专家在书籍写作任务中的边界,并与科信科技 LUFFA 模型协作,协助作者团队出版《Rock Dynamics 中的 AI》¹。 这些进展将 LLM 协作写作从文章扩展至整书,为作者与出版商提供实用工作流。 ## 2 相关工作 我们从三条研究脉络讨论与人类参与式书籍生成相关的进展。 #### 文献综述 早期系统如 LitLLM(Agarwal 等,2024)与 AutoSurvey(Wang 等,2024)采用检索增强生成管线,将论文集合转化为结构化综述。交互平台 Elicit(Ought,2024)与 SciSpace(Typeset,2024)进一步支持查询驱动的论文发现与摘要预览,供研究者人工策展。这些工作展示了搜索与生成结合的效率,但输出通常限于章节规模。 #### 科学报告生成 通用模型(如 GPT-3.5/4、Claude)已被用于撰写基金申请与临床报告,然而引用幻觉率居高不下(Alkaissi & McFarlane,2023)。领域约束方法通过多模态接地(如放射学的 R2GenGPT)或精选语料(Elsevier 的 ScienceDirect AI)提升事实性(Wang 等,2023;Bio-IT World Staff,2025)。尽管这些系统提供 HITL 验证界面,处理文档长度远不及整书。 #### 书籍起草与 HITL 工作流 Beta Writer 通过聚类与 summarization 自动构建学术专著,但生成文本碎片化严重,需大量人工后期编辑(Beta Writer,2019)。后续工业尝试将对话式 LLM 融入协作写作管线。例如,Springer Nature 的 GPT 辅助教科书据称缩短生产时间 50%,同时以人类作者为核心决策环节(Schoenenberger,2023)。然而,公开的系统架构、评估协议与设计权衡细节有限,可扩展性、引用可靠性及专家介入粒度等关键问题仍未解决。本文通过提供完整系统文档与综合实证分析填补该空白。 图 1:CoAuthorAI 概览,展示专家输入与修订前端,以及 PDF 解析、内容压缩、章节生成与后处理的 LLM 交互后端。 ## 3 CoAuthorAI CoAuthorAI 演示系统为基于 Streamlit² 的 Web 应用,预处理任务采用 Python³。我们利用自研 PDF 解析工具提取内容,并将嵌入存储于 Milvus⁴。系统由前端与后端两大组件构成。如图 1 所示,前端负责文档上传、书籍大纲创建与专家内容修订;后端使用 PDF 解析工具将论文转为机器可读格式,结合检索增强技术调用 LLM 生成章节内容。此外,我们提供详细的分步使用指南。 图 2:CoAuthorAI 用户界面与工作流。界面引导用户完成七步人机协作管线:(1)选择或创建项目;(2)查看与管理书籍级信息;(3)上传大纲与参考 PDF;(4)解析 PDF 内容;(5)压缩文献;(6)人工精修 AI 生成文本;(7)引用溯源。 ### 3.1 前端设计 #### 人类引导与循环 人类引导与迭代反馈是保证 AI 生成内容质量与准确性的关键。如图 2 所示,专家负责确立书籍标题与大纲,并按章节上传相关文献,提供方向与事实材料。由于 LLM 输出可能随机且机械,专家需在平台审阅、精修并核验生成内容,以符合学术与行业标准。该过程需多轮人工介入与反馈循环,持续改进 AI 文本。 ### 3.2 后端设计 #### PDF 提取 采用自研 PDF 解析工具,可高效分析并提取含图片、公式、表格等复杂元素的 PDF 内容,将多模态 PDF 转为 Markdown,便于计算分析与机器学习任务。借助该工具,用户可更高效构建 LLM 语料,充分利用 PDF 中的完整信息。 #### 内容压缩 在多文档长内容生成实验中,我们发现 LLM 两大局限:其一,上下文窗口即模型工作记忆,限制单次处理文档规模,常小于书籍所需参考资料总量;其二,即便扩展上下文,生成内容仍偏重概念解释,缺乏具体知识细节。为此,我们先用 LLM 对全文进行压缩 summarization,再将处理后的文本作为参考,提升生成效率、深度与准确性。 #### 章节生成 章节生成模块是内容生产管线的核心。我们基于压缩后的参考资料调用 LLM 生成章节内容。实验表明,更详细的提示可带来更高质量输出,因此领域专家在生成前将内容大纲细化至二级标题。受上下文窗口限制并经反复实验,为确保讨论深入,压缩后的参考资料不超过 40 篇。如需更多文献,后端采用多阶段生成策略: - 步骤 1:使用相同提示,每 40 篇文献生成一章内容,作为中间结果; - 步骤 2:批量生成后,以中间结果为参考资料,产出章节终版; - 步骤 3:将终版章节与原始资料关联,建立对应关系。 该批处理架构在保持叙事连贯的同时,最大化利用参考资料。 #### 引用链接 该模块确保生成内容引用的准确性与可信度。首先将源文档拆分为语义块,再使用 bge-m3 嵌入模型将生成内容与参考文献转为高维向量。Milvus 的 IVF-SQ8 索引用于高效相似度搜索,计算其与生成文本的语义相似度,从而快速定位最相关文献并获得相似度得分。处理原始参考文献时,先按标点分句,再将句子划分为三组,每组保留重叠句,该重叠方式保留更丰富的信息,提升召回完整性,并保证最终块语义连贯。为高效管理大规模向量搜索,我们集成高性能开源向量数据库 Milvus,其针对大规模非结构化数据优化,支持文档块嵌入的存储、索引与快速检索,确保相似度计算快速且可扩展。 #### 头尾生成 章节内容生成后,头尾生成模块负责撰写书籍引言与结论。该模块以已生成章节内容为参考,调用 LLM 创作引言与结语,为全书提供连贯的叙事框架。 ### 3.3 系统使用流程 图 2 给出系统完整使用流程。 - 步骤 1:用户上传大纲、指定章节并上传相关参考文档; - 步骤 2:使用 PDF 解析工具提取 PDF 内容; - 步骤 3:调用 LLM 压缩解析后文档; - 步骤 4:调用 LLM 生成章节内容,专家可在编辑区手动修改; - 步骤 5:对生成内容进行引用核验,确保引用准确。 ## 4 评估 评估采用分阶段策略。首先,我们使用系统执行文献综述任务,评估模型
相似文章
用AI写书一年:真实经历大揭秘!!!
一位作家分享用AI写书的一年实验,发现直接生成文本效果不佳,但用AI分析和改进自己的写作确实有价值。
Generating novel scientific hypotheses with Co-Scientist
Google DeepMind's Co-Scientist is a multi-agent AI system that acts as a virtual team of scientists to search literature, generate hypotheses, and design experiments, compressing months of research into days and already yielding new scientific discoveries.
Humanly:一个可配置且可追溯的人机协作写作环境
Humanly是一个可配置的写作平台,记录写作过程以提供人机协作的可追溯证据,具有密封证书和异常检测等功能。
@AYi_AInotes: https://x.com/AYi_AInotes/status/2062774798166503872
作者开源了一套基于Helio平台的AI内容创作系统,让多个AI agent自动接力完成选题侦查、资料研究和内容改写分发,作者只需做两个判断(选选题、定稿),大幅提升内容创作效率。
AI辅助写作的最佳平衡点是50%
本文分析认为,AI辅助写作的理想配比约为50% AI与50%人工介入:AI负责结构与编排,人类主导文风、判断力与最终审核。作者指出,100%由AI生成的文章显得廉价且缺乏灵魂,而0%使用AI则会白白浪费工具潜力;实现有效的AI辅助写作,离不开扎实的专业知识、严谨的架构以及鲜明的个人表达。