一个基于人类反馈循环的LLM科学摘要简化语料库
摘要
本文介绍了一种基于人类反馈循环的工作流程,用于创建LLM简化的科学摘要语料库,使用SciSummNet和GPT-4o-mini,结合非专家和专家反馈,以提高跨学科的可读性。
arXiv:2607.25630v1 公告类型:新
摘要:跨学科研究正在加速发展,但科学论文在其所属领域之外仍然难以理解。我们研究了基于大语言模型(LLM)的科学文本简化,并提出了一个人类反馈循环工作流程,将专家摘要转化为非专业人士更易理解的版本。我们以SciSummNet为源语料库,首先使用GPT-4o-mini生成基线简化版本。在第一阶段,来自计算机科学以外的STEM领域的读者识别出困难的句子和短语,并从可理解性、自然性和简洁性方面比较原始摘要和GPT简化摘要。在第二阶段,计算机科学专家利用这些反馈创建经过专家编辑的参考简化版本。我们发布了最终的语料库以及人工判断和自动评估结果。第一阶段判断显示,在可理解性和简洁性方面,GPT生成的摘要明显更受欢迎;而对第二阶段编辑的定性分析则强调了保留领域特定术语和科学声明力度的重要性。由此产生的资源支持跨学科科学交流的简化系统的训练和基准测试。
查看缓存全文
缓存时间: 2026/07/29 09:55
# 基于大语言模型的科学摘要简化中的人机协同语料库 来源: https://arxiv.org/html/2607.25630 \\copyrightclause 版权所有归本文作者所有。依据知识共享署名4.0国际许可协议(CC BY 4.0)允许使用。 \\conference SIG知识管理工作坊(FG WM)暨KI 2026, 2026, 不来梅, 德国 [[email protected]] (2026) ###### 摘要 跨学科研究正在加速发展,但科学论文在其本领域之外仍难以阅读。我们研究了基于大语言模型(LLM)的科学文本简化方法,并提出了一种将专家摘要转化为非专业人士更易理解版本的人机协同工作流程。以SciSummNet作为源语料库,我们首先使用GPT-4o-mini生成基线简化版本。在第一阶段,来自计算机科学以外的STEM领域的读者识别出难懂的句子和短语,并在理解度、自然度和简洁度方面对原始摘要和GPT简化后的摘要进行比较。在第二阶段,计算机科学专家利用这些反馈生成专家编辑的参考简化版本。我们发布了最终的语料库以及人工判断和自动评估的结果。第一阶段的判断显示,在理解度和简洁度方面,GPT的输出明显更受青睐;而对第二阶段编辑的定性分析则说明了保留领域术语和科学论断强度的重要性。该资源支持用于跨学科科学交流的简化系统的训练和基准测试。数据集:https://github.com/faerber-lab/scientific-text-simplification-corpus ###### 关键词: 文本简化\\seps科学交流\\seps人机协同\\sepse评价\\seps语料库 ## 1 引言 随着许多科学进步产生于不同领域的交叉点,跨学科研究变得越来越重要[1 (https://arxiv.org/html/2607.25630#bib.bib1), 2 (https://arxiv.org/html/2607.25630#bib.bib2)]。然而,科学写作通常针对特定学科内的专家,而非邻近领域的研究人员。因此,特定领域的术语、高度压缩的论点以及特定领域的写作惯例可能会极大地限制科学发现的易读性、解读和重用 [3 (https://arxiv.org/html/2607.25630#bib.bib3)]。 大语言模型(LLMs)为简化科学及其他专业文本提供了有前景的基础。它们在广泛的语言任务中展示了强大的零样本和少样本能力 [4 (https://arxiv.org/html/2607.25630#bib.bib4), 5 (https://arxiv.org/html/2607.25630#bib.bib5)],并且近期的研究已经探索了它们在科学和专业文本简化中的应用 [6 (https://arxiv.org/html/2607.25630#bib.bib6), 7 (https://arxiv.org/html/2607.25630#bib.bib7)]。然而,关于幻觉、细微差别丢失以及写作风格不一致的问题依然存在。此外,大多数现有的基准测试集中于新闻文章或维基百科段落,而非科学论述和跨学科受众。因此,适用于科学文本简化的数据集和评估协议仍然有限 [8 (https://arxiv.org/html/2607.25630#bib.bib8)]。 我们通过一个人机协同框架来弥补这一差距,该框架为不具备相应源领域专业知识的STEM读者提供了可操作性,同时保留了原始文本的科学含义。我们使用SciSummNet [9 (https://arxiv.org/html/2607.25630#bib.bib9)]作为源材料,(i) 使用LLM生成初始简化版本,(ii) 收集来自相关领域之外STEM读者在句子和短语层面的难度标注,以及对理解度、自然度和简洁度的评估,(iii) 根据这些反馈创建专家编辑的参考简化版本。最终的设计直接解决了提高可读性与保持科学精确性之间的核心权衡问题,这对全自动简化系统来说仍然是一个难题。 总的来说,我们的贡献如下: - • 一种用于简化科学摘要的人机协同方法,该方法以跨学科STEM读者的理解为中心,同时保持技术准确性。 - • 一个从SciSummNet衍生的精选语料库¹¹我们的代码和数据可在https://github.com/faerber-lab/scientific-text-simplification-corpus获取。,包含 (a) 基线LLM输出、(b) 句子和短语层面的难度标注,以及 (c) 专家编辑的参考简化版本。 - • 一项评估,展示了LLM在哪些方面提高了表面可读性,以及专家后期编辑在论断校准和术语保真度方面为何至关重要。 论文的其余部分结构如下。第2节回顾了科学文本简化和以人为中心的评估的相关工作。第3节描述了语料库的构建。第4节展示了两个研究阶段的结果,随后在第5节和第6节讨论了局限性和结论。 ## 2 相关工作 用于科学文本简化的LLM。LLM在广泛的语言任务中展示了强大的零样本和少样本能力 [4 (https://arxiv.org/html/2607.25630#bib.bib4), 5 (https://arxiv.org/html/2607.25630#bib.bib5)]。在零样本设置中,模型仅接收任务指令,而少样本提示则额外提供少量输入输出示例。近期的研究已经将这些能力应用于科学和专业文本简化 [6 (https://arxiv.org/html/2607.25630#bib.bib6), 7 (https://arxiv.org/html/2607.25630#bib.bib7)]。他们的结果表明,LLM可以提高源领域外读者的可及性,但仍然存在幻觉、细微差别丢失和论断强度变化的风险。除了这些质量问题外,大多数广泛使用的基准测试来自新闻或维基百科,对科学论述和跨学科受众的覆盖有限 [8 (https://arxiv.org/html/2607.25630#bib.bib8)]。本文通过关注科学摘要并收集来自跨学科STEM读者的难度标注来弥补这一差距。 NLP中以人为中心的评估。自动指标如BLEU和ROUGE [10 (https://arxiv.org/html/2607.25630#bib.bib10), 11 (https://arxiv.org/html/2607.25630#bib.bib11)]以及可读性公式如Flesch-Kincaid [12 (https://arxiv.org/html/2607.25630#bib.bib12)]捕捉了表层重叠和流畅性代理,但与实际理解的相关性不完美——尤其是在技术性材料方面。简化文献强调评估意义保留、语法性和流畅性,而不仅仅是n-gram重叠 [13 (https://arxiv.org/html/2607.25630#bib.bib13)]。作为补充,以用户为中心的评估针对特定受众的简洁性和读者效用 [14 (https://arxiv.org/html/2607.25630#bib.bib14), 15 (https://arxiv.org/html/2607.25630#bib.bib15)],以及话语连贯性和信息充分性 [16 (https://arxiv.org/html/2607.25630#bib.bib16), 17 (https://arxiv.org/html/2607.25630#bib.bib17)]。实证证据表明,LLM生成的简化可以帮助非专业人士,但通常需要专家监督来保持精确性和适当的校准 [7 (https://arxiv.org/html/2607.25630#bib.bib7)]。 定位。我们的研究通过结合以下内容来实施这些见解:(i) 基线LLM简化;(ii) 来自计算机科学之外的STEM读者在理解度、自然度和简洁度方面的结构化反馈;(iii) 专家后期编辑以生成参考简化。这种设计直接针对可读性与领域保真度之间的已知权衡,并提供了一个与真实跨学科使用场景一致的语料库和评估设置。 ## 3 方法论 我们的方法结合了基于LLM的简化和针对性的人工反馈。它包括语料库选择、初始简化、两个阶段的用户研究,以及对所得简化的自动和定性评估。 ### 3.1 数据集 我们采用SciSummNet [9 (https://arxiv.org/html/2607.25630#bib.bib9)],这是一个包含1000篇高引ACL论文及其摘要、引用上下文和150词专家撰写的摘要的语料库。尽管这些摘要抓住了相应论文的核心贡献,但它们通常保留了密集的术语和复杂的句法结构。先前的研究表明,仅靠摘要并不能保证可读性,而不受限制的简化可能导致冗长或信息丢失 [18 (https://arxiv.org/html/2607.25630#bib.bib18)]。因此,我们将SciSummNet摘要作为源文本,为计算机科学之外的非专业读者进行简化,同时旨在保留其科学内容。 ### 3.2 基线简化 我们使用GPT-4o-mini在零样本设置下生成初始简化摘要,即不提供输入输出示例。系统提示要求模型为不具备该科学领域专业知识的读者和普通公众简化文本,识别复杂词汇或关键短语,并保留段落格式。用户提示提供论文标题和源摘要,要求模型在简化摘要的同时保留标题。确切的提示包含在已发布的仓库中。这些LLM输出作为后续人工评估和细化的基线。 ### 3.3 第一阶段:跨学科读者评估 参与者。参与者从计算机科学以外的STEM学科中招募,且英语流利。 设计。对于每次评估,向参与者展示原始的SciSummNet摘要及其GPT简化版本,顺序随机化。参与者 (i) 选择他们认为难懂的句子,(ii) 就“理解度”、“自然度”和“简洁度”进行三类比较判断:偏好原始版本、偏好GPT简化版本或表示无差异,以及 (iii) 突出显示他们认为复杂的特定词汇或短语。这些是界面中使用的标签;在其他地方,理解度和自然度有时分别使用密切相关的术语连贯性和流畅性进行讨论。在整个完成的评估中,每个维度产生了92个比较判断。标注界面和任务流程如图1 (https://arxiv.org/html/2607.25630#S3.F1) - 3 (https://arxiv.org/html/2607.25630#S3.F3)所示。 见图注 图1:第一阶段中选择难懂句子的界面。 见图注 图2:第一阶段中按理解度、自然度和简洁度比较摘要的界面。 见图注 图3:第一阶段中突出显示难懂词汇和短语的界面。 ### 3.4 第二阶段:专家编辑的简化 参与者和材料。编辑是具有较强英语能力的计算机科学研究生或研究人员。第二阶段任务涵盖92个候选摘要,其中47个已完成并作为当前语料库和评估中的专家编辑参考。对于每个项目,专家收到 (i) 原始摘要、(ii) GPT简化版本以及 (iii) 第一阶段中用户突出显示的难懂词汇或短语。 程序。专家按照以下四种指导情景创建专家编辑的参考简化: 1. 两个摘要都包含难懂段落:精炼并合并内容以确保清晰和保真度。 2. 仅原始摘要被标记:验证并在必要时编辑GPT简化版本。 3. 仅GPT版本被标记:纠正过度简化或表述生硬的部分。 4. 无标记:润色结构并确认意义保留。 我们的编辑指南强调,在需要精确性时保留技术术语,保持科学论断的强度和范围,并尽可能使用更短、结构清晰的句子。用户界面如图4 (https://arxiv.org/html/2607.25630#S3.F4)所示。 见图注 图4:第二阶段中创建专家编辑参考简化的界面。 ## 4 结果 我们评估 (i) 在第一阶段,跨学科STEM读者如何看待LLM生成的科学摘要简化版本,以及 (ii) 在第二阶段,根据自动指标,专家编辑的参考简化版本与LLM输出相比如何。我们通过定性分析来补充定量结果,说明自动简化在哪些方面有效,以及专家编辑在哪些方面仍然重要。 ### 4.1 第一阶段:跨学科读者判断 #### 偏好。 如图5 (https://arxiv.org/html/2607.25630#S4.F5) 所示,在92次判断中,参与者对LLM生成的摘要的“理解度”有73次偏好,对“简洁度”有70次偏好。这表明对简化版本有明显的描述性偏好。对“自然度”的判断更为均衡:42次表示无差异,而14次偏好原始摘要,这表明LLM输出偶尔存在风格不一致或过于非正式的表述。 理解度 自然度 简洁度 0 20 40 60 80 0 20 40 60 80 73 36 70 11 14 88 42 14 判断次数 GPT简化版本 原始 无差异 图5:第一阶段三个评估维度的比较判断。每个维度包含92次判断;未进行推断显著性检验。 #### 难度标注。 句子和短语层面的标注显示,参与者最常标记的是多名词复合词、未解释的缩写和特定领域术语。这些标注为第二阶段的编辑提供了信息,通过识别应在哪些方面扩展压缩的术语、改善话语流或澄清指代对象。 #### 定性见解。 参与者评论和突出显示(如图6 (https://arxiv.org/html/2607.25630#S4.F6) 和7 (https://arxiv.org/html/2607.25630#S4.F7) 所示)揭示了两个反复出现的张力:(1) 精确性与可接近性:用通用释义替换诸如“潜在变量”、“PCFG”或“NP-难”等术语可以提高可读性,但会降低技术精度;(2) 风格与自然度:LLM通常能提高局部清晰度,但偶尔会引入生硬或过于非正式的表述,而原始摘要通常保持更传统的学术风格。 自然度:“段落1整体上听起来更自然一些。它的用词(‘任意阈值’、‘正确性概念’、‘句子级QE系统’)符合标准学术英语,读起来流畅,而段落2中的一些替换——例如‘正确性的概念不容易理解’和‘选择的限制’——感觉有点非正式或生硬。两个段落语法上都正确,但段落1的词汇和措辞更符合传统的、流畅的学术风格。” 简洁度:段落1——它的句子稍短,插入语或堆砌短语较少,因此每个观点都以更清晰、更易理解的结构呈现。 “原始”:“我们提出了一项关于机器翻译置信度估计的详细研究。研究了确定【MT】输出是否正确的各种方法,包括【整个句子】和【单词】层面。由于在此上下文中【正确性的概念】并不直观清晰,因此提出了定义它的不同方法。我们引入了一个【句子级QE系统】,其中使用【任意阈值】将【MT输出】分类为好或坏。”
相似文章
基于思维树启发的混合方法:使用大语言模型进行法律案件判决摘要生成
提出一种基于思维树的抽取-生成混合方法,利用大语言模型进行法律案件判决摘要,在DeepSeek和LLama上的实验表明,该方法生成的摘要优于单独的抽取式或生成式方法。
忠实设计:为多利益相关方受众评估和改进LLM生成的临床试验摘要
本文引入了一个基准评估框架,用于衡量针对不同利益相关方受众的LLM生成临床试验摘要的忠实性。该研究测试了GPT-4o、Claude Sonnet 4.6和Gemini 2.5 Flash模型在1,800份摘要上的表现,并提出了一种知识图谱增强的检索系统,显著提升了忠实性得分。
ScholarSum:基于知识图谱推理与反思式优化的师生式抽象摘要生成
ScholarSum是一个层次化反思图框架,用于科学文献的抽象摘要生成,模拟了师生写作过程。它利用层次化知识图谱捕获全局结构,生成初稿,并通过证据检索和类似教师的审阅迭代地优化摘要,以提高流畅性和事实忠实性。
LaMSUM: 通过LLM引导的提取式摘要放大针对骚扰的声音
LaMSUM是一个新颖的多层次框架,使用LLM为公民举报平台生成大量骚扰事件报告的提取式摘要。该方法优于最先进的提取式摘要方法,并解决了有限的LLM上下文窗口和代码混合语言处理等挑战。
超越大语言模型:从叙事文本生成因果图的语言学方法
本文提出了一种混合框架,结合了LLM摘要、语言学基础的专家指数(Expert Index)以及STAC分类,用于从叙事文本生成因果图,在基准故事上超越了GPT-4o和Claude 3.5。