CWF:一种面向个性化可靠科普写作的协作写作框架

arXiv cs.AI 论文

摘要

本文介绍了一种面向个性化可靠科普写作的协作写作框架,包括新数据集、基准测试和多智能体事实核查机制,实现了最先进的性能。

arXiv:2609.06126v1 公告类型:新 摘要:我们引入个性化可靠科普写作,一项需要适应不同认知水平受众并保持事实准确性的新任务。然而,提高个性化往往会引入简化,增加幻觉和事实扭曲的风险。为了解决这些挑战,我们首先构建了一个包含39,134条条目的数据集和一个以读者为中心的个性化科学交流基准测试(PSCB),共同评估受众适应性和事实准确性。为了减少数据和计算需求,同时提高跨领域和受众的泛化能力,我们引入了DA-MoE,通过单独建模明确地将受众适应与领域知识解耦。为了在证据稀缺场景下实现稳健的验证和修订,提出了一种多智能体事实核查机制,通过角色特定的智能体辩论增强有限证据,并在图上传播置信度。在PSCB上的实验表明,我们的方法实现了最先进的性能。我们的代码已在https://github.com/DPInnovationWorks/CWF上开源。
查看原文
查看缓存全文

缓存时间: 2026/09/10 08:47

# CWF:面向个性化与可靠科普写作的协同写作框架  
来源:https://arxiv.org/html/2609.06126  
符瑞彪  
所属机构:华中科技大学新闻与信息传播学院,武汉 430074,中国  
汤迪  
所属机构:华中科技大学新闻与信息传播学院,武汉 430074,中国  
杨云龙  
所属机构:华中科技大学新闻与信息传播学院,武汉 430074,中国  
王然  
所属机构:华中科技大学新闻与信息传播学院,武汉 430074,中国  
所属机构:教育部大数据与国家传播战略哲学社会科学实验室,武汉 430074,中国  
陆思成  
所属机构:华中科技大学新闻与信息传播学院,武汉 430074,中国  
吴佩璇  
所属机构:华中科技大学新闻与信息传播学院,武汉 430074,中国  
范晓宇  
所属机构:华中科技大学新闻与信息传播学院,武汉 430074,中国  
马嘉成  
所属机构:华中科技大学新闻与信息传播学院,武汉 430074,中国  
罗浩哲  
所属机构:华中科技大学新闻与信息传播学院,武汉 430074,中国  
肖阳  
所属机构:多谱信息智能处理技术国家重点实验室,华中科技大学人工智能与自动化学院,武汉 430074,中国  
\{furuibiao3,tangdi030223,yunlongyang64,xiaoyuf30\}@gmail\.com  
\{rex\_wang,loo\_seychan,w\_px,jiacheng\_ma,luo\_haozhe,Yang\_Xiao\}@hust\.edu\.cn  

###### 摘要  
我们提出**个性化与可靠科普写作**这一新任务,要求在保持事实准确性的同时,适应不同认知水平的受众进行科学解释。然而,提高个性化程度常会引入简化,从而增加产生幻觉和事实扭曲的风险。为解决这些挑战,我们首先构建了包含39,134个条目的数据集,并提出了一个以读者为中心的**个性化科学传播基准(PSCB)**,该基准共同评估受众适应性和事实准确性。为降低数据与计算需求,同时提升跨领域和跨受众的泛化能力,我们引入了DA-MoE(解耦适应混合专家)模型,该模型通过分别建模,明确地将受众适应与领域知识解耦。为在证据稀缺的场景下实现稳健的验证与修订,我们提出了一种多智能体事实核查机制,该机制通过特定角色的智能体辩论来增强有限的证据,并利用图结构传播置信度。在PSCB上的实验表明,我们的方法达到了最先进的性能。我们的代码已开源:https://github.com/DPInnovationWorks/CWF。  

\footnotetext{三位作者对本文贡献均等。}  
\footnotetext{通讯作者。}  

## 1 引言  

(见插图)  
图1:专业方法(微调和基于RAG的方法)与协同写作框架(CWF)的比较。  

科普写作旨在以准确且易于理解的方式向受众传播科学知识。大型语言模型(LLMs)通过实现跨领域和跨写作风格的灵活文本生成,为这一任务带来了新的可能。然而,有效的科普写作不仅需要流畅的生成。生成的文章应在写作风格和认知适应上贴合目标受众,同时保持事实准确性。现有方法主要依赖提示工程<cit.>、基于检索的验证<cit.>或监督微调(SFT)<cit.>。尽管这些方法有效,但它们通常将写作风格、受众适应和事实准确性视为独立的目标,难以生成既个性化又可靠的文章。这一局限性在SFT中尤为明显。高质量的科普写作通常需要耦合领域知识、受众适应和写作风格的对齐数据<cit.>。此类数据的收集成本高昂,因为它必须同时包含准确的知识和受众适应性的表达。此外,作为一个生成任务,科普写作可能产生事实遗漏和幻觉性解释。因此,关键挑战不仅在于降低对大规模配对数据用于领域和受众适应的依赖,还在于在整个生成过程中确保事实准确性。  

现有基准未能充分应对这一挑战,它们通常只强调科普写作中的风格偏好<cit.>或事实准确性<cit.>,很少在一个统一的基准中同时考虑两者。受众适应通常会改变解释粒度、类比使用、隐含推理和概念简化,这可能增加生成无支持信息或事实扭曲的风险<cit.>。因此,我们引入PSCB基准用于个性化与可靠的科普写作,如图1所示。PSCB共同评估认知适应和事实准确性。除了读者态度和个性化对齐,PSCB首次引入**认知负荷**<cit.>作为指标,并将指标分解为细粒度维度,以评估超越表面风格的认知适应。  

为解决联合对齐数据成本高昂以及平衡个性化与事实准确性的困难,我们设计了**协同写作框架(CWF)**。我们首先引入了一种用于科普写作的解耦MoE(混合专家)架构。该框架放宽了对包含目标受众和科学知识的配对数据的要求。这一设计使我们能够构建一个不依赖于领域与受众之间联合对齐的39,134条目数据集,从而支持在不同科学领域和读者群体中进行训练。然而,简单的MoE在迁移到新领域时面临困难,因为在不同领域生成文章可能需要重新训练整个模型。我们提出了DA-MoE,其核心思想是将适应任务分配给独立的可插拔专家,并将受众特定的适应与领域特定的知识分离,从而使认知适应和知识可以从不同来源学习。这允许仅通过轻量级训练即可适应新领域。  

科普写作不仅需要认知适应。即使精心个性化的生成也可能包含遗漏、无支持的主张或幻觉,因此事实验证至关重要。因此,CWF在生成过程中加入了一个事实核查模块以保持事实准确性。然而,基于RAG的方法在直接证据稀少或冲突时表现不佳,因为它们主要依赖检索到的证据,而不是通过推理间接观点或证据来获得额外支持<cit.>。此外,大多数事后事实核查方法依赖于对完成输出的直接模型判断,不仅产生不可量化的结果,也无法指导写作过程<cit.>。进一步地,我们提出了一种结合多智能体辩论和图推理的验证机制。具体来说,多智能体辩论模拟了交互式评审过程,并通过引入互补视角和拓宽检索角度来帮助验证主张,尤其是在直接证据不完整时。干预措施将验证应用于生成过程中,而非仅在生成之后,使得多智能体的事实反馈能够引导写作过程本身。最后,图推理将主张、检索到的证据和智能体推理连接起来,使得从间接观点推断额外证据成为可能,同时使事实判断可追溯,而非黑箱决策。  

总之,本文的主要贡献如下:  
- •首次提出**个性化与可靠的科普写作**任务。我们进一步引入了人类对齐的基准PSCB,共同评估受众适应性和事实准确性。  
- •我们提出了一种用于科普写作的DA-MoE框架,该框架将领域知识与受众适应解耦,减少了对配对训练数据的依赖,并实现了向新领域的低成本泛化。  
- •我们提出了一种基于图推理的多智能体事实核查机制。它模拟辩论过程以支持多视角验证、生成过程中的干预,并提供可量化的置信度分数以实现稳健的主张验证。  

## 2 相关工作  

**科普写作。**计算语言学领域的近期工作研究了如何将科学内容转化为普通受众可理解的语言。Goldsack等人<cit.>和Cheng等人<cit.>将此问题构建为通俗摘要或学术到公众的释义,通过构建配对数据集和基准(包括PLOS、eLife和VTechAGP)。Fang等人<cit.>和Jiang等人<cit.>进一步研究了LLM生成的生物医学摘要的事实错误,或使用多智能体交互来提高科学新闻报道生成的可靠性。然而,现有研究通常分别处理认知适应和事实准确性,没有提供一个统一的框架来同时考虑科普写作中针对不同读者的个性化和事实准确性。为弥合这一差距,我们提出了个性化与可靠的科普写作任务,并引入PSCB共同评估读者适应性和事实准确性。  

**个性化与可控写作。**个性化生成主要利用少样本提示或SFT<cit.>。然而,基于提示的方法在处理长文本时往往表现不佳,而微调则对有效建模目标风格有严格的数据要求。这一局限性在结合异构风格时尤为突出,因为这需要构建能联合捕获多种风格模式的昂贵数据集<cit.>。为减少这种依赖,我们提出了DA-MoE,它将受众适应与领域知识解耦,实现了跨读者群体和科学领域的灵活组合。  

**大语言模型中的事实核查。**传统上,事实核查严重依赖人类评估者,这一过程不仅耗时昂贵,而且容易产生主观偏见<cit.>。随后,结合LLMs与RAG的方法出现,以整合外部数据库<cit.>。然而,由于缺乏深层推理能力,它们在直接证据稀少或冲突时往往表现不佳。近期方法提出了将复杂主张分解为原子单元<cit.>或模拟多智能体辩论<cit.>。通过为原始主张补充额外上下文,这些方法实现了多角度判断。然而,它们仍然是事后的、静态的,无法主动指导生成过程。此外,虽然模拟多智能体辩论引入了交互式推理,但它们依赖模型判断而没有提供严格的度量标准。为解决这些问题,我们提出了一种验证框架。通过将多智能体辩论与图结构结合,我们的方法不仅综合了多样化的视角来处理不完整的证据,还为各个推理节点提供了可量化的置信度分数,确保了验证过程的透明性。  

**评估基准。**现有基准要么强调科学传播中的可读性和受众可及性<cit.>,要么关注生成文本中的事实准确性<cit.>。然而,这两条研究路线通常被分开研究,不足以评估面向不同受众的科普生成。我们的**个性化科学传播基准(PSCB)**评估生成的科普文章是否既可靠又适应其目标读者。在现实世界的科学传播中,一篇有效的文章不仅要传达基于科学的知识,还应根据不同读者群体调整其概念难度、解释策略和传播风格。因此,PSCB包含两个互补的评估分支:**事实可靠性**和**受众适应性**。  

(见插图)  
图2:CWF概览,该框架集成了协同写作、个性化风格建模以及结合多智能体讨论的事实核查,以提升AI生成科普文章的质量和相关性。  

## 3 协同写作框架  

如图2所示,所提出的CWF旨在生成连贯的、

相似文章

@hwchase17: https://x.com/hwchase17/status/2071963622298050997

X AI KOLs Timeline

文章讨论了AI代理中新兴的'wiki记忆'模式,其中原始源数据被智能压缩成一个持久、结构化的知识层,代理可以高效地使用它。文章将其与基础RAG进行了比较,并给出了DeepWiki和LLM Wiki等例子。