通过偏好学习从多个不完美指标优化摘要的事实一致性
摘要
本文介绍了一种通过偏好学习聚合多个弱指标的分数来提高文本摘要事实一致性的方法,在各种语言模型上实现了一致的事实性提升。
arXiv:2605.26840v1 Announce Type: new
摘要:将评估指标作为奖励的强化学习被广泛用于增强语言模型的特定能力。然而,对于诸如事实一致性摘要等任务,现有指标仍不成熟,限制了它们作为塑造模型行为的信号的有效性。虽然单个事实性指标不可靠,但它们的组合可以更有效地捕捉多样化的事实错误。我们利用这一见解,引入了一个自动训练流程,通过聚合不同弱指标的分数来提高摘要的事实一致性。我们的方法通过将分数映射到偏好并过滤掉指标间高度不一致的情况,避免了复杂的奖励塑造。对于每个源文档,我们通过改变解码策略生成词汇相似的摘要对,使模型能够学习由细微词汇差异引起的事实差异。这种方法仅使用源文档就构建了一个高质量的偏好数据集。实验表明,从早期的编码器-解码器架构到现代大型语言模型,各模型均获得一致的事实性提升,较小的模型也能达到与较大模型相当的事实性。
查看缓存全文
缓存时间: 2026/05/27 09:11
# 通过多不完美指标的偏好学习优化摘要的事实一致性 来源: https://arxiv.org/abs/2605.26840 查看PDF (https://arxiv.org/pdf/2605.26840) > 摘要:使用评估指标作为奖励的强化学习被广泛用于增强语言模型的特定能力。然而,在事实一致性摘要等任务中,现有指标仍不成熟,限制了它们作为信号来塑造模型行为的效果。尽管单个事实性指标不可靠,但它们的组合能更有效地捕捉多样化的事实错误。我们利用这一见解,引入了一个自动化训练流程,通过聚合不同弱指标的分数来提高摘要的事实一致性。我们的方法避免了复杂的奖励塑造需求,而是将分数映射到偏好,并过滤掉指标间高度不一致的情况。对于每个源文档,我们通过改变解码策略生成词汇相似的摘要对,使模型能够从细微词汇差异所导致的事实差异中学习。这种方法仅使用源文档即可构建高质量的偏好数据集。实验表明,在从早期编码器-解码器架构到现代大型语言模型的各类模型中,事实性持续提升,较小的模型能达到与较大模型相当的事实性。 ## 投稿历史 来自: Yuxuan Ye [查看邮件 (https://arxiv.org/show-email/5733012b/2605.26840)] **\[v1\]** 2026年5月26日 星期二 10:55:03 UTC (21,531 KB)
相似文章
通过人类反馈学习总结
OpenAI展示了一种通过在人类偏好上训练奖励模型并使用强化学习微调模型来改进语言模型总结的技术,实现了在数据集间具有良好泛化性能的显著质量提升。这项工作通过大规模人类反馈推进了模型对齐,并具有超越总结任务的应用前景。
评估文本摘要的抽象性度量:一种改进的公式及其经验验证
本文引入了参考抽象度(RA)、摘要抽象度(SA)和抽象比率(AR)等度量指标,通过使用文档长度的调和均值与三次非重叠因子来量化文本摘要中的抽象性。在XSUM数据集上对四种模型进行的经验评估表明,这些度量能够有效区分抽取式摘要和生成式摘要,并能识别潜在的幻觉问题。
用于令牌高效且语义保持的观点摘要的大语言模型
本文提出一个利用大语言模型进行观点摘要的框架,该框架结合多维分类和分层采样,在降低令牌使用量的同时保持语义多样性和观点间的平衡。
基于微调PEGASUS的抽象摘要优化
本文展示了在XL-Sum英语语料库上微调PEGASUS的方法,在ROUGE评分上相比基线mT5模型取得了显著提升,达到了当前最优结果。
RIMS:通过平滑多对聚合进行偏好优化以用于小规模语言模型检索增强生成
本文提出了RIMS,一种面向小规模语言模型在检索增强生成中的三阶段偏好优化框架,利用合成思维链数据和可微软聚合机制来提高对噪声证据的鲁棒性。实验表明,在多跳问答基准上,该方法相较于基线持续取得改进。