标签
本文引入了参考抽象度(RA)、摘要抽象度(SA)和抽象比率(AR)等度量指标,通过使用文档长度的调和均值与三次非重叠因子来量化文本摘要中的抽象性。在XSUM数据集上对四种模型进行的经验评估表明,这些度量能够有效区分抽取式摘要和生成式摘要,并能识别潜在的幻觉问题。
本文展示了在XL-Sum英语语料库上微调PEGASUS的方法,在ROUGE评分上相比基线mT5模型取得了显著提升,达到了当前最优结果。
ScholarSum是一个层次化反思图框架,用于科学文献的抽象摘要生成,模拟了师生写作过程。它利用层次化知识图谱捕获全局结构,生成初稿,并通过证据检索和类似教师的审阅迭代地优化摘要,以提高流畅性和事实忠实性。
本文将对基于最优传输的幻觉检测扩展到NMT和抽象式摘要中的所有解码器层,发现检测主要集中在早期层,并且由于忠实性失败无法通过注意力集中检测到,几何信号在摘要任务中迁移效果不佳。
提出MASF,一种多模型自适应选择框架,集成多个微调后的Transformer摘要模型并选取最高质量摘要,在CNN/DailyMail上达到88.63%的BERTScore,优于多个大型语言模型。