Naver-News-KO:一个用于开源微调摘要模型的韩语新闻摘要数据集

arXiv cs.CL 论文

摘要

本技术报告介绍了Naver-News-KO,一个包含27,400对(文档,摘要)的韩语新闻摘要数据集,数据来自Naver News,托管在Hugging Face上,用于微调Gemma-2B-ko和KoBART等开源摘要模型。

arXiv:2607.20442v1 公告类型: 新提交 摘要: 我们发布了Naver-News-KO,一个包含27,400对(文档,摘要)的韩语新闻摘要数据集,数据来自2022年7月为期十天的Naver News,涵盖两个类别(经济与IT/科学,比例为77/23),训练/验证/测试分区分别为22,194 / 2,466 / 2,740,平均每记录文档到摘要的字符压缩比为6.03倍。该数据集自2023年1月起在Hugging Face Hub上公开发布,截至2026年5月,每月下载量约为33,000次;社区维护的基于该数据集微调的韩语摘要模型包括Gemma-2B-ko及其Gemma2-9B变体。本技术报告(i)记录了采集协议、列模式及分区构建方法,(ii)报告了语料库层面的统计信息(长度分布、压缩比,以及测试集与训练集之间16.8%的近重复标题Jaccard重叠,用户需注意),(iii)将该资源与其他开源韩语摘要语料库进行了对比,(iv)提供了Lead-3抽取式基线(ROUGE-1 55.1,ROUGE-L 50.6)以及两个可复现的微调基线——KoBART(R-1 56.6,BERTScore-F1 81.5)和采用LoRA的Gemma-2B-ko(R-1 55.3,BERTScore-F1 78.3),并附发布时的训练脚本,(v)阐明了该资源的许可协议及预期使用范围。本报告旨在为已使用该数据集的后续工作提供可引用参考,而非提出新的基准。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:16

# 一个用于开源微调摘要模型的韩语新闻摘要数据集
来源:https://arxiv.org/html/2607.20442

###### 摘要

我们发布了**Naver-News-KO**,一个包含27,400个(文档,摘要)对的韩语新闻摘要数据集。该数据集于2022年7月连续十天从Naver News收集,覆盖两个类别(经济与IT/科学;77/23比例),训练/验证/测试分区分别为22,194 / 2,466 / 2,740,每条记录的文档到摘要平均字符压缩比为6.03×。该数据集自2023年1月起在Hugging Face Hub上公开托管,截至2026年5月,每月下载量约33,000次;社区维护的基于该数据集微调的韩语摘要模型包括Gemma-2B-ko和Gemma2-9B变体(§6 (https://arxiv.org/html/2607.20442#S6))。本技术报告:(i) 记录了收集协议、列模式(schema)和分割构建;(ii) 报告了语料层级的统计信息(长度分布、压缩比,以及测试集与训练集之间16.8%的近重复标题Jaccard重叠——用户应注意此问题);(iii) 将该资源与其他公开韩语摘要语料进行了定位比较(表1 (https://arxiv.org/html/2607.20442#S2.T1));(iv) 提供了一个Lead-3抽取式参考基准(ROUGE-1 55.1, ROUGE-L 50.6)以及两个可复现的微调基线——KoBART(R-1 56.6, BERTScore-F1 81.5)和带有LoRA的Gemma-2B-ko(R-1 55.3, BERTScore-F1 78.3)——并附有发布时的训练脚本;(v) 明确了该资源的许可和预期使用范围。目标是为已在使用该数据集的下游工作提供一个可引用的参考,而非提出新的基准。

## 1 引言

韩语新闻摘要是面向韩语的语言模型常见下游任务,然而,韩语中可公开再分发的摘要语料库相较于英语仍然十分有限。可公开获取的韩语资源大多受限于研究协议(例如AI Hub语料库)或仅限于具有限制性条款的单一新闻媒体。这种稀缺性导致从业者自行维护小规模、基于爬取的语料库,其中大多数在Hugging Face Hub上非正式发布,没有附带文档或基线。

Naver-News-KO就是此类资源之一。该数据集于2022年7月收集,2023年1月上传,已在韩语开源社区中获得持续采用:Hugging Face报告每月约33,000次下载(2026年5月),并且至少有两个衍生自该数据集、以Gemma类模型为骨干[1 (https://arxiv.org/html/2607.20442#bib.bib1)]的韩语摘要模型已公开发布。尽管如此,该数据集从未在任何可引用的文档中正式描述过:现有的模型卡仅列出了列名和收集日期。因此,下游用户无法引用该资源,无法评估其代表性,也没有共同的基线来比较自己的微调结果。

本技术报告填补了这一空白。我们记录了收集协议,报告了对于摘要研究重要的统计数据(长度分布、压缩比以及一个Lead-3抽取式参考点),发布了可复现的基线脚本,并明确了许可和预期用途。我们*并非*声称Naver-News-KO是一个适用于*一般*韩语摘要的基准:十天的收集窗口和两个类别的范围限制了其代表性(§9 (https://arxiv.org/html/2607.20442#S9))。我们将该数据集定位为其实际上已演变成的角色:一个轻量级、可公开再分发的语料库,用于在适度的计算资源上引导韩语摘要微调。

### 贡献。

(1) 为Naver-News-KO提供一份文档化的数据声明,包括收集范围、过滤条件、类别平衡、新闻社分布、分割构建和测量到的近重复审计。(2) 语料层级的长度和压缩统计,附带一个Lead-3抽取式基准值。(3) 随本文发布的可复现基线脚本(lead3, kobart, gemma2b)。(4) 与其他公开韩语摘要资源的比较(表1 (https://arxiv.org/html/2607.20442#S2.T1)),说明该语料库在何场景可用、何场景不可用。(5) 明确的许可和再分发讨论。

## 2 相关资源

### 英语新闻摘要语料库。

CNN/DailyMail、NYT、XSum和Newsroom[7 (https://arxiv.org/html/2607.20442#bib.bib7),2 (https://arxiv.org/html/2607.20442#bib.bib2)]建立了基于爬取的新闻摘要模板:标题/导语式摘要搭配文章正文,但已知存在对首句抽取式重叠的偏见。我们的资源继承了该模板和偏见。

### 韩语摘要资源。

表1 (https://arxiv.org/html/2607.20442#S2.T1)从三个维度比较了主要可公开访问的韩语摘要语料库:规模(文档或配对数量)、访问方式(直接再分发 vs. 在AI Hub上使用国民身份证注册)和摘要来源(人工撰写的抽象式摘要、爬取时提取的编辑摘要、或人工抽取式标注)。在这三个维度上,Naver-News-KO占据了一个特定的细分领域——*中等规模、可公开再分发、编辑摘要来源*。AI Hub语料库在规模上占优,但对非韩国国民以及在Hugging Face上镜像而言,访问条件不达标;sci-news-sum-kr-50可公开再分发但规模太小,不适合微调;在Hugging Face上,没有其他韩语摘要数据集的下载量能达到类似水平(截至2026年5月,排名其后的韩语摘要上传每月下载量落后约两个数量级)。

表1: 可公开访问的韩语摘要资源。†AI Hub列出了40万个源文档配对80万个摘要单元。“访问”标记是否需要AI Hub的韩国居民注册与审批流程。“再分发”标记许可是否允许第三方再分发(例如Hugging Face镜像)。来源:https://www.aihub.or.kr/aihubdata/data/view.do?dataSetSn=97, https://www.aihub.or.kr/aihubdata/data/view.do?dataSetSn=93, https://github.com/theeluwin/sci-news-sum-kr-50, https://huggingface.co/datasets/daekeun-ml/naver-news-summarization-ko。
### 韩语NLU基准(非摘要)。

几个韩语基准经常在摘要工作旁被引用,但*不包含*摘要任务。KLUE[6 (https://arxiv.org/html/2607.20442#bib.bib6)]涵盖八个NLU任务(主题分类、STS、NLI、NER、关系抽取、依存句法分析、MRC、对话状态追踪);KorQuAD 1.0/2.0是基于韩语维基百科的抽取式问答;KoBEST是一个五任务韩语NLU基准。据我们所知,目前不存在得到广泛采用、带有独立排行榜的韩语摘要*基准*;公开的韩语摘要工作使用表1 (https://arxiv.org/html/2607.20442#S2.T1)中资源的临时测试分割。

### 定位。

Naver-News-KO处于*中等规模、可公开再分发的*韩语摘要语料库的细分领域。它不是AI Hub在规模上的替代品;它是对“从博客文章复制爬虫脚本”这种非正式模式的替代,成为韩语摘要微调的事实上的起点。

## 3 收集协议

### 来源。

文章从Naver News (https://news.naver.com/) 收集,该聚合器索引来自多个韩语新闻媒体的文章。

### 时间窗口。

爬取在为期十天的时间窗口内进行,从2022年7月1日到2022年7月10日(含首尾两日)。

### 类别。

数据集中存在两个Naver News类别标签:经济(存储为economy, 경제;21,049条记录,76.8%)和IT/科学(存储为IT과학;6,351条记录,23.2%)。各类别长度统计差异显著:IT/科学类文档平均较长(平均1165字符 vs. 950字符),平均压缩比也更高(6.98× vs. 5.74×)。其他Naver News类别(政治、社会、体育、娱乐)*未被收集*;见§9 (https://arxiv.org/html/2607.20442#S9)。

### 新闻社分布。

文章涵盖81个不同的press值。排名前三的媒体——연합뉴스 (2,529)、뉴스1 (2,210)、뉴시스 (2,064)——合计占语料库的25.6%;接下来的十二家媒体贡献了另外的41.9%。通讯社聚合器(연합뉴스, 뉴스1, 뉴시스)的大量存在显著影响了分割泄漏行为(见下方“近重复审计”)。

### 日期分布。

虽然名义窗口为十天,但爬取量并不均匀:2022-07-04和2022-07-05合计贡献了49.1%的记录(分别为6,463和6,992条),而2022-07-09和2022-07-10合计仅贡献了1.5%。本次发布不由作者定义的时间感知分割。

### 每篇文章字段。

每条记录包含以下七个列:

- • date — 发布时间戳(YYYY-MM-DD HH:MM:SS)。
- • category — {economy, IT/Science}之一。
- • press — 发布媒体字符串。
- • title — 文章标题。
- • document — 文章完整正文。
- • link — Naver News上文章的规范URL。
- • summary — 源页面上与文章关联的摘要文本。

### 摘要来源。

summary字段是从Naver News页面可用的文章级摘要中填充的。这些摘要并非由数据集作者撰写;而是由来源媒体的编辑人员制作,并在爬取时从源页面提取。我们将其视为*新闻社编辑*摘要,而非众包生成的抽象式摘要。这种区别很重要,因为编辑摘要通常是基于文章导语进行编辑修改,而不是事后进行抽象式重写,这会导致参考重叠指标偏向抽取式行为(§4 (https://arxiv.org/html/2607.20442#S4), §9 (https://arxiv.org/html/2607.20442#S9))。

### 过滤条件。

document字段缺失或summary字段缺失的记录被删除。除了删除任一字段为空的记录行之外,未应用进一步的内容级过滤(例如长度上限、去重)。

### 分割。

数据集以作者定义的训练/验证/测试分割发布,分别包含22,194 / 2,466 / 2,740条记录(表2 (https://arxiv.org/html/2607.20442#S3.T2))。分割通过随机划分生成,未对press或date进行分层。如果用户需要*press*不重叠或*date*不重叠的评估,应从发布的全集重新分割。

### 近重复审计。

由于语料库以通讯社聚合器(연합뉴스, 뉴스1, 뉴시스)为主,这些机构的文章经常在多个媒体间被重新索引,我们测量了测试分割与训练分割之间的近重复重叠。使用标题字符三元组Jaccard作为廉价相似度代理,测试集中16.8%(461 / 2,740)的示例在训练集中存在Jaccard≥0.8的近邻,14.0%的示例存在Jaccard≥0.9的近邻;11.9%(327 / 2,740)的测试文档与某个训练文档共享完全相同的前200字符前缀。这些比率应被视为随机分割在基于通讯社重印的韩语新闻语料库上可能导致的训练/测试泄漏的上限,下游用户应将绝对测试分数视为被此幅度乐观估计。该审计可通过scripts/run_baselines.py的leakage子命令复现。

### 数据声明覆盖范围。

按照Bender和Friedman的数据声明模式的简短形式:策展理由——在可公开再分发的数据上引导韩语摘要微调;语言变体——通过韩语新闻社编辑风格过滤的标准书面韩语(ko-KR);说话者/作者人口统计学——未收集;文本是机构作者撰写的新闻文章;标注者人口统计学——不适用(摘要是编辑生成的,非事后标注);言语情境——书面新闻聚合,2022年7月;文本特征——编辑性新闻散文;录音质量——不适用(纯文本);其他——语料库包含可能快速过时的专有名词(政治家、公司、产品名)。

表2: Naver-News-KO 分割。

## 4 语料库统计

表3: 各文本字段的长度统计,基于全部27,400条记录通过scripts/run_baselines.py(stats子命令)计算。文档长度呈长尾分布(均值≫中位数);summary字段遵循相同模式。
### 长度。

document字段范围为29到16,889字符(中位数855,均值1,000);summary字段范围为59到1,838字符(中位数171,均值183)。两个字段的分布均为长尾(图1 (https://arxiv.org/html/2607.20442#S4.F1) a, b)。每条记录的字符压缩比 r_i = |document_i| / |summary_i| 的均值为6.03×(中位数4.88×;图1 (https://arxiv.org/html/2607.20442#S4.F1) c),大小上与CNN/DailyMail等英语新闻数据集相当,但这里由更长的源文档驱动,而非更短的摘要。注意,每条记录比率的均值(6.03)与边缘均值之比(999.9 / 183.1 = 5.46)不同,因为在长度分布下压缩比是超线性的。

参照图题图1: (a) document和(b) summary的每条记录字符长度分布,以及(c) 每条记录的压缩比。所有面板汇总了全部27,400条记录;虚线标记中位数,点线标记均值。尾部仅为了显示而被裁剪至4,000 / 600 / 20;表3 (https://arxiv.org/html/2607.20442#S4.T3)中的统计使用未裁剪的值。
### 类别平衡。

由于只爬取了两个类别且比例不均(77%经济 vs. 23% IT/科学;§3 (https://arxiv.org/html/2607.20442#S3)),Naver-News-KO*不应*用于衡量韩语新闻摘要的*跨领域*泛化能力。按类别进行分片评估对于领域内工作是合适的,但继承了3.3:1的大小不对称性。

### 抽取式重叠。

新闻社编辑流程产生的新闻摘要往往具有很高的导语偏向;Naver-News-KO也不例外。一个Lead-3抽取式基线(document的前三个句子)在测试分割上达到了ROUGE-1 55.1和ROUGE-L 50.6(表4 (https://arxiv.org/html/2607.20442#S5.T4)),这是一个很强的基准值,抽象式模型应与之进行比较。

## 5 基线

我们报告了一小部分模型在保留测试分割(n=2,740)上的摘要质量。报告了ROUGE-1 / ROUGE-2 / ROUGE-L[5 (https://arxiv.org/html/2607.20442#bib.bib5)]和BERTScore-F1[9 (https://arxiv.org/html/2607.20442#bib.bib9)];配置在表4 (https://arxiv.org/html/2607.20442#S5.T4)的标题中完全指定。所有行均通过发布的脚本(scripts/run_baselines.py)在单一随机种子下计算;此处未描述种子方差,下游用户在比较自己的微调结果时应对其进行估计(§9 (https://arxiv.org/html/2607.20442#S9))。

表4: Naver-News-KO测试分割(n=2,740)上的基线,使用贪心解码,单一随机种子。ROUGE F值(%)使用官方rouge_score实现[5 (https://arxiv.org/html/2607.20442#bib.bib5)]计算;BERTScore-F1(%)使用klue/roberta-base[9 (https://arxiv.org/html/2607.20442#bib.bib9)]作为参考编码器,未进行基线重新缩放,因此表中的值仅可在此表内比较,*不应*与使用roberta-large报告的英语BERTScore值直接比较。KoBART为gogamza/kobart-base-v2在我们的训练分割上微调3个周期,批量大小8,学习率3×10^(-5),

相似文章

通过人类反馈学习总结

OpenAI Blog

OpenAI展示了一种通过在人类偏好上训练奖励模型并使用强化学习微调模型来改进语言模型总结的技术,实现了在数据集间具有良好泛化性能的显著质量提升。这项工作通过大规模人类反馈推进了模型对齐,并具有超越总结任务的应用前景。

基于微调PEGASUS的抽象摘要优化

arXiv cs.CL

本文展示了在XL-Sum英语语料库上微调PEGASUS的方法,在ROUGE评分上相比基线mT5模型取得了显著提升,达到了当前最优结果。

优化基于词的L2韩语语法错误标注

arXiv cs.CL

本文通过解决现有资源中的问题(包括表面目标实现和单一参考评估),优化了L2韩语的基于词的语法错误标注,并展示了使用基于KoBART的纠错方法所取得的改进。

基于SSP构建用于细粒度方面级情感分析的评价标注数据

arXiv cs.CL

本文介绍了利用半自动符号传播(SSP)方法,构建用于电子商务评论细粒度方面级情感分析的韩语评价标注语料库(EVAD)。并在该数据集上评估了KoBERT和KcBERT模型,在方面-值对识别任务上取得了较高的F1分数。