FrenchNews-7: 跨发布者法国新闻编辑部分类基准测试

arXiv cs.CL 论文

摘要

本文介绍了FrenchNews-7,一个用于跨多个发布者分类法国新闻编辑部的基准,特点是一个微调的CamemBERT分类器以及与LLM基线的评估。

arXiv:2608.18097v1 公告类型:新 摘要:我们介绍了FrenchNews-7,一个基于法国的法语新闻编辑部跨发布者分类基准,结合了一个大型多出版物语料库、一个基于URL的七类分类法和一个微调的CamemBERT分类器。标签通过混合流程分配,结合发布者URL标识符和LLM注释,用于结构模糊的情况,通过评审者间研究进行审计(2名人类+2个LLM;配对$\kappa \geq 0.766$,人类-人类$\kappa = 0.806$)。我们评估了词汇、多语言和特定于法语的训练分类器,在分布内和排除发布者设置下,并在排除池上与零样本LLM基线(GPT-OSS-120B、Mistral Small 3.2、Llama-3.3-70B)进行了额外比较。最强的模型,基于完整文章文本的CamemBERT-base,优于仅标题输入,泛化到未见出版物,并在总体召回率(0.799)上超过所有三个零样本LLM基线,差距集中在模糊的编辑边界类别Economie和Societe上。跨发布者评估揭示了边界稳定性不均:Sport、Culture & Loisirs和International转移干净,而Economie(召回率 = 0.517)接近盲评人类一致性(0.55),Societe(精确率 = 0.577)吸收了边界模糊性,两者都表明了编辑惯例而非可恢复的分类器提升空间。微调的CamemBERT-base模型、标签清单、参考收集脚本和可靠性层级指南表可在以下位置获取:https://huggingface.co/LeFrenchNewsLab/camembert-base-frenchnews7(模型)和https://huggingface.co/datasets/LeFrenchNewsLab/frenchnews-7(数据集)。
查看原文
查看缓存全文

缓存时间: 2026/08/20 09:57

# FrenchNews-7:跨出版商标签的法语新闻编辑部分类基准
来源:https://arxiv.org/html/2608.18097
###### 摘要

我们提出FrenchNews-7,一个基于法国法语新闻的跨出版商编辑部分类基准。该基准结合了大规模多来源语料库、基于URL的七类别分类体系以及经过微调的CamemBERT分类器。标签通过混合流程分配,该流程将出版商URL片段与针对结构模糊情况的大语言模型标注相结合,并通过标注者间信度研究(2名人类+2个大语言模型;配对κ≥0.766,人类间κ=0.806)进行审核。我们在分布内和留出出版商设置下评估了词汇、多语言及法语特定的分类器,并额外与在留出样本上进行的零样本大语言模型基线(GPT-OSS-120B、Mistral Small 3.2、Llama-3.3-70B)进行比较。最强模型CamemBERT-base在全文本上优于仅使用标题的输入,能泛化到未见过的媒体机构,并在总体召回率(0.799)上超越了所有三个零样本大语言模型基线,差距集中在模糊的编辑边界类别*Économie*(经济)和*Société*(社会)上。跨出版商评估揭示了边界稳定性的不均衡:*Sport*(体育)、*Culture & Loisirs*(文化与休闲)和*International*(国际)能够清晰迁移,而*Économie*(召回率=0.517)接近盲测人类一致性(0.55),*Société*(精确率=0.577)则吸收了边界模糊性,两者都表明是编辑惯例而非可恢复的分类器提升空间。微调的CamemBERT-base模型已发布在Hugging Face(https://huggingface.co/LeFrenchNewsLab/camembert-base-frenchnews7),标签数据集发布于(https://huggingface.co/datasets/LeFrenchNewsLab/frenchnews-7),同时提供了参考收集脚本以协助重新抓取,以及一个可靠性等级指导表。

FrenchNews-7:跨出版商标签的法语新闻编辑部分类基准

Amr Sobhy, Le French News Lab, [email protected]

关键词:文本分类;法语自然语言处理;CamemBERT;混合标注;经验分类法;大语言模型标注;跨出版商泛化;计算新闻学;比较媒体研究;FrenchNews-7

## 1 引言

对法语新闻的计算比较媒体研究(议程设置研究、媒体多样性审计、纵向主题覆盖分析)需要一种能在不同出版商间可靠工作的分类器。现有的法语新闻语料库要么是单一媒体来源(Scialom等人,2020年),要么范围过于狭窄无法泛化,据我们所知,此前没有法语基准直接针对这种跨出版商设置。FrenchNews-7填补了这一空白,提供了植根于法国新闻生态系统的编辑部分类基础设施:一个包含来自13家法国媒体机构87,637篇文章的标注语料库,配有跨模型基准测试和留出样本的跨出版商评估。

标签是经过协调的编辑部类别:当可用时从出版商的URL片段推断(72.2%),当URL不携带编辑部信号时,由大语言模型将内容标注到相同分类体系中(27.8%)。这与基于内容的主题分类不同:编辑部的分配(当存在时)是目标变量本身,而非潜在主题的嘈杂代理。该基准衡量的是自动分类器仅从文章文本中恢复这些编辑路由决策的可靠性,这一任务在计算新闻学中有直接应用,因为下游分析依赖于跨媒体机构规模化分配编辑版块。构建跨出版商基准需要两个实际决策:使用什么标签空间,以及如何大规模获取标签。对于标签空间,我们使用语料库中13家媒体机构的URL结构分析来识别七类符合以下条件的类别:(a)至少出现在13家出版商中的10家;(b)各自占总产出的至少3.5%。得到的类别是*Société*(社会与国内事务)、*Culture & Loisirs*(文化与休闲)、*International*(国际)、*Politique*(国内政治)、*Sport*(体育)、*Économie*(经济)和*Sciences & Technologies*(科学与技术)。对于标注,混合管道(§3.3)结合了确定性的URL片段规则和对模糊情况的大语言模型标注。

FrenchNews-7贡献了一个编辑部分类语料库和一个在分布内及留出出版商条件下进行评估的CamemBERT分类器(§5.1, §5.4)。

## 2 相关工作

#### 新闻主题分类。

早期的TF-IDF + SVM方法(Joachims, 1998年)为文本分类建立了强大的基准环境;Lewis等人(2004年)将RCV1确立为该领域的大规模标准基准。后续的神经网络工作扩展到了大规模数据集,如AG News(Zhang等人,2015年)。BERT家族的编码器(Devlin等人,2019年;Liu等人,2019年;He等人,2021年)随后取得了显著的性能提升,关注点转向了更困难的设置:分层分类、跨语言迁移和特定语言的新闻分类。我们的挑战不同:无需大规模人工标注的跨出版商泛化。

#### 法语自然语言处理。

CamemBERT(Martin等人,2020年)是一个基于RoBERTa的编码器,在约138GB的法语文本上进行预训练,在法语基准测试中取得了最先进的结果。CamemBERTav2(Antoun等人,2024年)更新了架构(DeBERTaV3)和训练数据(2750亿词元),将序列长度限制扩展到1024个词元。FlauBERT(Le等人,2020年)提供了FLUE基准套件。我们识别到的最接近的先前法语新闻分类器是lincoln/flaubert-mlsum,111 在 Hugging Face 模型库中可用 (huggingface.co/lincoln/flaubert-mlsum)。一个在MLSUM(Scialom等人,2020年)上微调的FlauBERT模型,其10类分类体系源自*Le Monde*的URL片段;由于*Le Monde*占我们语料库的37.8%,直接比较会引入数据污染问题。Pelloin等人(2024年)使用教师-学生方法将法语广播转录文本分为18个受IPTC启发的类别;他们的工作是最接近的方法论先例,但针对的是少数广播来源的音频内容。在纸质媒体方面,Escouflaire等人(2024年)使用CamemBERT与基于特征的分类器区分了比利时和加拿大法语新闻中的观点与事实报道(一个相关但正交的文体分类问题):是二元观点与事实新闻检测,而非跨出版商的编辑部路由。

#### 基于大语言模型的标注。

Gilardi等人(2023年)表明,零样本ChatGPT在多个标注任务上优于众包工人,同时每个标签的成本约为人工的1/30。Törnberg(2023年)表明GPT-4在政治文本上匹配或超越了人类专家标注者。Pangakis和Wolken(2024年)证明,使用GPT-4标注数据微调的分类器在14个任务上匹配了人类标注基线。我们的Bucket B仅对结构模糊的文章(27.8%)应用此范式,而大多数标签是确定性的。Lu和Smith(2025年)警告了大语言模型标注模型中非随机错误传播的风险;我们的混合设计通过将72.2%的标签锚定在出版商编辑决策上来缓解这一问题。

#### 跨出版商协调化。

各个出版商使用专有分类体系。我们识别到的最接近的工作是Kuzman和Ljubešić(2025年):EMMediaTopic使用GPT-4o将21,000篇四种非法语文本标注为17个IPTC类别,然后训练XLM-RoBERTa-large(宏F1=0.746)。lincoln/flaubert-mlsum模型卡(同上)提供了源自URL片段的单出版商分类体系先例;FrenchNews-7将此信号扩展到13家出版商,并将跨媒体机构协调化作为一个独特挑战引入。我们没有识别到将URL衍生分类体系、多媒体法语数据、混合标注和留出跨出版商评估结合在单一基准中的先前工作。

#### 分类体系可比性。

我们将分类体系错配视为可量化的障碍,通过在不重新训练的情况下在FrenchNews-7测试集上探测EMMediaTopic分类器(Kuzman和Ljubešić,2025年)来衡量它,这是一个最坏情况探测:法语文本,未见过的标签空间。结构性分类体系错配仅占相对于我们CamemBERT模型观察到的性能差距的一半以下;主要因素是跨语言领域转移(完整结果见附录D)。最大的分类体系冲突具有启发性:“冲突、战争与和平”(一个IPTC类别,在FrenchNews-7中没有对应项)是第三高频的预测(占测试文章的9.3%),吸收了FrenchNews-7分配到*International*或*Politique*的法国地缘政治内容。性能差距反映了结构性分类体系不匹配,而非表示能力的局限,仅靠模型重新训练无法解决这一区别。

## 3 数据集构建

### 3.1 分类体系设计

为了构建适合跨出版商分类的标签空间,我们分析了语料库中13家出版商的URL结构,而非采用外部本体论。每家出版商直接在其文章URL路径段中编码其编辑版块(例如,lemonde.fr/politique/, lexpress.fr/sport/)。我们从所有87,637篇文章中提取第一段路径,并根据编辑意图将其分组为语义家族,得到13个候选家族,按数量和跨出版商覆盖率排名。

表1显示了结果。我们应用两个纳入标准:(a)出现在≥10家/13家出版商中;(b)语料库份额≥3.5%;两者必须同时满足。3.5%的阈值位于第七名家族(*Sciences & Technologies*:3.5%,10/13家出版商)和第八名(*Environnement*:2.2%,10/13家)之间1.3个百分点的差距中,这是上层排名中相邻候选者之间最大的降幅。低于第七名家族的候选者要么缺乏数量(*Santé* 1.2%,*Médias* 1.0%),要么缺乏跨出版商共识(*Régional*:5家出版商,*Opinion*:6家)。

表1:按数量排名的候选URL家族。规则标记了七个家族的断点;较低家族被吸收到语义父类中或推迟到Bucket B。URL路径缺失或不可解析的2,890篇文章通过Bucket B进行标注。断点以下家族的吸收决定:*Santé*和*Environnement*归入*Société*(国内社会事务包含健康和地方环境内容);*Médias*归入*Culture & Loisirs*(媒体评论和电视报道);*Opinion*和*Régional*片段不携带明确的主题信号,推迟到Bucket B进行大语言模型标注。任何离散分类体系都涉及务实的边界决定;我们透明地报告我们的决定,以便未来工作可以扩展标签空间(例如,将*Environnement*或*Santé*提升为独立类别)而不使现有的七类标注失效。

七个类别是:*Société*(社会:国内社会事务、健康、教育、犯罪)、*Culture & Loisirs*(文化与休闲:艺术、电影、书籍、休闲)、*International*(国际事务、地缘政治)、*Politique*(国内政治、制度)、*Sport*(体育)、*Économie*(经济:商业、金融、市场)和*Sciences & Technologies*(科学与技术:研究、技术、数字化)。*Environnement*(环境)不是一个独立类别;环境内容分布在*Société*和*Sciences & Technologies*中。附录C提供了这七个类别到顶级IPTC媒体主题标准的映射,记录了自下而上经验推导与独立制定的国际标准之间的趋同。

### 3.2 数据收集

我们从13家基于法国的法语媒体机构收集了87,769篇文章。这些机构是根据公开存档的可用性以及构建能够结构性代表法国媒体格局的跨面所需的必要性而选择的,有意跨越了全国性日报和周报、政治杂志、地区报刊、数字原生媒体机构和广播新闻,主要覆盖2018-2026年,并有稀疏的存档尾巴延伸到2005年(4%的文章早于2018年)。通过文章文本的SHA-256哈希进行去重(移除132条重复记录)并过滤掉标题和正文为空的记录后,最终语料库包含87,637篇文章。每篇文章记录存储了标题、完整正文、发布日期、来源URL以及出版商的原始URL片段。

表2列出了所有13家媒体机构。*Le Monde*占主导地位(37.8%);其余12家各贡献2.1%至10.4%。Bucket A的覆盖率从100%(JDD)到34.3%(Slate.fr)不等。

表2:按出版商划分的语料库组成。类型:NP = 全国性报刊,RP = 地区报刊,DN = 数字原生媒体,BR = 广播网络媒体。Bucket A = 确定性片段-标签份额。*去重后;移除了132条重复记录。

媒体机构集合的意识形态多样性(横跨左翼 [*L’Humanité*]、中左 [*Le Monde*, *HuffPost*]、中间 [*JDD*, *TF1 INFO*]、中右 [*L’Express*, *Le Point*] 和右翼 [*Le Figaro*])确保了类别边界是从政治异质的报道中学习的,降低了分类体系学到政治倾向性而非基于主题区别的风险。

### 3.3 双桶标注流程

标注遵循双桶流程,在可能的情况下优先进行确定性标签分配而非模型判断。

#### 桶A:基于片段的标注(63,302篇文章,72.2%)。

对于URL路径片段明确映射到分类体系类别的文章,标签通过包含74条规则的确定性查找表分配。规则按类别组织:20个片段映射到*Culture & Loisirs*(例如,cinema, musique, livres),10个映射到*International*(例如,monde, europe, afrique),7个映射到*Sport*(例如,sport, rugby, jo-paris-2024),8个映射到*Sciences & Technologies*,2个映射到*Politique*,6个映射到*Économie*,21个映射到*Société*。出版商片段覆盖率(表2)范围从100%(JDD)到34.3%(Slate.fr)。

#### 桶B:大语言模型标注(24,335篇文章,27.8%)。

URL片段不携带明确类别信号的文章归入桶B。三种片段类型触发大语言模型标注:

相似文章

移民之声与地方新闻:弥合社区需求与媒体内容差距的洞察

arXiv cs.CL

# 弥合社区需求与媒体内容差距的洞察 来源:[https://arxiv.org/html/2604.16651](https://arxiv.org/html/2604.16651) ## 移民之声与地方新闻:弥合社区需求与媒体内容差距的洞察 作者:Paula Dolores Rescala [paula\.rescala@epfl\.ch](https://arxiv.org/html/2604.16651v1/mailto:[email protected]),EPFL 瑞士 Victor Bros [vbros@idiap\.ch](https://arxiv.org/html/2604.16651v1/mailto:[email protected]),Idiap Research Institute 及 EPFL 瑞士 与 Daniel Gatica