DistilledGemma:多语言历史文章中人物-地点关系抽取的效率与准确性平衡

arXiv cs.CL 论文

摘要

本文介绍了DistilledGemma,一个用于从多语言历史报纸文章中抽取人物-地点关系的系统,该系统采用从26B参数的Gemma教师模型到2.3B参数的学生模型的三阶段知识蒸馏流程,在HIPE-2026共享任务中实现了具有竞争力的准确性和效率。

arXiv:2606.29130v1 公告类型:新 摘要:我们提出了DistilledGemma,这是一个高效且准确的系统,用于HIPE-2026共享任务中的多语言(英语、德语和法语)历史报纸文章的人物-地点关系抽取。我们的方法采用三阶段知识蒸馏流程,旨在平衡分类准确性与计算效率。在第一阶段,我们系统地探索了八种大型语言模型的提示工程策略,以确定针对这一挑战性任务最有效的推理架构。在第二阶段,我们通过QLoRA对Gemma 4 26B A4B教师模型进行监督微调(SFT),利用其强大的多语言能力在训练语料库上生成银标准思维链轨迹。在最后阶段,我们进行响应级蒸馏,将这些学习到的推理模式迁移到紧凑的Gemma 4 E2B学生模型中。在官方评估中,我们的团队WHEREAMI在标准测试集上排名第三,准确率平均分为0.688;在二元测试集上排名第二,平均分为0.8156。值得注意的是,通过将知识从26B教师模型蒸馏到2.3B学生模型,我们保留了强大的推理能力,同时将部署模型的有效参数规模缩减至约2.3B;训练中使用的LoRA适配器在推理时已合并到学生模型中。这一配置在标准测试集和二元测试集上的均衡效率-准确性剖面中均排名第二。这些结果表明,知识蒸馏为历史文档处理提供了一种实用且可扩展的解决方案,在不造成过高计算成本的情况下实现了具有竞争力的性能。
查看原文
查看缓存全文

缓存时间: 2026/06/30 05:30

# DistilledGemma:面向多语言历史文章中人物-地点关系提取的平衡效率与准确性

来源:https://arxiv.org/html/2606.29130

\\conference

评估论坛会议与实验室 (CLEF) 2026

[电子邮件:[email protected]] \\fnmark[1]

[电子邮件:[email protected]] \\fnmark[1]

[电子邮件:[email protected]]

[电子邮件:[email protected]]

\\fntext

[1] 同等贡献。

###### 摘要

我们提出了 **DistilledGemma**,这是一个高效且准确的系统,用于 HIPE-2026 共享任务:从英语、德语和法语的多语言历史报纸文章中提取人物-地点关系。我们的方法采用三阶段知识蒸馏流程,旨在平衡分类准确性与计算效率。在第一阶段,我们系统地探索了八种大语言模型的提示工程策略,以确定针对此挑战性任务最有效的推理架构。在第二阶段,我们通过 QLoRA 对 Gemma 4 26B A4B 教师模型进行监督式微调 (SFT),利用其强大的多语言能力,在整个训练语料库上生成银标准思维链轨迹。在最后阶段,我们执行响应级蒸馏,将这些学习到的推理模式迁移到紧凑的 Gemma 4 E2B 学生模型中。为了解决正负关系对之间的类别不平衡问题并强制语义一致性,我们在所有生成的输出上采用了基于规则的后处理。具体来说,此步骤强制了实体类型兼容性、关系方向约束、上下文触发模式以及逻辑约束。在官方评估中,我们的团队 WHEREAMI 在标准测试集上排名第三,准确率概况平均得分为 0.688;在二值测试集上排名第二,平均得分为 0.8156。值得注意的是,通过将知识从 26B 教师模型蒸馏到 2.3B 学生模型,我们保留了强大的推理能力,同时将部署模型的有效参数量减少到约 2.3B;训练期间使用的 LoRA 适配器在推理时已合并到学生模型中。此配置在标准测试集和二值测试集上的平衡效率-准确性概况中均排名第二。这些结果表明,知识蒸馏为历史文档处理提供了一种实用且可扩展的解决方案,无需过多的计算成本即可实现具有竞争力的性能。

## 1 引言

历史报纸是研究过去社会、移民模式和地缘政治事件的宝贵资源。解锁这些信息的关键步骤是 **人物-地点关系提取**:判断文章中提及的人物是否与其中提及的地点存在地理关联。

HIPE-2026 共享任务 [opitz2026clef, opitz_overview_2026, opitz_extended_2026] 将此问题形式化为对从英语、德语和法语多语言报纸文章中提取的 (人物, 地点) 对的分类任务。每对必须标记两种关系:`at`(该人物是否*曾*与该地点有关联;TRUE/PROBABLE/FALSE)和 `isAt`(该人物是否*在文章直接描述的时间范围内*位于该地点;TRUE/FALSE),如图 1 (https://arxiv.org/html/2606.29130#S1.F1) 和 2 (https://arxiv.org/html/2606.29130#S1.F2) 所示。

参考图注图 1:`at` 和 `isAt` 关系区别的示意图。
参考图注图 2:HIPE-2026 中 `at` 和 `isAt` 关系区别的示意图。`at` 关系捕获历史或一般关联,而 `isAt` 表示人物在文章描述时所在的位置。

此任务存在若干挑战:

- • **有噪声的 OCR 文本**:历史文档包含频繁的光学字符识别错误,降低了实体提及的质量。
- • **类别不平衡**:`FALSE` 标签在两种关系中占主导地位(`at` 约占 ∼55%,`isAt` 约占 ∼78%),使模型偏向于负面预测。
- • **多语言推理**:模型必须在三种类型多样的语言上表现一致,且各语言训练数据可用性不同。
- • **隐含证据**:许多人物-地点关联是隐含的而非明确陈述的,需要世界知识和上下文推理。

大语言模型 (LLM) 在关系提取方面展现了令人印象深刻的零样本和少样本能力 [wadhwa2023revisiting, wan2023gpt],但容量足够大的模型(例如 26B+ 参数)对于需要处理数百万文档的数字人文学科流程而言并不实用。这促使了我们的核心研究问题:**我们能否将大型、微调的 LLM 的关系提取能力蒸馏到一个足够小、适合实际部署的模型中,且不会导致灾难性的性能损失?**

我们的贡献如下:

1. 1. **对八种 LLM 配置的全面评估**,涵盖提示工程、零样本推理和监督式微调,用于三种语言的人物-地点关系提取。
2. 2. **一个三阶段蒸馏流程**,通过 QLoRA 微调 Gemma 4 26B A4B 教师模型,生成带有思维链 (CoT) 推理的银标准训练数据,并在教师模型的输出上训练 Gemma 4 E2B 学生模型。
3. 3. **经验证据**表明知识蒸馏可以恢复教师模型性能的约 88%,为历史 NLP 应用建立了实用的效率-准确性权衡。

## 2 相关工作

#### 基于编码器的关系提取。

在近期转向生成式 LLM 之前,关系提取通常被构建为对标记实体对的判别式分类,使用手工设计的特征 [zhang-etal-2017-position] 或上下文编码器 [pathak2016context]。这些轻量级基线对于低资源和类别不平衡场景仍然很重要,因为它们直接以实体片段为条件,并且只需要一个小型的任务头。实体感知表示学习,包括来自实体链接文本的与任务无关的关系表示 [baldini2019matching]、类型化实体标记模型 [zhou2022improved] 以及 PL-Marker 片段对打包 [ye2022packed],为句子级 RE 提供了强大的基线。跨语言编码器(如 XLM-R [conneau2020xlmr])和实体感知多语言编码器(如 mLUKE [ri2022mluke])对于多语言 HIPE 风格的数据尤其相关。对于更长的文章级证据,文档级 RE 基准(如 DocRED)强调了跨句子和实体提及综合证据的必要性 [yao2019docred]。最近的多语言和数字人文学科 RE 工作也使用了引导式远程监督来构建德语传记关系数据并评估多语言迁移 [plum2024guided]。低资源 RE 基准表明,类别平衡、数据增强和自训练是有用的替代方案,但它们在长尾标签分布下的收益可能不一致 [xu2022towards]。因此,这些方法是强大的轻量级基线,也是我们 LLM 蒸馏流程的补充替代方案。

#### 使用 LLM 进行关系提取。

近期工作表明,LLM 可以通过上下文学习 [wan2023gpt] 和思维链提示 [wei2022chain] 进行竞争性的关系提取,尤其是在预测标签之前引发显式推理步骤时。Wadhwa 等人 [wadhwa2023revisiting] 表明,GPT 类模型在标准基准上匹配或超越监督式基线,尽管计算成本显著更高。

#### 历史 NLP。

HIPE 共享任务系列 [hipe2022, ehrmann2023extended] 推动了历史文本中命名实体识别和链接的重大进展,建立了跨多种语言和时间段的标准基准。这些任务突显了独特的挑战,包括 OCR 噪声、古语用法以及现代 NLP 基准中不存在的领域特定实体类型。HIPE-2026 版本 [opitz_overview_2026] 将该系列扩展到人物-地点关系提取,引入了同时考虑准确性和计算效率的新评估概况。

#### 知识蒸馏与教师对齐。

Hinton 等人 [hinton2015distilling] 引入了知识蒸馏 (KD) 作为一种模型压缩技术,其中紧凑的学生网络学习模仿较大教师模型的输出分布。对于生成模型,序列级 KD 训练学生使用完整的教师输出,而不仅仅是 token 级分布 [kim2016sequence]。这种范式已被广泛采用于语言模型:DistilBERT [sanh2019distilbert] 压缩 BERT 同时保留其 97% 的性能,而 MiniLLM [gu2024minillm] 将 KD 扩展到自回归 LLM,使用策略级的反向 KL 目标。诸如 GKD [agarwal2024gkd] 等在线策略方法通过在学生自己的生成上进行训练并允许替代的 KL 散度,进一步改进了标准 KD。更接近我们的设置,基于理由和解释轨迹的蒸馏方法表明,小型模型可以从 LLM 生成的推理监督中受益 [hsieh2023distilling, mukherjee2023orca]。基于偏好的对齐方法,如 DPO [rafailov2023dpo],通过优化成对的教师或人类偏好而非直接模仿单个教师响应,提供了另一条途径。在低资源 RE 中,自训练和置信度校准也是可行的替代方案;例如,PRiSM 在仅有少量标注数据可用时,使用关系感知分数校准文档级 RE 的对数几率 [choi2023prism]。在我们的工作中,我们采用了 **响应级** 蒸馏策略,其中教师的基于证据的解释和标签输出作为学生的银标准训练数据,将结构化推理迁移与标准 SFT 的简单性相结合,避免了这些替代方案所需的额外偏好构建或置信度阈值调整。

#### 参数高效微调。

LoRA [hu2022lora] 及其量化变体 QLoRA [dettmers2023qlora] 通过仅训练低秩适配器矩阵而保持基础模型权重冻结,使得在消费级硬件上微调数十亿参数的模型成为可能。我们在整个流程中利用 QLoRA 进行教师和学生训练,使整个工作流程在单个 GPU 上即可实现。

## 3 方法

我们的方法遵循一个三阶段流程,如图 3 (https://arxiv.org/html/2606.29130#S3.F3) 所示:(1) 通过系统实验进行模型选择,(2) 教师微调和银标准数据生成,以及 (3) 学生蒸馏。

参考图注图 3:DistilledGemma 三阶段流程概览。首先,评估多种 LLM 配置和提示策略以选择最强的教师模型。然后微调教师模型并用于生成思维链银标准注释,随后用于将知识蒸馏到紧凑的学生模型中。

### 3.1 阶段 1:模型选择与提示工程

我们评估了多个配置中的多种 LLM 系列:

#### 提示工程。

我们设计了五种提示变体,范围从最小的零样本基线到结构化的思维链模板,后者引导模型在输出标签之前进行明确的证据评估。表现最佳的提示(思维链)如列表 1 所示,用于所有 LLM 候选的基础模型选择阶段,以预测 `at` 和 `isAt` 关系。它将模型角色设定为历史学家,定义两种关系标签,强调 OCR 鲁棒性和保守推理,强制标签之间的逻辑依赖关系,并要求生成简洁、基于证据的 JSON 输出。

你是一位历史学家,正在研究多语言历史欧洲报纸中的人物-地点关系。

请仔细阅读,注意可能存在的 OCR 噪声,并且每个判断都必须仅基于此处提供的文档文本和元数据。

任务:

- 为人物和地点分类“at”关系。允许标签:TRUE, PROBABLE, FALSE
- 为人物和地点分类“isAt”关系。允许标签:TRUE, FALSE

关系含义:

- “at” = 文章提供文本证据表明该人物在出版前的某个时间曾在该地点。
- “isAt” = 文章支持该人物在文章的直接时间范围内(即当前、正在进行或相对于出版日期非常近期)位于该地点。

决策指南:

- 仅当文本给出明确的在场证据时,才将“at”标记为 TRUE。
- 仅当文本给出间接、部分或微弱的但仍指向在场的证据时,才将“at”标记为 PROBABLE。
- 当文章不支持在场时,将“at”标记为 FALSE。
- 仅当文章清楚地将人物置于当前、正在进行或非常近期的框架中时,才将“isAt”标记为 TRUE。
- 切勿将“isAt”标记为 PROBABLE。它必须是 TRUE 或 FALSE。
- 如果“at”是 FALSE,则“isAt”也必须是 FALSE。
- 如果“isAt”是 TRUE,则“at”也必须是 TRUE。

规则:

- 不要使用外部知识。
- 不要推断超出文本允许的范围。
- 当证据缺失或过于不确定时,首选 FALSE。
- 仅返回 JSON。
- 使用为当前对提供的精确人物和地点字符串。
- 对文本和实体提及中的 OCR 噪声和换行符伪影保持鲁棒。
- 即使提到因转义换行符、连字符或轻微 OCR 拼写噪声而不同,也要将明显等价的提及表面形式视为同一实体。
- 首先写下 'at_explanation',然后决定 'at'。
- 然后写下 'isAt_explanation',然后决定 'isAt'。
- 每个解释保持简洁,最多 100 个单词。
- 每个解释必须仅提及文章中的证据,而非你的推理过程。

文档语言:{language}
出版日期:{publication_date}
文章文本:
{article_text}
{pair_context}

列表 1:用于 LLM 推理、教师生成和学生微调的提示模板。

#### 模型系列。

我们评估了来自四个系列的模型:**Gemma** [gemma2team2024](E2B, E4B 和 26B A4B)、**Qwen** [qwen3](2B 到 9B)、**Mistral** [mistral2024ministral](3B)和 **HY-MT** [zheng2025hymt](1.8B)。模型通过 vLLM [kwon2023vllm] 进行高效批量推理。

#### 训练策略。

除了零样本提示之外,我们还探索了使用 LoRA [hu2022lora] 在 HIPE 训练数据上进行监督式微调 (SFT)。SFT 数据是通过将每个带标签的 (人物, 地点) 对转换为聊天格式记录来准备的,其中提示作为用户消息,金标准 JSON 作为助手响应。

### 3.2 阶段 2:教师微调

我们评估了 **Gemma 4 26B A4B** [gemma4modelcard2026],使用了与选择阶段相同的提示。我们选择它作为教师模型,因为它在零样本宏观平均召回率(跨语言 0.7255)上表现最强,并且与目标学生模型属于同一模型系列。

教师模型使用 QLoRA [dettmers2023qlora] 进行微调,配置如下:

- • **LoRA**:秩 r=32,α=64,dropout 0.1,应用于所有注意力和 MLP 投影(q/k/v/o/gate/up/down)。
- • **训练**:3 个 epoch,批大小 1,梯度累积 32(有效批大小 32),余弦学习率调度,η=2×10⁻⁴,5% 预热。
- • **数据**:来自 EN/DE/FR 新闻和沙箱训练分区的所有标记对,采用 90/10 分层训练/开发划分。

训练后,LoRA 适配器被合并到基础模型中以进行高效推理。然后,合并后的教师模型用于在整个训练语料库上生成银标准标签,并为每对生成带有 `at` 和 `isAt` 预测的思维链解释。

### 3.3 阶段 3:学生蒸馏

学生模型 (Gemma 4 E

相似文章

HIPE-2026 概述:从多语言历史文本中抽取人物-地点关系

arXiv cs.CL

本文介绍了HIPE-2026的结果,这是HIPE评测系列的第三版,专注于从法语、德语和英语的多语言历史文档中提取基于时间的人物-地点关系。对17个参赛团队在预测准确性、计算效率和跨领域泛化能力方面进行了评估。

Gemma 4 技术报告

arXiv cs.CL

Gemma 4 引入了新一代开放权重、原生多模态语言模型,采用密集和混合专家架构,具备思考模式以进行高级推理,提高了效率并支持长上下文能力。

Gemma 4 技术报告

Hugging Face Daily Papers

Gemma 4 技术报告介绍了新一代开放权重、原生多模态语言模型,采用多样化的架构,推理能力增强,并在各项任务中性能提升。模型参数范围从 2.3B 到 31B,并具备生成推理轨迹的思考模式。