基于归一化的法医作者验证似然比估计

arXiv cs.CL 论文

摘要

本文提出了两种新的归一化技术(平方根校正和罕用词校正),用于从LambdaG作者验证方法推导似然比,无需单独校准模型,减少了数据需求和复杂性,同时在法医文本比较中实现了相当或更优的性能。

arXiv:2607.09501v1 公告类型:新 摘要:作者验证(AV)是判断两篇文本是否由同一作者撰写的任务。在法医背景下,AV证据的强度可通过似然比进行量化。大多数AV方法基于分数,要从这些分数推导出经过良好校准的似然比,需要单独的校准模型,而这又需要额外数量的案例相关数据,获取和准备这些数据往往耗时。本研究提出了两种新的归一化技术——平方根校正和罕用词校正,用于从AV方法LambdaG(Nini et al. 2026)推导似然比,无需校准模型。这些校正旨在减轻因文本过长或高度重复而可能导致的证据强度高估。我们使用对数似然比成本(Cllr)对十五个语料库以及不同文本长度(100-9,500词元)下的逻辑回归校准进行了性能评估。所提方法达到了与逻辑回归校准相当的性能,其中罕用词校正在大约45%的测试(按语料库加权)中优于逻辑回归校准。此外,当罕用词校正被逻辑回归校准超越时,其性能更频繁地接近(差异在5%以内),而反向比较时则不然。消除训练校准模型的需求降低了数据需求、时间和复杂性,从而提高了法医文本比较的可及性和透明度。这种经验性能与实际优势的结合,支持了所提方法在法医场景中的采用。
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:58

# 基于归一化的似然比估计方法在法庭作者身份验证中的应用 来源:https://arxiv.org/html/2607.09501 ###### 摘要 作者身份验证(AV)是一项判断两篇文本是否由同一作者撰写的任务。在法庭语境下,AV证据的强度可以通过似然比进行量化。大多数AV方法基于评分,要从这些评分中推导出良好校准的似然比,需要一个单独的校准模型。而这又需要额外数量的案件相关数据,获取和准备这些数据通常很耗时。本研究提出了两种新颖的归一化技术——平方根校正和罕用词校正,用于从LambdaG AV方法(Nini等人,2026)中直接推导似然比,无需校准模型。这些校正旨在减轻可能因长文本或高度重复文本导致的证据强度高估。使用对数似然比代价(Cllr)在十五个语料库和不同文本长度(100–9,500个词例)范围内,与逻辑回归校准进行了性能比较。所提方法达到了与逻辑回归校准相当的性能,其中罕用词校正在大约45%的测试中(按语料库加权)优于逻辑回归校准。此外,当罕用词校正被逻辑回归校准确切时,其性能更频繁地接近(在5%以内),而反向比较则不然。消除训练校准模型的需求降低了数据需求、时间和复杂性,从而提高了法庭文本比较的可及性和透明度。这种实证性能与实践优势的结合支持了所提方法在法庭环境中的采用。 ###### 关键词: 作者身份验证,校准,似然比 ††期刊:Forensic Science International\\affiliation \[1\]organization=The University of Manchester, Department of Linguistics and English Language,addressline=Oxford Road,city=Manchester,postcode=M13 9PL,postcodesep=\\affiliation\[2\]organization=The University of Manchester, Department of Computer Science,addressline=Oxford Road,city=Manchester,postcode=M13 9PL,postcodesep= t1t1footnotetext:This work was supported by the North West Social Science Doctoral Training Partnership (NWSSDTP) [ES/P000665/1].## 1 引言 在整个法庭科学领域,似然比框架已被公认为评估证据的“逻辑和法律”认可标准(Ishihara等人,2022,第183页;Forensic Science Regulator,2021,第26页)。该框架要求比较证据在两个竞争假设下的概率。虽然似然比框架在DNA分析中已牢固确立(Balding and Nichols, 1994;Taylor等人,2013),并在法庭语音比较中经过充分验证(Rose, 2006;Morrison, 2011),但其在法庭文本比较中的应用仍相对新颖(Ishihara, 2017;Grant, 2022;Nini等人,2026)。对于基于评分的系统,可以通过一个称为“校准”的过程(Morrison, 2013,第174页;van der Vloed, 2024)推导出对数似然比(LLR)。这涉及训练一个单独的校准模型,该模型学习必要的变换,以使预测概率与经验结果频率对齐(Guo等人,2017;Silva Filho等人,2023,第3215页;Pull and Hurlin, 2025,第2页)。在实践中,校准最常通过逻辑回归实现(Brümmer and du Preez, 2006;Gonzalez-Rodriguez等人,2007;Morrison, 2013)(详见第3节),这需要全面且针对案例的训练数据。编译这样的数据集通常可能复杂且计算量大。数据最好应反映案件条件(Morrison, 2024),然而,这具体意味着什么并不明显。为了证明校准数据是否足够产生正确校准的LLR,必须进行额外的测试。如果LLR未正确校准,则不被视为有效且可靠的法庭证据(Ramos and Gonzalez-Rodriguez, 2013,第164页;Vergeer等人,2021,第14页)。因此,在许多法庭学科中,包括法庭文本比较,校准是产生有意义LLR的关键步骤。 许多法庭文本比较案件涉及作者身份验证(AV)。这是一项判断争议作者身份的文本是否与已知作者身份的文本由同一人撰写的任务(Koppel等人,2012,第284页;Potha and Stamatatos, 2014;Juola, 2021)。AV之所以可能,是因为个体持续重复使用语言模式(Coulthard, 2004;Mollin, 2009;Wright, 2017),而这些模式的独特组合可用于识别作者。本研究关注一种近期提出的AV方法——LambdaG(Nini等人,2026)。LambdaG在第4节中概述。该方法以未校准LLR的形式返回一个分数。为确保该分数可解释,仍需要单独的后续校准。本文研究了AV分数的性质,并检验了归一化(将值缩放至共同尺度)在此背景下是否提供了校准的功能等效替代方案。在第5节中,我们介绍了两种新颖的归一化技术——平方根校正(解决文本长度对AV分数的影响)和罕用词校正(基于相对于规模的独特性度量调整分数)。我们使用15个多样化的数据集对这些技术进行评估,涵盖学术论文、报纸文章、博客文章、四个评论语料库、Wikipedia讨论页、两个论坛语料库、两个电子邮件语料库、聊天记录、短信和推文。对于部分语料库,文本长度被系统性地变化,范围从100到9,500个词例。这使我们能够测试文本长度是否会在分数归一化中引入偏差。评估结果总结在第7节。结果表明,跨语料库平均而言,性能最佳的归一化技术(罕用词校正)在45.4%的测试中优于基线逻辑回归校准。在56.91%的损失情况下,该校正的性能与基线相当,保持在逻辑回归校准的5%以内。通过消除对单独校准模型的需求,同时保持相当的性能,也消除了校准模型所带来的局限性。特别是,数据需求减少,进而降低了方法的时间成本和复杂性。总之,本研究有助于为法庭AV开发更易获得、更高效且更易解释的方法。## 2 似然比 对数似然比是证据价值的一种度量,量化了在两种对立假设下观察到给定证据的相对概率(Biedermann等人,2016)。它定义为在控方假设(Hp)为真时观察到证据(E)的概率与在辩方假设(Hd)为真时观察到证据的概率之比的对数(Ishihara, 2021,公式1): LLR=log(P(E|Hp)/P(E|Hd)) (1) 在法庭AV的背景下,两种对立的假设可能是: > Hp:候选作者撰写了争议文档 > Hd:候选作者未撰写争议文档 LLR的大小代表了证据支持某一假设相对于另一假设的强度。然而,在法庭文本比较中,领先的方法通常输出相似度分数而非校准后的LLR(Evert等人,2017;Grieve等人,2019a)。目前,没有任何AV方法能在没有单独校准模型的情况下产生良好校准的LLR。例如,最为人熟知的AV方法之一——冒充者方法,会产生一个介于0和1之间的分数,需要校准为LLR(Koppel and Winter, 2014)。同样,基于神经网络的最先进AV系统LUAR和STAR产生余弦相似度分数,若不校准为LLR,仅适用于比较性评估(Rivera-Soto等人,2021;Huertas-Tato等人,2024)。此外,近期提出的AV方法LambdaG以未校准LLR的形式产生分数,该值被构建为LLR,但未经进一步处理则无法进行概率解释(Nini等人,2026)。因此,所有现有的AV方法都需要校准,我们将在下一节解释这一点。## 3 校准 校准涉及通过缩放和平移等变换调整原始模型分数(Morrison等人,2011,第61页),使得结果值能够进行有意义的LLR解释。对于一个完美校准的系统,计算系统输出的LLR会返回与输出本身相同的值(Morrison, 2024)。 ### 3.1 应用校准 为了阐明校准的概念及其在AV中的作用,考虑天气预报的类比(Dawid, 1982;DeGroot and Fienberg, 1983)。直观上,一个良好校准的天气预报系统是:当预报有70%的概率下雨时,实际上70%的时间会下雨(DeGroot and Fienberg, 1983,第13页)。因此,校准后的预报产生的预测对应于观察到的相对频率(Silva Filho等人,2023,第3215页),使其适合概率解释。相反,如果70%的预报后只有60%的时间下雨,则模型系统性地高估了降雨的可能性。在这种情况下,报告的概率不能被视为经验频率的可靠估计,表明需要校准。 对于本身未良好校准的LLR系统,校准涉及训练一个模型,将原始输出转换为适当尺度上的可解释值。在天气预报中,校准模型是在历史预报数据与观测到的天气结果配对的基础上训练的(Wilks, 2009)。该模型学习参数,将原始预测变换为更好地符合实际结果。这使得预报能够以概率术语进行解释,从而可靠地用于决策——例如,“下雨的可能性有多大?因此,我是否应该带伞?” ### 3.2 AV中的校准 与天气预报类似,AV系统的输出并不总是良好校准的。AV系统可能产生类似于似然比(LR)的输出,由相似性和典型性度量组成,但概率(P(E|Hp)和P(E|Hd))可能不准确。这可能反映出,即使AV系统基于认知语言学理论(Nini, 2023),个体语言产生的复杂性和不完全理解也限制了AV模型简化底层生成机制(Argamon, 2008;Nini等人,2026)。如果模型的假设不准确,估计的概率不太可能反映观察到的证据的真实概率。 虽然未校准的LLR可能正确地对证据强度进行排序,但其数值大小不可解释。这意味着这些值不能可靠地表示给定每个假设下证据的可能性。因此,需要进一步的过程将系统输出转换为校准后的LLR。最常见的是使用逻辑回归校准(Ishihara, 2011,第51页;Morrison, 2013)。 ### 3.3 逻辑回归校准 逻辑回归校准最初为说话人识别而建立(Gonzalez-Rodriguez等人,2007;Brümmer and Doddington, 2013;Morrison, 2013),现已应用于各种法庭科学学科(Biosa等人,2020;Macarulla Rodriguez等人,2024;Ishihara等人,2022)。在实践中,逻辑回归校准的主要挑战之一是获取和准备训练逻辑回归模型所需的数据。 #### 3.3.1 校准数据 逻辑回归校准所需的训练数据包括来自给定法庭分析系统的输出以及伴随的真值标签。在AV背景下,这需要一组标记为同源(同一作者撰写)或异源(不同作者撰写)的文本对。必须包含属于两种来源类别的文本对。由于语言使用在不同语境下有所变化(Biber, 2012),不同条件可能导致语言特征的系统性变异,进而影响AV分数。为确保逻辑回归变换能够推广到案件数据,文本必须反映案件的条件(Morrison, 2024)。然而,与案件数据充分相似的阈值并未明确定义(Morrison, 2021),应更接近的精确参数也未明确。

相似文章

对数似然、辛普森悖论与机器生成文本的检测

arXiv cs.CL

本文通过指出基于似然的机器生成文本检测器在 token 分数聚合中存在的辛普森悖论,解决了此类检测器性能下降的问题。本文提出了一种学习到的局部校准步骤,显著提升了各种模型和数据集上的检测性能。

检索增强的语言校准

arXiv cs.CL

本文提出检索增强的语言校准(RALC),一种事后流水线方法,通过将语言置信度建模为分布并使用检索增强重写来校准大语言模型中的置信度信号。它引入了忠实度散度指标,并在多个基准测试中展示了显著改进。