欺骗语义:法律领域欺骗检测与通用领域最先进方法的基准测试

arXiv cs.CL 论文

摘要

本文综述并评测了法律语境下基于NLP的自动欺骗检测,比较了微调Transformer和七个大语言模型(LLM)在七个数据集上采用多种提示策略的表现。结果表明存在明显的领域敏感性:微调模型在数据丰富的通用领域表现出色,而少样本LLM在低资源法律场景中具有竞争力。

arXiv:2607.29066v1 公告类型:新 摘要:欺骗检测对法律诉讼、执法和在线安全具有关键影响。尽管人类判断在准确性和可扩展性方面存在局限,自然语言处理(NLP)提供了一种数据驱动的替代方案。我们针对法律领域对基于NLP的自动欺骗检测(ADD)进行了综述和比较分析,回顾了从基于特征的机器学习到大型语言模型(LLM)方法的演变。我们在七个数据集(两个法律领域,五个通用领域)上进行了统一的实证评估,比较了六个微调Transformer模型和七个LLM在四种提示策略下的表现。结果显示强烈的领域敏感性:微调模型在数据丰富的通用领域表现优异,而少样本LLM在低资源法律环境中仍具竞争力。思维链提示通常在直接分类中表现不佳。这些发现强调了在高风险法律场景中对领域适应和可解释系统的需求。
查看原文
查看缓存全文

缓存时间: 2026/08/03 07:35

# 语义诡计:法律谎言检测与通用领域最先进方法的基准测试
Source: https://arxiv.org/html/2607.29066
\(2026\)

###### 摘要\.

谎言检测在法律诉讼、执法和在线安全等领域具有重要影响。尽管人类判断在准确性和可扩展性方面存在局限,自然语言处理(NLP)提供了一种数据驱动的替代方案。我们针对以法律领域为重点的NLP自动谎言检测(ADD)进行了综述和比较分析,回顾了从基于特征的传统机器学习到大语言模型(LLM)方法的演变。我们在七个数据集(两个法律领域,五个通用领域)上进行了统一的实证评估,比较了六个微调transformer模型和七个LLM在四种提示策略下的表现。结果表明强烈的领域敏感性:微调模型在数据丰富的通用领域表现优异,而少样本LLM在低资源的法律环境中仍具有竞争力。思维链提示往往不如直接分类。这些发现强调了在高风险法律语境中领域适应性和可解释系统的必要性。

谎言检测、自然语言处理、机器学习、大语言模型、法律谎言、语言分析

††版权:ACM授权††出版年份:2026††DOI:XXXXXXX.XXXXXXX††CCS:计算方法论 自然语言处理††CCS:应用计算 法律††CCS:计算方法论 机器学习

## 1\. 引言

谎言检测是刑事调查、法律诉讼、欺诈预防和社交媒体等多个领域的关键挑战,对执法和司法系统具有重大影响。在法律语境中,风险尤其高:未被发现的谎言可能阻碍司法公正,而误报则可能导致错误指控和公众信任的丧失。当前实践基于主观判断和对陈述与证词进行资源密集型的人工分析。自动化谎言检测系统可以通过标记可疑陈述来辅助决策,同时减轻人类分析员的认知负担。然而,法律领域面临独特的挑战:隐私约束导致训练数据稀缺、误报成本高,以及对可解释性和问责制的严格要求。

### 1\.1\. 范围与贡献

我们对基于NLP的谎言检测进行了结构化综述和比较分析,重点关注法律和警务情境。我们追溯了从传统机器学习到现代LLM方法的演变,并在七个公开数据集(两个法律领域,五个通用领域)上进行了统一实验,比较了六个微调transformer模型(RoBERTa、BERT、DeBERTa、ALBERT、DistilBERT、T5)和七个LLM(GPT-4o、LLaMA、Gemma2、Phi变体)在四种提示策略下的表现。我们的分析揭示了领域敏感性模式、提示策略有效性、温度敏感性以及实际限制,以指导未来研究走向有效且可问责的ADD系统。

## 2\. 相关工作

### 2\.1\. NLP在谎言检测中的演变

早期的谎言研究主要集中在非语言信号上。然而,越来越多的证据表明,语言行为为欺骗意图提供了更可靠和可扩展的指标,使得无需持续人工干预即可进行计算分析。实证研究表明,人类评判者在谎言检测中的表现仅略高于随机水平(54\-60%的准确率)(Li等,2020 (https://arxiv.org/html/2607.29066#bib.bib1)),这促使人们采用能够从大型文本语料库中识别细微语言模式的计算方法。

基于文本的自动谎言检测(ADD)经历了三个主要阶段。早期方法依赖于人工设计的语言和心理特征(LIWC指标、n\-gram、词性(POS)标记)与经典机器学习分类器(支持向量机(SVM)、随机森林)相结合。神经表示学习使模型能够直接从文本中捕获语义和上下文信息,减少对手工特征的依赖。最近,大语言模型(LLM)引入了知识增强方法,利用预训练、提示工程、少样本学习和参数高效微调,对欺骗性语言进行上下文敏感推理(Zhang和Gao,2023 (https://arxiv.org/html/2607.29066#bib.bib33))。

### 2\.2\. 领域特定应用:法律与警务

在法律语境中,谎言检测支持庭审笔录分析、证据验证和可信度评估,这引发了关于可解释性和公平性的伦理关切。面向警务的研究涉及投诉核实、不当行为检测和虚假报告识别。表1 (https://arxiv.org/html/2607.29066#S2.T1)总结了这两个领域的关键工作。挑战包括数据稀缺、敏感性以及高误分类成本;因此,人工监督对于负责任地部署仍然至关重要。

表1\. 法律与警务领域相关工作

## 3\. 比较分析

### 3\.1\. 实验设置

#### 3\.1\.1\. 数据集

基于现有工作,我们选择了七个数据集:两个法律领域数据集和五个通用领域数据集,旨在评估跨领域模型行为。表2 (https://arxiv.org/html/2607.29066#S3.T2)总结了语料库统计信息。

表2\. 数据集统计信息。SC:平均句子数,AT:平均标记数,VR:词汇丰富度

##### 真实庭审谎言(RLTD)(Pérez\-Rosas等,2015 (https://arxiv.org/html/2607.29066#bib.bib32))

该数据集使用从美国公开法庭审判中收集的视频创建。谎言标签(真实/欺骗)由审判结果决定。视频随后通过众包转录以捕获口头信息,并对手部动作和面部表情等非语言线索进行手动标注。在我们的实验中,我们使用了转录文本,不包括非语言线索。

##### DECOUR(Fornaciari等,2012 (https://arxiv.org/html/2607.29066#bib.bib105))

包含来自35场刑事听证会的意大利法庭笔录,涵盖受访者与采访者(法官、检察官、律师)之间的对话。话语被标记为真实、虚假或不确定。在我们的实验中,仅使用真实/虚假话语以保持数据集间二分类的一致性。

##### 通用领域数据集

OpSpam(Ott等,2011 (https://arxiv.org/html/2607.29066#bib.bib109))由来自TripAdvisor的酒店评论组成,涵盖20家芝加哥酒店。跨文化谎言检测(cCult)(Pérez\-Rosas和Mihalcea,2014 (https://arxiv.org/html/2607.29066#bib.bib44))数据集通过众包收集,包含关于三个主题(堕胎、死刑、最好的朋友)的真实和欺骗性短文。DeRev2014(Fornaciari和Poesio,2014 (https://arxiv.org/html/2607.29066#bib.bib101))是一个包含236条书评的语料库。Liar(Wang,2017 (https://arxiv.org/html/2607.29066#bib.bib104))和FakeNewsNet(Shu等,2020 (https://arxiv.org/html/2607.29066#bib.bib106))是分别来自PolitiFact和BuzzFeed的假新闻数据集。

表2 (https://arxiv.org/html/2607.29066#S3.T2)报告了语料库规模、标签分布和语言特征。SC和标记计数使用NLTK计算;词汇丰富度(VR)定义为类型\-标记比(type\-token ratio),数值越低表示语言越重复。

#### 3\.1\.2\. 数据处理

我们对所有数据集应用统一的80:10:10训练\-验证\-测试划分,遵循Liar(Wang,2017 (https://arxiv.org/html/2607.29066#bib.bib104))的原始划分比例。但其原始六个标签被映射为二分类:true/mostly\-true/half\-true→True,以及false/barely\-true/pants\-on\-fire→False。

#### 3\.1\.3\. 模型

我们通过监督微调评估了仅编码器transformer模型(RoBERTa、BERT、DeBERTa、ALBERT、DistilBERT)和T5\-base,以及七个LLM:GPT\-4o、GPT\-4o\-mini、LLaMA3\-8B、LLaMA3\.1\-8B、Gemma2\-9B、Phi\-3\-mini和Phi\-4,这些模型已在最近的谎言检测工作中使用(Benny,2023 (https://arxiv.org/html/2607.29066#bib.bib107);Velutharambath和Klinger,2023 (https://arxiv.org/html/2607.29066#bib.bib99);Miah等,2025 (https://arxiv.org/html/2607.29066#bib.bib21);Cui等,2025 (https://arxiv.org/html/2607.29066#bib.bib91);Aspromonte等,2025 (https://arxiv.org/html/2607.29066#bib.bib87);Papantoniou等,2025 (https://arxiv.org/html/2607.29066#bib.bib56))。全程使用加权F1以考虑类别不平衡。

#### 3\.1\.4\. 实验设置

微调使用:学习率=2e\-5、批次大小=8、训练轮数=6、AdamW优化器,在NVIDIA RTX 3080(16GB)上运行。开源LLM通过Ollama(v0\.13\.5)以4比特量化(Q4\_K\_M)在本地运行。OpenAI模型通过Chat Completions API访问。除非另有说明,所有LLM使用temperature=0以确保确定性输出。

### 3\.2\. 提示策略

#### 3\.2\.1\. 提示配置

我们评估了五种不同的实验配置,以评估微调和提示策略的影响:(1)监督微调:基于BERT的模型和T5\-base模型使用标准交叉熵损失在训练数据上进行微调,超参数如第3\.1\.4节所述。(2)零样本直接分类:LLM接收任务描述和文本输入,无示例。(3)少样本直接分类:从训练集中预置四个选定示例。(4)零样本思维链(CoT):模型被指示在分类之前进行推理。(5)少样本思维链(CoT):将示例与推理演示相结合(4个带有逐步推理的示例)。

#### 3\.2\.2\. 少样本示例选择

对于所有少样本配置,每个测试实例使用句子嵌入(all\-MiniLM\-L6\-v2)动态选择k=4个示例,并强制标签平衡(2个真实、2个欺骗)。Top\-K通过余弦相似度选择与查询最相似的k个示例。High\-Variance使用由最相似示例初始化的贪心过程,迭代添加使所选集合内成对相似度方差最大化的候选,从而产生语言多样化的上下文。

## 4\. 结果与观察

我们在一致的划分和提示下评估了微调transformer和LLM,没有进行数据集特定调整。完整结果见表3 (https://arxiv.org/html/2607.29066#S4.T3)。

表3\. 各数据集和模型上的谎言检测F1分数(%)。FT=微调;ZS=零样本;TK=少样本Top\-K;HV=少样本High\-Variance;CoT=思维链。粗体表示每个数据集每个部分的最佳值。
表4\. 加权F1分数(%)——10折交叉验证与原始划分(RLTD)
表5\. F1加权分数(%)——LLM直接分类,10折交叉验证在不同温度下的结果(RLTD)

##### 微调模型与零样本LLM

在数据充足的 datasets 上,微调transformer模型始终优于零样本LLM。DeBERTa在OpSpam上获得F1=92\.52%,而GPT\-4o为59\.63%;多个微调模型在DeRev2014上达到100%——尽管这反映了数据集伪影(见第5 (https://arxiv.org/html/2607.29066#S5)节)。然而,在较小的RLTD数据集(121个样本)上,少样本GPT\-4o(F1=84\.62%)与微调模型相当或超越它们,这表明当标记数据稀缺时,预训练先验知识可以弥补不足。

##### 领域敏感性

法律数据集的性能较低且波动较大:RLTD在不同模型上的F1跨度从14\.48%到84\.62%;DECOUR峰值达71\.95%(DistilBERT)。评论数据集最容易处理(OpSpam:92\.52%,DeRev2014:100%),而新闻数据集难度中等,GPT\-4o在FakeNewsNet上零样本达到65\.92%,可能受益于世界知识。图1 (https://arxiv.org/html/2607.29066#S4.F1)总结了每个数据集每种方法可达到的最佳F1,表明在七个数据集中的六个上,微调相较于基于LLM的方法具有持续优势,唯一例外是RLTD,其中少样本LLM占优。

参见图注 图1\. 每个数据集每种方法的最佳F1。
##### 少样本学习的影响

少样本提示带来的收益不一致。GPT\-4o在RLTD(从41\.59%提升到84\.62%)和DECOUR(从40\.52%提升到66\.16%)上通过4\-shot Top\-K显著提升。相反,LLaMA模型在若干数据集上在少样本提示下性能下降。高方差示例选择偶尔优于Top\-K(例如,GPT\-4o在DeRev2014上,High\-Variance(91\.92%)优于Top\-K(87\.76%)),但没有一致优势,证实了对示例选择的敏感性。图2 (https://arxiv.org/html/2607.29066#S4.F2)追踪了GPT\-4o和GPT\-4o\-mini在所有三种直接分类变体以及全部七个数据集上的表现;标注值显示了所有六个变体中每个数据集的最大值(深蓝色)和最小值(深红色)。

参见图注 图2\. GPT\-4o与GPT\-4o\-mini:零样本与少样本(直接分类)
##### 思维链推理

CoT的效果不一致:GPT\-4o零样本CoT在RLTD上比零样本直接分类有所提升(从41\.59%提升到71\.65%),但4\-shot直接分类(84\.62%)优于4\-shot CoT(62\.94%)。在OpSpam上,CoT始终不如直接分类。数据集特定的收益出现在DeRev2014上(LLaMA3\-8B CoT:58\.00%,直接分类:44\.29%)。这些发现与(Miah等,2025 (https://arxiv.org/html/2607.29066#bib.bib21))一致,证实了推理步骤并非普遍有利于谎言检测。

##### 模型大小与架构效应

更大的模型并不保证更好的性能:GPT\-4o优于GPT\-4o\-mini,但差距不大。在微调模型中,DeBERTa和DistilBERT整体表现最强;ALBERT尽管与BERT架构相似,但表现落后。T5\-base在小数据集上表现不佳(RLTD:14\.48%),但在较大语料库上仍具有竞争力。

##### 稳定性分析(RLTD)

鉴于RLTD规模较小,我们进行了10折交叉验证(表4 (https://arxiv.org/html/2607.29066#S4.T4))。高标准差证实了显著的不稳定性:BERT的交叉验证均值从48\.11%提高到62\.86%,而DeBERTa从77\.53%下降到61\.46%,表明在单一划分上过拟合。在LLM中,使用Top\-K选择的GPT\-4o获得了最高的交叉验证均值(78\.14%,标准差=0\.053),是所有配置中最稳定的强结果。

##### 温度敏感性(RLTD)

表5 (https://arxiv.org/html/2607.29066#S4.T5)显示了在RLTD上LLM在不同温度(0\.0–1\.0)下的表现。大多数模型表现出低敏感性:Gemma2\-9B少样本Top\-K在不同温度下的标准差仅为1\.06。LLaMA3\.1\-8B在少样本High\-Variance选择下表现出较高方差(标准差=4\.32),表明示例多样性与输出随机性之间存在交互作用。Phi\-3\-mini在零样本设置中在温度变化下产生近乎恒定的输出(各折之间标准差=0\.65

相似文章

DECOR:基于信息操纵理论审计LLM欺骗行为

arXiv cs.CL

介绍了DECOR,一个基于信息操纵理论的多智能体框架,用于细粒度审计LLM回应中的策略性欺骗,在15个前沿模型的欺骗检测基准测试中取得了最先进的性能。