这个引用是否切题?

Hugging Face Daily Papers 论文

摘要

本文评估了大型语言模型在法律文件中验证引用支持的能力,发现虽然模型能有效检测错误案件的引用,但在精确页码引用上存在困难,常常混淆主题相关性和精确支持。

2023年,在Mata v. Avianca案中,一位纽约法官因两名律师提交的辩护简报中包含由ChatGPT生成的虚构引用而对他们进行了制裁。此类错误大多能被数据库查询发现;更难的问题是检测那些指向真实案件但不支持所提出主张的引用——这种失败模式在现有的法律用例LLM评估中很大程度上被忽视了。在本文中,我们通过对从两个法律语料库中获得的真实法律引用进行可控扰动,研究命题级别的引用支持验证,要么替换所引用的案件,要么仅在同一案件中更改精确页码。我们对由此产生的示例评估了十四个模型配置。模型能捕获93-100%的错误案件损坏。它们仅在法院意见中捕获37-61%的错误页码损坏,在法律简报中捕获52-83%。当模型未能捕获错误页码损坏时,它们基于主题重叠而非页面级别的支持接受引用。规模和扩展推理缩小了差距但并未消除:具有高推理努力的GPT-5.4在法院意见中仍遗漏40%的页码不匹配,在简报中遗漏18%。提示模型在引用页验证支持提高了召回率,但也提高了假阳性率。识别正确的法律主题和验证所引用命题的支持是不同的能力,当前模型将它们混淆了。
查看原文
查看缓存全文

缓存时间: 2026/08/17 23:48

论文页面 - 引用是否切题?

来源:https://huggingface.co/papers/2608.12571 发布于 8 月 12 日

·

由 https://huggingface.co/0xe69756 提交

Apurv (https://huggingface.co/0xe69756) 于 8 月 17 日

摘要

大型语言模型能够可靠地检测出错误的案例引用,但经常忽略错误的精确页码引用,混淆了主题相关性与精确的法律支持。

2023年,纽约一位法官在 Mata v. Avianca 案中制裁了两名律师,因为他们提交的法律摘要中包含了由 ChatGPT 生成的虚假引用。这类错误很大程度上能被数据库查询所发现;更难的问题是检测那些指向真实案例、但并不支持其被引用的论点的引用——现有针对法律用例的大语言模型评估很大程度上忽略了这种失败模式。本文中,我们研究了命题级引用支持验证 (https://huggingface.co/papers?q=proposition-level%20citation%20support%20verification),通过对两个法律语料库获得的真实法律引用进行可控扰动 (https://huggingface.co/papers?q=controlled%20perturbations) 来实现:要么替换被引用的案例,要么仅更改同一案例中的精确页码 (https://huggingface.co/papers?q=pinpoint%20page)。我们评估了十四个模型配置在所生成样本上的表现。模型能捕捉 93-100% 的错误案例篡改 (https://huggingface.co/papers?q=wrong-case%20corruptions)。但对于法院意见书中的错误页码篡改 (https://huggingface.co/papers?q=wrong-pinpoint%20corruptions),它们只能捕捉 37-61%,对于法律摘要则能捕捉 52-83%。当模型未能捕捉错误页码篡改 (https://huggingface.co/papers?q=wrong-pinpoint%20corruptions) 时,它们基于主题重叠 (https://huggingface.co/papers?q=topical%20overlap) 而非页码级别的支持来接受该引用。模型规模和扩展推理能缩小差距,但无法彻底消除:具有高推理努力 (https://huggingface.co/papers?q=reasoning%20effort) 的 GPT-5.4 仍会错过法院意见书中 40% 和摘要中 18% 的页码不匹配。提示模型验证被引用页码的支持能提高召回率,但也会增加假阳性率 (https://huggingface.co/papers?q=false%20positive%20rate)。识别正确的法律主题与验证所引用命题的支持是不同的能力,当前模型混淆了这两者。

查看 arXiv 页面 (https://arxiv.org/abs/2608.12571) 查看 PDF (https://arxiv.org/pdf/2608.12571) 项目页面 (https://vermaapurv.com/2026-07-25-citation-on-point/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.12571)

通过您的智能体获取本文:

hf papers read 2608.12571

没有最新的 CLI?运行 curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 0

无模型链接本文

在模型 README.md 中引用 arxiv.org/abs/2608.12571 以将其从本页面链接。

引用本文的数据集 0

无数据集链接本文

在数据集 README.md 中引用 arxiv.org/abs/2608.12571 以将其从本页面链接。

引用本文的 Spaces 0

无 Space 链接本文

在 Space README.md 中引用 arxiv.org/abs/2608.12571 以将其从本页面链接。

包含本文的收藏集 0

无收藏集包含本文

将本文添加到收藏集 (https://huggingface.co/new-collection) 以将其从本页面链接。

相似文章

用于引文功能分类的大型语言模型

arXiv cs.CL

本文对五种大型语言模型在引文功能分类任务上进行了全面评估,基于微调后的 Falcon 7B 模型在 ACL-ARC 数据集上取得了新的最优结果。同时引入了 AC3 数据集,该数据集采用七类别标注方案,能够区分中性致谢与评价性立场。

偏好数据中引用的作用

arXiv cs.CL

本文研究了在科学问答中人类和LLM偏好中引用的作用,发现人类偏好多样但较少的引用,而LLM尽管缺乏源访问,却表现出更强的与引用相关的偏好。