这个引用是否切题?
摘要
本文评估了大型语言模型在法律文件中验证引用支持的能力,发现虽然模型能有效检测错误案件的引用,但在精确页码引用上存在困难,常常混淆主题相关性和精确支持。
查看缓存全文
缓存时间: 2026/08/17 23:48
论文页面 - 引用是否切题?
来源:https://huggingface.co/papers/2608.12571 发布于 8 月 12 日
·
由 https://huggingface.co/0xe69756 提交
Apurv (https://huggingface.co/0xe69756) 于 8 月 17 日
摘要
大型语言模型能够可靠地检测出错误的案例引用,但经常忽略错误的精确页码引用,混淆了主题相关性与精确的法律支持。
2023年,纽约一位法官在 Mata v. Avianca 案中制裁了两名律师,因为他们提交的法律摘要中包含了由 ChatGPT 生成的虚假引用。这类错误很大程度上能被数据库查询所发现;更难的问题是检测那些指向真实案例、但并不支持其被引用的论点的引用——现有针对法律用例的大语言模型评估很大程度上忽略了这种失败模式。本文中,我们研究了命题级引用支持验证 (https://huggingface.co/papers?q=proposition-level%20citation%20support%20verification),通过对两个法律语料库获得的真实法律引用进行可控扰动 (https://huggingface.co/papers?q=controlled%20perturbations) 来实现:要么替换被引用的案例,要么仅更改同一案例中的精确页码 (https://huggingface.co/papers?q=pinpoint%20page)。我们评估了十四个模型配置在所生成样本上的表现。模型能捕捉 93-100% 的错误案例篡改 (https://huggingface.co/papers?q=wrong-case%20corruptions)。但对于法院意见书中的错误页码篡改 (https://huggingface.co/papers?q=wrong-pinpoint%20corruptions),它们只能捕捉 37-61%,对于法律摘要则能捕捉 52-83%。当模型未能捕捉错误页码篡改 (https://huggingface.co/papers?q=wrong-pinpoint%20corruptions) 时,它们基于主题重叠 (https://huggingface.co/papers?q=topical%20overlap) 而非页码级别的支持来接受该引用。模型规模和扩展推理能缩小差距,但无法彻底消除:具有高推理努力 (https://huggingface.co/papers?q=reasoning%20effort) 的 GPT-5.4 仍会错过法院意见书中 40% 和摘要中 18% 的页码不匹配。提示模型验证被引用页码的支持能提高召回率,但也会增加假阳性率 (https://huggingface.co/papers?q=false%20positive%20rate)。识别正确的法律主题与验证所引用命题的支持是不同的能力,当前模型混淆了这两者。
查看 arXiv 页面 (https://arxiv.org/abs/2608.12571) 查看 PDF (https://arxiv.org/pdf/2608.12571) 项目页面 (https://vermaapurv.com/2026-07-25-citation-on-point/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.12571)
通过您的智能体获取本文:
hf papers read 2608.12571
没有最新的 CLI?运行 curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 0
无模型链接本文
在模型 README.md 中引用 arxiv.org/abs/2608.12571 以将其从本页面链接。
引用本文的数据集 0
无数据集链接本文
在数据集 README.md 中引用 arxiv.org/abs/2608.12571 以将其从本页面链接。
引用本文的 Spaces 0
无 Space 链接本文
在 Space README.md 中引用 arxiv.org/abs/2608.12571 以将其从本页面链接。
包含本文的收藏集 0
无收藏集包含本文
将本文添加到收藏集 (https://huggingface.co/new-collection) 以将其从本页面链接。
相似文章
用于引文功能分类的大型语言模型
本文对五种大型语言模型在引文功能分类任务上进行了全面评估,基于微调后的 Falcon 7B 模型在 ACL-ARC 数据集上取得了新的最优结果。同时引入了 AC3 数据集,该数据集采用七类别标注方案,能够区分中性致谢与评价性立场。
你需要一个前沿模型作为引用验证器吗?——针对深度研究来源归因的评估LLM基准测试
本文对8个用于深度研究系统中引用质量的LLM评估器进行了基准测试,发现较便宜的模型在来源相关性和事实支持方面仍与前沿模型竞争,但在方向偏差上有所不同,这对强化学习训练很重要。
CiteVQA: 面向可信文档智能的证据归因基准测试
CiteVQA 是一个面向文档视觉-语言模型的基准,它同时评估答案正确性与支持证据的引用,揭示了广泛的归因幻觉现象,即模型提供正确答案但引用错误区域。
偏好数据中引用的作用
本文研究了在科学问答中人类和LLM偏好中引用的作用,发现人类偏好多样但较少的引用,而LLM尽管缺乏源访问,却表现出更强的与引用相关的偏好。
本地LLM在适配法律文档时持续自信地产生虚构引用——是否有接地/模型/流水线的思路?
用户报告称,本地LLM在适配法律文档时以高自信度虚构引用,并寻求关于如何通过接地、模型或流水线思路来缓解此问题的建议。