推理者还是翻译者?税法中的污染感知评估与神经符号鲁棒性

arXiv cs.AI 论文

摘要

本文实证研究了LLMs在税法中的法律推理,表明数据污染会夸大性能,而神经符号混合系统比单体LLMs提供更可靠和稳健的泛化能力。

arXiv:2605.16052v1 Announce Type: new 摘要:大型语言模型(LLMs)的最新进展显著提升了自动化法律推理的能力。然而,其表现是否反映了真正的法律推理能力,还是数据污染的产物,仍不清楚。我们提出了一个全面的税法推理方法实证研究,并实施了一个污染检测协议来严格评估LLM的可靠性。我们表明,污染可能会夸大性能。基于这一分析,我们进行了系统评估,比较了单体LLM与将法规文本翻译成正式表示并委托符号求解器进行推理的混合系统。我们构建了一个新颖的测试套件,旨在通过案例和规则变化来探测对未见文档的泛化能力。我们的研究结果表明,法律推理本质上是组合性的,神经符号框架为法律AI提供了更可靠和稳健的基础,同时提高了对未观察情况的泛化能力。
查看原文
查看缓存全文

缓存时间: 2026/05/18 06:35

# 推理者还是翻译者?税法中污染感知评估与神经符号鲁棒性

来源:https://arxiv.org/abs/2605.16052  
查看PDF(https://arxiv.org/pdf/2605.16052)

> **摘要:**大语言模型(LLM)的最新进展显著提升了自动化法律推理能力。然而,其表现究竟是反映了真正的法律推理能力,还是数据污染带来的假象,目前尚不明确。我们对税法推理方法进行了全面的实证研究,并实施了一种污染检测协议以严格评估LLM的可靠性。研究表明,污染可能虚增模型性能。基于此分析,我们进行了系统性评估,将单一LLM与将成文法文本转换为形式化表示并将推理委托给符号求解器的混合系统进行比较。我们构建了一个新颖的测试套件,通过案例和规则变体来探测模型对未见文档的泛化能力。研究结果表明,法律推理本质上是组合性的,神经符号框架为法律AI提供了更可靠、更稳健的基础,并且在未见情境下展现出更好的泛化能力。

## 提交历史

来自:Parisa Kordjamshidi [查看邮件](https://arxiv.org/show-email/a2c105b0/2605.16052)  
**[v1]** 2026年5月15日星期五 15:20:16 UTC (129 KB)

相似文章

推理先行翻译:利用结构化推理增强法律机器翻译

arXiv cs.CL

本文比较了多种增强法律领域神经机器翻译的方法,包括监督微调和基于可验证奖励的强化学习。重点针对瑞士法律体系翻译,表明小型语言模型可显著增强,其中强化学习超越监督微调的性能。

推理大语言模型中的隐藏语言一致性现象

arXiv cs.CL

本文研究多语言推理模型,揭示输出中的语言一致性可能随任务难度增加而退化或崩溃,尤其是对于资源较少的语言。文章认为,评估多语言能力需要同时考虑准确性、语言一致性和任务难度。