ImmigrationReason: 一个用于法律推理研究的美国移民上诉结构化数据集
摘要
本文介绍了ImmigrationReason,一个用于法律推理研究的大规模美国移民上诉结构化数据集,填补了自然语言处理研究中行政裁决数据的空白。
arXiv:2608.20391v1 Announce Type: new
摘要:大多数法律自然语言处理资源源自联邦判例法,并专注于粗分类,使得行政裁决——绝大多数政府决策发生的地方——基本上未被涉及。我们介绍了ImmigrationReason,一个源自美国公民及移民服务局(USCIS)行政上诉办公室(AAO)12,375项非先例决定的规模化结构化数据集,时间跨度为2005年至2026年。每条记录捕获适用的法律框架、基于五类标签的每项标准证据充分性发现、逐字裁决批评引用、所有引文和最终处置,以及高质量的Claude转录源文本。提取质量通过一个三阶段管道进行验证,该管道结合两种独立模态,并通过Opus 4.7进行比较提示裁决,并在500条记录样本上由领域专家验证。该数据集记录了近9,000个AAO识别的法律错误的逐字实例,跨越了一个自然的法律制度过渡(2016年Dhanasar规则变更),并涵盖了21年的裁决。我们详细分析了该数据集,并概述了它所启用的研究方向,从结果预测和裁决错误分析到高风险监管领域的智能体设计。
查看缓存全文
缓存时间: 2026/08/24 04:19
# ImmigrationReason:用于法律推理研究的美国移民上诉结构化数据集 来源:https://arxiv.org/html/2608.20391 Amirhossein Afsharrad 斯坦福大学 [email protected] & Seyed Shahabeddin Mousavi 斯坦福大学 [email protected] ###### 摘要 大多数法律自然语言处理资源来源于联邦判例法,并侧重于粗粒度分类,这使得绝大多数政府决定发生的行政裁决领域基本未被触及。我们推出了**ImmigrationReason**,这是一个大规模结构化数据集,源自美国公民及移民服务局(USCIS)行政上诉办公室(AAO)在2005年至2026年间做出的12,375项非先例决定。每条记录捕获了适用的法律框架、基于五类标签的逐项标准证据充分性认定、逐字记录的裁决官批评引语、所有引文以及最终处置结果,并附有高质量的Claude转录源文本。提取质量通过结合两种独立模态并与由Opus 4.7执行的对比提示裁决相结合的三遍流程进行了验证,并由领域专家在500条记录样本上进行了核实。该数据集记录了近9,000条AAO识别的法律错误逐字实例,跨越了一个自然的法律制度过渡期(2016年*Dhanasar*规则变更),并覆盖了21年的裁决历史。我们详细分析了该数据集,并概述了它所能推动的研究方向,从结果预测和裁决官错误分析,到高风险监管领域的智能体设计。 ## 1 引言 法律推理正成为大语言模型(LLMs)最重要且最具挑战性的前沿领域之一。商业应用现已瞄准法律研究、合同起草、合规分析和咨询任务(Magesh等人,2024 (https://arxiv.org/html/2608.20391#bib.bib8);Dahl等人,2024 (https://arxiv.org/html/2608.20391#bib.bib9))。然而,评估和改进法律推理能力需要能够反映法律工作实际复杂性的数据资源:包括在演变的教义标准下进行多步骤的证据权衡、基于引文的论证,以及发现对方推理中微妙错误的能力。现有的法律NLP数据集(Guha等人,2023 (https://arxiv.org/html/2608.20391#bib.bib1);Chalkidis等人,2022 (https://arxiv.org/html/2608.20391#bib.bib2);Fei等人,2023 (https://arxiv.org/html/2608.20391#bib.bib3))做出了重要贡献,但它们主要建立在联邦判例法之上,并被构建为粗粒度的分类任务。法律决策的更深层次,即行政裁决——联邦机构在监管框架下确定个人权利和资格——几乎完全缺失。行政机构每年做出的决定数量比联邦法院多出几个数量级,并且他们依据的教义标准与普通法判例法截然不同。其中,美国基于就业的移民裁决尤为重要:USCIS每年处理数百万份申请;行政上诉办公室(AAO)就被拒绝的申请发布公开且理由详尽的决定;并且USCIS已明确承认在其裁决过程中部署了人工智能工具(美国国土安全部,2026 (https://arxiv.org/html/2608.20391#bib.bib11)),这使得独立评估既紧迫又具有实际重要性。 我们推出了**ImmigrationReason**,这是一个基于2005年至2026年间12,375项非先例AAO决定构建的大规模结构化数据集。与原始法律语料库不同,**ImmigrationReason**在三个层次上提供了深度的结构化标注:决定级元数据(案件态势、法律框架、申请人领域)、逐法律问题分析(问题类型、推理、结论)以及基于五类标签的逐项标准认定(分别追踪官员和AAO对每个要点的认定)。该数据集以其三个在以往任何法律NLP资源中都不存在的特征而著称:(1) 源自高级行政法庭的逐项标准证据充分性标签;(2) 裁决官错误的明确标签(AAO对原审官员的逐字批评);以及 (3) 内置的时间性法律制度过渡(2016年12月的*Dhanasar*规则变更),这为自然的分布外测试条件提供了基础。 ## 2 相关工作 #### 法律NLP数据集与基准。 LegalBench(Guha等人,2023 (https://arxiv.org/html/2608.20391#bib.bib1))是最全面的法律推理基准,涵盖162项任务,但以美国判例法为中心,面向分类/跨度提取。LexGLUE(Chalkidis等人,2022 (https://arxiv.org/html/2608.20391#bib.bib2))提供跨司法管辖区的七个法律分类数据集。LawBench(Fei等人,2023 (https://arxiv.org/html/2608.20391#bib.bib3))和LEXam(Louise等人,2025 (https://arxiv.org/html/2608.20391#bib.bib4))专注于中国和瑞士法律。Pile of Law(Henderson等人,2022 (https://arxiv.org/html/2608.20391#bib.bib19))汇集了256 GB的原始法律文本作为预训练语料。CaseHOLD(Zheng等人,2021 (https://arxiv.org/html/2608.20391#bib.bib20))提供来自美国联邦法院意见的引文预测标签。这些都没有提供结构化的逐项标准认定、裁决官错误标注或行政法覆盖范围。 #### 具体到移民法。 Barale(2023 (https://arxiv.org/html/2608.20391#bib.bib6))提供了一个小型的加拿大难民法检索数据集(400个案例)。Chen和Eagel(2017 (https://arxiv.org/html/2608.20391#bib.bib7))在预LLM时代研究了庇护结果预测作为一个分类任务。两者都未涵盖美国基于就业的裁决,也未提供结构化标注。 #### 文档数字化与OCR。 Pile of Law(Henderson等人,2022 (https://arxiv.org/html/2608.20391#bib.bib19))和先前的法律NLP工作主要依赖经典的OCR流程(例如Tesseract、PyMuPDF)处理扫描的法律文档。作为我们语料库的基线比较,我们衡量了在12,375对2017年前后的决定中,经典PyMuPDF提取与我们Claude驱动的转录之间的质量差异。结果总结在表1中(https://arxiv.org/html/2608.20391#S4.T1),证实了预期的发现:基于LLM的转录在嘈杂的扫描文档上显著优于经典OCR,恢复了3.3倍的脚注,消除了99.9%的噪声标记,并在严重截断的2017年前案例中实现了多达5倍的内容恢复。这一差距促使我们选择发布Claude驱动的转录版本,而非原始OCR文本,作为规范的源文本。 #### 法律AI部署与幻觉。 Magesh等人(2024 (https://arxiv.org/html/2608.20391#bib.bib8))和Dahl等人(2024 (https://arxiv.org/html/2608.20391#bib.bib9))记录了商业法律AI中显著的引文幻觉率,Curran等人(2025 (https://arxiv.org/html/2608.20391#bib.bib10))表明了司法管辖区特异性差异。**ImmigrationReason**为在AI已被部署的背景下研究这些现象提供了基础,并能在真实世界环境中评估法律论证的连贯性。 ## 3 背景:AAO裁决 USCIS行政上诉办公室在USCIS服务中心拒绝后,审查I-140表格就业类移民签证申请。AAO进行*重新审理*(USCIS行政上诉办公室,2015 (https://arxiv.org/html/2608.20391#bib.bib16))并公开发布非先例决定。 EB-1A(杰出人才)。受8 C.F.R. § 204.5(h)(3)管辖,该条款规定了十项证据标准;申请人必须满足至少三项。自*Kazarian v. USCIS*(美国第九巡回上诉法院,2010 (https://arxiv.org/html/2608.20391#bib.bib15))以来,AAO应用两步分析:计算符合标准的数量,然后进行最终的实质性国家或国际声誉认定。 EB2-NIW(国家利益豁免)。自2016年12月起,受三要点的*Dhanasar*(USCIS行政上诉办公室,2016 (https://arxiv.org/html/2608.20391#bib.bib13))框架管辖:(1) 具有实质价值和国家重要性;(2) 有能力推进该事业;(3) 总体而言,豁免工作邀约要求是有益的。在2016年12月之前,适用NYSDOT框架(移民和归化局,1998 (https://arxiv.org/html/2608.20391#bib.bib14)),要求不同的证明。这一过渡是**ImmigrationReason**的一个核心特征:它在数据的法律结构中创建了一个硬性的时间边界。 决定主体遵循一致的结构:引言摘要(包括结果宣布)、法律部分(法律和法规框架)、分析部分(逐项标准讨论)和命令块。 ## 4 数据集构建 ### 4.1 源数据收集与过滤 我们从USCIS网站抓取了所有公开可用的EB-1A(表格代码B2203)和NIW(表格代码B5203)类别的AAO非先例决定,得到了13,520份PDF文件,时间跨度为2005年1月至2026年3月。在过滤掉O-1申请(规模小且结构不同)、文本提取后少于2,000个字符的文档以及少量重复项后,最终语料库包含12,375项决定。 ### 4.2 源文本准备 PDF分为两类质量。2017年后的文档是文本原生的(USCIS开始生产带有嵌入文本的文档);PyMuPDF可以近乎无损地提取这些内容。2017年前的文档主要是扫描图像;经典OCR会产生嘈杂的结果,包括混乱的引文、缺失的脚注和截断的内容。对于所有文档,我们使用Claude Sonnet 4.6和详细的转录提示(见附录B (https://arxiv.org/html/2608.20391#A2))制作了Claude转录的Markdown版本。表1(https://arxiv.org/html/2608.20391#S4.T1)量化了改进效果。 **表1:** 12,375对记录的OCR质量比较。Claude驱动的转录显著降低了噪声并恢复了更多的结构化内容,尤其是在2017年前的扫描文档中。 **图1:** Claude驱动转录前后的OCR质量比较。(a, b) 2017年前的文档改进最明显;许多已被经典OCR严重截断。(c) 语料库范围内的关键信号类型结构特征恢复。 ### 4.3 提取架构 每项决定被分解为一个类型化的**Decision**记录,包含三个嵌套层级。完整的Pydantic模式随数据集发布;我们在此总结关键字段。 **决策级**(每份文档一个):`filename_stem`、`decision_date`、`posture`(8种类型:上诉、重新开放动议、重新考虑动议、合并动议、批准后上诉、认证、发回审查、其他)、`visa_category`(5种类型)、`originating_office`、`petitioner_field`(自由文本)、`petitioner_type`、`aao_overall_disagreement_with_director`(4种类型)、`aao_specific_criticisms_of_director`(逐字引语列表)、`citations`(类型化列表)、`final_orders`和`extraction_confidence`。 **法律问题级**(每项决定一个列表,中位数2,最大值7):`issue_type`(17个值,涵盖实质性框架和跨领域的就业类问题)、`framework_citation`、`aao_conclusion`(5种类型)、`aao_reasoning_summary`、`aao_reasoning_quotes`(逐字列表)。 **认定级**(每个问题一个列表,中位数3,最大值14):`prong_id`、`prong_name`、`petitioner_evidence_types`(列表)、`petitioner_arguments_summary`、`director_finding`(4种状态)、`aao_finding`(5种状态;见下文)、`aao_reasoning_summary`、`aao_reasoning_quotes`、`aao_agrees_with_director`和`aao_specific_criticism_of_director`(逐字)。 #### 五类认定标签。 `aao_finding`字段是最新的结构元素。它取以下五个值之一:`met`(AAO认为该标准已满足)、`not_met`(AAO认为未满足)、`reserved`(AAO明确拒绝就该问题作出裁决,因为另一个问题是决定性的,根据*INS v. Bagamasbad*(美国最高法院,1976 (https://arxiv.org/html/2608.20391#bib.bib18)))、`waived_by_petitioner`(申请人在上诉中未提出该问题,视为放弃)和`not_addressed`(双方均未实质性讨论该问题)。如表2(https://arxiv.org/html/2608.20391#S4.T2)所示,19.8%的认定是`reserved`,3.4%是`waived`;二元{`met`, `not_met`}方案将错误分类23%的所有认定实例,抹去了理解裁决逻辑的关键信号,并为任何下游任务产生错误的真值标签。 **表2:ImmigrationReason数据集统计。** | 属性 | 值 | 备注 | | :--- | :--- | :--- | | 决定总数 | 12,375 | 2005–2026 | | NIW (Dhanasar框架) | 3,484 | 2016年后 | | NIW (NYSDOT框架) | 1,280 | 2016年前 | | EB-1A (Kazarian) | 6,486 | 步骤1 + 步骤2问题 | | 仅EB-2门槛 | 2,626 | 无NIW要点分析 | | 其他/程序性 | 499 | | | 维持原判 | 674 | 5.4% | | 发回重审 | 975 | 7.9% | | 驳回/拒绝 | 10,373 | 83.8% | | 其他 | 353 | | | 2017年前 (扫描PDF) | 6,051 | | | 2017年后 (文本原生PDF) | 6,324 | | | 逐项标准认定总数 | 45,290 | | | met | 8,139 | 18.0% | | not_met | 25,454 | 56.2% | | reserved | 8,972 | 19.8% | | waived_by_petitioner | 1,527 | 3.4% | | not_addressed | 1,198 | 2.6% | | AAO完全同意主任官 | 5,678 | 45.9% | | AAO部分不同意 | 3,650 | 29.5% | | AAO完全不同意(撤销) | 1,487 | 12.0% | | 程序性/不适用 | 1,560 | 12.6% | | AAO逐字批评引语 | ~9,000 | 跨4,377条记录 | | 独特的申请人领域(自由文本) | ~1,000 | | | 独特的问题类型 | 17 | | | 每项决定的中位数引文 | 10 | | ### 4.4 提取流程 我们使用Claude Sonnet 4.6通过强制工具使用(Anthropic,2024b (https://arxiv.org/html/2608.20391#bib.bib21))并结合Pydantic(Pydantic开发者,2023 (https://arxiv.org/html/2608.20391#bib.bib24))验证(以及在验证反馈后重试,最多重试3次后再升级)来提取结构化记录。完整的提取系统提示在附录A (https://arxiv.org/html/2608.20391#A1)中复制;转录和裁决提示分别在附录B (https://arxiv.org/html/2608.20391#A2)和C (https://arxiv.org/html/2608.20391#A3)中。完整的模型细节在附录D (https://arxiv.org/html/2608.20391#A4)中。 为了最大化质量,我们运行了三次独立提取,并对分歧进行裁决(裁决判决细分见图4(https://arxiv.org/html/2608.20391#S5.F4),右侧): * **第1遍(直接PDF):** Sonnet 4.6通过Anthropic Files API(Anthropic,2024a (https://arxiv.org/html/2608.20391#bib.bib23))直接读取每个PDF。 * **第2遍(基于文本):** Sonnet 4.6读取Claude转录的Markdown。 * **第3遍(对比提示裁决):** 对于在3,401条记录(27.5%)中,两遍提取在至少一个关键字段上存在分歧的情况,我们向Opus 4.7提供源文本、两次有冲突的提取以及具体有分歧的字段,并要求其对冲突进行推理并产生正确的值。这在方法论上优于多数投票:它在本质上是不同的任务(裁决 vs. 提取),模型可以识别出两遍都错误的情况,并产生可解释的审计跟踪。在10.1%的已裁决记录中,Opus产生了一个之前两遍都未得出的值。 **图2:** 语料库概览:(a) 按年份着色的决定数量;(b) 2016年12月(*Dhanasar*)的NIW框架过渡;(c) 按来源USCIS服务中心的撤销率。 ## 5 数据集分析 图3(https://arxiv.org/html/2608.20391#S5.F3)至图6(https://arxiv.org/html/2608.20391#S5.F6)提供了数据集的全面统计特征。 **图3:** (a) AAO与原审主任官的
相似文章
ImmigrationQA:一个基于来源的数据集及面向美国移民法的小型模型适配
本文介绍了ImmigrationQA,一个包含17,058个问答对的、基于来源的美国移民法数据集,并使用LoRA对Llama 3.2 3B模型进行微调,在保留的评估集上相比基础模型提升了27%。
@tom_doerr: 大语言模型指令与推理数据集精选列表 https://github.com/mlabonne/llm-datasets…
由 mlabonne 整理的大语言模型指令与推理数据集列表,包含数据集特征、许可证及用例详情。
IMLJD:用于印度婚姻诉讼分析的计算数据集
本文介绍了IMLJD,一个专门用于分析印度婚姻诉讼的计算数据集,支持自然语言处理和法律分析研究。
从判决到争议点:带有引用幻觉控制的法律推理的结构化提取
本文介绍了一条自动化流水线,该流水线使用 DeepSeek V3 模型将意大利税务法院判决分解为各个法律争议点,并按照 IRAC 框架以 XML 格式结构化表示,同时包含一个使用 Linkoln 解析器验证引用的幻觉检测过滤器,该过滤器已由专家注释者验证。
NOWJ@COLIEE 2026: 面向法律检索与推理的自适应流水线
本文介绍了在COLIEE 2026竞赛中用于法律检索、蕴含和判决预测任务的自适应流水线,采用了多阶段检索、重排序和基于LLM的推理。