RegDivergence-101:一个用于生命科学领域跨辖区监管矛盾检测的LLM基准

arXiv cs.AI 论文

摘要

RegDivergence-101是一个试点基准,旨在通过LLM检测FDA与EMA之间的跨辖区监管矛盾,并建立了在监管关系分类上表现各异的基线方法。

arXiv:2608.28607v1 公告类型:新 摘要:为美国和欧盟同时开发药物的制药申办者必须调和FDA和EMA独立发布的指导原则。当两个机构要求实质相同的内容时,申办者可以一次性提交;当它们存在分歧时,单一试验设计可能在某一地区被拒绝;当一个机构在另一机构监管的点上保持沉默时,申办者必须推断其义务。目前,这种调和由监管事务专家手动完成。我们引入跨辖区监管差异检测:给定FDA和EMA对同一主题的要求,将其关系分类为AGREE、DIVERGE或SILENT。SILENT本质上是有方向的(SILENT_FDA vs. SILENT_EMA);我们记录每对的方向,并报告每个方向的F1分数以及折叠标签。我们发布RegDivergence-101,这是一个101对的专家基础试点评估基准(标签基于三项同行评审的FDA/EMA比较研究以及主要的FDA/EMA/ICH指导文本;双标注者间标注者kappa = 0.85),并系统地描述了四种方法的基线层级:词法启发式(宏F1分数0.511,95%置信区间[0.411-0.605])、NLI交叉编码器(0.233)、义务级Graph-RAG(0.663 [0.570-0.747])和扁平LLM评判器/Claude Haiku(0.830 [0.747-0.908])。在试点规模(n = 101)下出现了三个方向性观察:SILENT在语义上可检测,但对仅蕴含的公式不可见;成对义务图优于词法方法,但落后于扁平LLM上下文(置信区间部分重叠);语料库级图构建是大规模沉默检测的既定架构目标。RegDivergence-101是一个试点发布,建立了任务表述和基线层级;四个未代表的监管领域和扩展路线图在第7节中描述。
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:31

# 用于生命科学领域跨司法管辖区监管矛盾检测的LLM基准
来源:https://arxiv.org/html/2608.28607
\(2026\)

###### 摘要

为同时在美国和欧盟开发药物的制药申办方,必须协调FDA和EMA独立发布的指南。当两个机构要求实质相同时,申办方可单次提交;当存在分歧时,单一试验设计可能在某一地区被拒绝;当一个机构未规定而另一个机构有规定时,申办方需推断其义务。目前这种协调工作由法规事务专家手动完成。我们提出**跨司法管辖区监管分歧检测**:给定FDA和EMA关于同一主题的要求,将其关系分类为**一致**、**分歧**或**沉默**。“沉默”本质上具有方向性(FDA沉默 vs. EMA沉默);我们记录每对要求的沉默方向,并在报告折叠标签的同时提供按方向计算的F1值。我们发布**RegDivergence-101**,这是一个由专家标注的101对基准数据集(标签基于三项经同行评审的FDA/EMA比较研究以及FDA/EMA/ICH主要指南文本;双人标注的一致性系数κ=0.85),并系统评估了四层方法基线:词汇启发式方法(宏F1为0.511,95%置信区间 [0.411–0.605])、NLI交叉编码器(0.233)、基于义务层级的Graph-RAG(0.663 [0.570–0.747])以及扁平化LLM判断/Claude Haiku(0.830 [0.747–0.908])。在试点规模(n=101)下,观察到三个方向性发现:沉默可被语义检测但仅蕴含式模型无法识别;基于对要求的义务图谱比词汇方法有所改进,但逊于扁平化LLM的上下文理解(置信区间部分重叠);语料库级别的图谱构建是大规模沉默检测的预设架构目标。RegDivergence-101是确立任务形式和基线层次的试点发布;第7节描述了四个未涵盖的监管领域及扩展路线图(https://arxiv.org/html/2608.28607#S7)。

大型语言模型、LLM基准、监管自然语言处理、合规人工智能、FDA/EMA分歧、矛盾检测、Graph-RAG、检索增强生成、生成式AI、生命科学、一致/分歧/沉默分类

††版权:ACM许可††期刊年:2026††DOI:XXXXXXX.XXXXXXX††会议:2026第二届人工智能与基础模型国际会议;2026年6月26-28日;中国乌鲁木齐††ISBN:979-8-4007-2458-9††CCS:计算方法 词汇语义学††CCS:应用计算 医疗信息学

## 1. 引言

在美国和欧盟同时将药品推向市场,需要满足两个独立发布且经常存在差异的监管机构。基因治疗申办方需遵循FDA长达15年的长期随访建议,而EMA则根据个案风险评估决定时长——主题相同,具体性要求实质不同。类似分歧广泛存在于儿科外推、溃疡性结肠炎终点定义、生物类似药可比性以及估算目标实施等领域。申办方若在方案设计中遗漏一个分歧,可能需重新进行研究,损失一年或更长时间。

协调两个机构的要求目前仍是需要专家手动完成的任务。然而,实现自动化的自然语言处理技术基础已经成熟——文档级NLI(ContractNLI(Koreeda与Manning, 2021 (https://arxiv.org/html/2608.28607#bib.bib1))、DocNLI(Yin等人, 2021 (https://arxiv.org/html/2608.28607#bib.bib2)))、法律矛盾检测(LegalWiz(Mantravadi等人, 2025 (https://arxiv.org/html/2608.28607#bib.bib3))、CLAUSE(Roy Choudhury等人, 2026 (https://arxiv.org/html/2608.28607#bib.bib4)))以及Graph-RAG(Microsoft GraphRAG(Edge等人, 2024 (https://arxiv.org/html/2608.28607#bib.bib6))、GraphCompliance(Chung等人, 2025 (https://arxiv.org/html/2608.28607#bib.bib8))、RAGulating Compliance(Jomraj等人, 2025 (https://arxiv.org/html/2608.28607#bib.bib7)))。此前尚无研究将这些技术结合,用于检测来自不同司法管辖区的平行监管语料库之间的差异。所有现有的矛盾检测研究都是**文档内**(单一合同内)或**单一司法管辖区**(合同与法规对比)的。

本文做出三项贡献:(1)**任务形式化**——针对预对齐的FDA/EMA要求对进行三分类(一致/分歧/沉默);沉默具有方向性(FDA沉默/EMA沉默),其按方向的F1值见表2(https://arxiv.org/html/2608.28607#S5.T2)。(2)**试点基准**——RegDivergence-101,包含13个主题领域的101对数据,具有明确的双轨道构建协议,κ=0.85,以及自助法置信区间;扩展路线图见第7节(https://arxiv.org/html/2608.28607#S7)。(3)**基线层次**——在试点规模(n=101)下比较四种方法,并提供95%自助置信区间,得出关于任务结构的三个方向性观察。

## 2. 相关工作

**文档级NLI**。ContractNLI(Koreeda与Manning, 2021 (https://arxiv.org/html/2608.28607#bib.bib1))引入了文档级蕴含/矛盾/未提及分类及证据抽取,指出矛盾检测落后于蕴含检测,尤其在“例外否定”情况下。DocNLI(Yin等人, 2021 (https://arxiv.org/html/2608.28607#bib.bib2))将NLI扩展到完整文档。

**法律矛盾检测(2025–2026)**。LegalWiz(Mantravadi等人, 2025 (https://arxiv.org/html/2608.28607#bib.bib3))使用多智能体框架进行法律矛盾检测,但仅限于单文档情景;Better Call CLAUSE(Roy Choudhury等人, 2026 (https://arxiv.org/html/2608.28607#bib.bib4))对7,500余份扰动合同进行基准测试,发现LLM难以从法律上证明细微错误。一项关于RAG鲁棒性的研究直接与我们的结果相关:Yoran等人(2024 (https://arxiv.org/html/2608.28607#bib.bib26))表明,除非明确过滤,否则检索到的无关或非蕴含上下文会误导检索增强模型——这是观察2中出现的失败模式,其中情态寄存器相似性误导了成对图谱。

**Graph-RAG与监管合规**。Microsoft GraphRAG(Edge等人, 2024 (https://arxiv.org/html/2608.28607#bib.bib6))构建实体图谱并生成社区摘要以支持局部和全局查询。GraphCompliance(Chung等人, 2025 (https://arxiv.org/html/2608.28607#bib.bib8))将政策图谱(监管要求)与上下文图谱(组织事实)对齐用于GDPR;它明确将“处理冲突的监管解释”列为开放问题。RAGulating Compliance(Jomraj等人, 2025 (https://arxiv.org/html/2608.28607#bib.bib7))构建了一个无本体的监管知识图谱,用于可追溯的问答。

**跨司法管辖区监管基准**。最接近的同期工作是Sino-US-DrugQA(Sino-US-DrugQA作者, 2026 (https://arxiv.org/html/2608.28607#bib.bib15))(11,871道选择题,中美对比),它与我们共享概念对齐的论点,但无法表达沉默类别。比较监管科学综述记录了FDA/EMA在给药(Mita等人, 2026 (https://arxiv.org/html/2608.28607#bib.bib16))、肿瘤学标签(Gómez-Fernández等人, 2026 (https://arxiv.org/html/2608.28607#bib.bib17))以及多国产品特性概述(Sartori等人, 2026 (https://arxiv.org/html/2608.28607#bib.bib18))方面的分歧,但这些是人工撰写的比较,而非机器学习基准。RegDivergence-101是首个具有明确沉默类别的FDA/EMA基准。在医疗保健等高风险行业,政策对齐的评估框架比单纯准确率更重视安全性和监管约束(Chen等人, 2026 (https://arxiv.org/html/2608.28607#bib.bib25));RegDivergence-101将此扩展到跨司法管辖区的监管推理。

**差距**。矛盾检测仅限于文档内或单一司法管辖区;Graph-RAG针对单一语料库问答或单一司法管辖区合规;FDA/EMA分歧通过人工记录但从未实现自动化。我们的任务正位于这一空白领域。

## 3. 任务与数据集

### 3.1. 任务定义

对于一个主题t,令$f_{t}$为FDA要求陈述,$e_{t}$为相应的EMA陈述。标签$y_{t}$定义为:

- •**一致**——两个司法管辖区要求实质相同的事物(相同的情态强度、相同的阈值、相同的适用范围)。释义等价和同义情态词(shall/must)视为一致;不影响申办方义务的细微起草差异忽略不计。
- •**分歧**——要求直接冲突:施加了不同的阈值、不同的情态强度(shall vs. should)、不同时间线或相互不兼容的设计规范。
- •**沉默**——一个司法管辖区未涉及另一个机构监管的内容。沉默具有**方向性**:FDA沉默(FDA沉默,EMA监管) vs. EMA沉默(EMA沉默,FDA监管)。方向记录在silent_direction字段中,并在表2(https://arxiv.org/html/2608.28607#S5.T2)中报告;为向后兼容,表1(https://arxiv.org/html/2608.28607#S5.T1)保留统一的沉默标签。

**沉默标签的认知状态**。沉默标签是一个缺失性断言:它声称在穷尽语料库搜索后未找到对应要求。这带来了不可约的认知不确定性。我们通过以下方式限定此不确定性:(a)明确的语料库搜索协议(§3.3 (https://arxiv.org/html/2608.28607#S3.SS3));(b)每对数据的doc_confidence标志(高/中等)。后续工作应将中等置信度的沉默对视为软标签。

**任务范围**。此形式化假设要求对是**预对齐**的——双方通过双轨道协议(§3.2 (https://arxiv.org/html/2608.28607#S3.SS2))处理相同的监管主题。主题对齐是一个非平凡的上游问题,将单独处理;将包含此步骤的语料库级架构在§7 (https://arxiv.org/html/2608.28607#S7)中描述。

### 3.2. 对构建协议

RegDivergence-101通过两个轨道构建,两者在确立FDA与EMA要求之间主题对应关系的方式上有所不同。每对的来源轨道归属对应于两个发布的源文件(每个轨道一个)。

**轨道A——源于专家比较的对(59对)**。提取自三项开放获取的同行评审研究,这些研究比较性地映射了FDA和EMA要求:Vieujean等人(2025 (https://arxiv.org/html/2608.28607#bib.bib9))(溃疡性结肠炎,40对)、Boesen等人(2021 (https://arxiv.org/html/2608.28607#bib.bib11))(精神药物试验,10对)和Schwarz与Decristoforo(2019 (https://arxiv.org/html/2608.28607#bib.bib12))(放射性药物,9对)。这些研究中的领域专家已确立主题对应性;我们的任务是对其预对齐的要求对进行一致/分歧/沉默关系分类。

**轨道B——主要指南对(42对)**。对于来自ICH E9(R1)、E11A(国际协调理事会, 2024 (https://arxiv.org/html/2608.28607#bib.bib13))以及FDA/EMA生物类似药和基因治疗指南的对,通过以下方式确立主题对应性:(1)将要求锚定到共同的ICH通用技术文档(CTD)模块/子主题,然后(2)由专家确认候选对确实具有主题对应性。

**特异性排除标准**。操作于不同监管层次水平的候选对(例如,统计分析计划 vs. 一般统计原则)被排除,以防止将细节层次差异与实质分歧标签混淆。排除的对列表为机器可读格式,未包含在试点发布中。

发布的试点数据集是两个JSONL文件(每个轨道一个),字段包括{id, topic, source, fda_text, ema_text, label},其中label∈{AGREE, DIVERGE, SILENT-FDA, SILENT-EMA}——沉默方向编码在标签中(表2 (https://arxiv.org/html/2608.28607#S5.T2) 的基础)。101对数据分为:42对一致,38对分歧,21对沉默(13对FDA沉默,8对EMA沉默),涵盖13个主题。doc_confidence(统一为中等)、disputed和annotation_notes注释目前在试点文件中不是独立字段。我们报告宏F1。

### 3.3. 标注协议

**标注者**。标注者A(C. Wu)是法规文档AI平台的解决方案架构师;标注者B(Z. Zhou)是AI驱动临床试验管理平台的产品经理。两人都没有正式的法规事务资质认证;轨道A的专家评审论文作为外部人类专家锚点。

**阶段**。阶段1:Wu根据定义框架分配标签;阶段2:Zhou独立地对所有101对重新标注,采用申办方义务框架,以检验框架无关的稳定性。κ是跨框架一致性度量,而非相同指令的标注者间一致性。计划为RegDivergence-500进行独立的第三方标注。

**标注者间一致性**。人类跨框架κ=0.85(101对,观测值0.90)——根据Landis与Koch(1977 (https://arxiv.org/html/2608.28607#bib.bib14)),属于实质性一致,与MedNLI(0.65)和ContractNLI(≈0.72)相当。沉默标签近乎完美(κ=0.98);一致/分歧标签更具变异性(≈0.79–0.81)。二次LLM一致性检查(36对样本)得出κ=0.542(重测信度,非人类标注者间一致性)。

**分歧(n=10)**。其中6对通过源论文语言解决;4对真正处于边缘的对保留阶段1标签,附书面理由记录在审稿人回复中(试点文件中无disputed字段)。

**沉默置信度**。所有21对沉默数据均视为中等置信度(统一值,非发布字段):已执行穷尽语料库搜索(完整的FDA和EMA指南、问答、反思文件),但缺失性断言在认知上仍属“软性”。高/中审计推迟至RegDivergence-500。

## 4. 基线

### 4.1. 评估协议

RegDivergence-101是**评估基准**,而非训练数据集。所有基线均为零样本或少样本;结果报告为排序趋势(相邻方法间宏F1差异Δ=0.15–0.60,置信区间部分重叠),而非成对显著性。

所有方法使用分层5折划分(5个种子),并计算95%自助置信区间(1,000次重采样)。词汇和NLI方法使用嵌套交叉验证(内部折调整阈值);Graph-RAG和LLM判断器无可调超参数(LLM判断器在所有101对上评分,仅计算自助置信区间)。

### 4.2. 词汇启发式方法

无神经模型,无API——完全离线且确定性。结合TF-IDF余弦相似度与五种冲突信号:否定不对称性、分歧提示对(例如,单臂 vs. 随机化)、情态强度不对称性(must/shall vs. may/encouraged)、数值阈值不匹配以及单侧特异性(具体数字 vs. 个案评估)。共享的ICH引用是一致性的强信号。

### 4.3. NLI交叉编码器

使用typeform/distilbert-base-uncased-mnli,双向运行;标签从矛盾/中立/蕴含概率中导出,阈值通过交叉验证调整。任何缺乏明确沉默类别的NLI模型都会将“未监管”映射为中立,结构性地压缩了沉默的召回率(§6 (https://arxiv.org/html/2608.28607#S6) 中的观察1);更强的编码器可提高一致/分歧的F1,但若无任务特定监督则无法解决此差距。

### 4.4. Graph-RAG成对分类器

对于每份文本,Claude Haiku提取策略三元组⟨主体,义务层级,要求,条件⟩,其中义务层级∈{强制性,禁止性,推荐性,许可性,沉默}。

相似文章

EnterpriseRAG:非理想企业检索场景下LLM指令遵循与鲁棒性的基准测试

arXiv cs.AI

介绍了EnterpriseRAG,一个包含六个领域983个专家验证样本的基准测试,用于评估LLM在非理想企业检索条件下的指令遵循和鲁棒性,这些条件包括噪声、知识缺口和事实冲突。对13个LLM的评估揭示了单个约束满足率与整体合规率之间的巨大差距,凸显了在生产级RAG系统中需要上下文感知协议。

面向多模态核监管文件多跳推理的LLM引导规划

arXiv cs.AI

本文将监管文件审查问题建模为LLM引导的规划问题,采用无向量文档树,配备浏览、读取和搜索工具,并以动态知识图谱作为状态。在针对NuScale FSAR文档的200个问题基准测试中,该系统达到了81.5%的准确率和0.93的RAGAS忠实度,显著优于现有RAG方法。

IndustryBench:探测大语言模型在工业知识领域的边界

Hugging Face Daily Papers

本文介绍了 IndustryBench,这是一个针对中文工业采购问答的大语言模型基准测试,以国家标准为参照评估模型表现,突显了安全合规方面的差距。研究揭示,在考虑安全违规的情况下,扩展推理往往会导致安全调整后的评分降低,并改变模型的排名。