UZH Shared Task 2026中的LLM-INSTRUCT:用于段落级论点挖掘的约束感知检索与选择性辩论
摘要
本文介绍了LLM-INSTRUCT,它是ArgMining 2026 UZH Shared Task中段落级论点挖掘任务的获胜系统。该系统采用约束感知检索和选择性辩论来提高准确性和schema合规性。
arXiv:2607.20430v1 公告类型:新提交
摘要:我们提出了LLM-INSTRUCT,这是ArgMining 2026 UZH Shared Task中针对联合国和联合国教科文组织决议的段落级论点挖掘任务的获胜系统。该任务要求进行段落类型分类、预测141个官方标签的子集,并在严格的JSON schema设置下使用仅限80亿参数以内的开放权重模型进行有向关系预测。我们将其视作约束结构化预测任务。系统首先通过元数据感知的密集检索缩小候选标签空间,然后应用带每维度上限的约束解码,仅将不确定案例升级至三智能体辩论分支,最后验证输出schema。在官方排行榜上,LLM-INSTRUCT综合排名第一,F1分数第一,LLM-as-a-Judge排名第五。在开发过程中,我们的配置搜索将任务1b微观F1从35.83%提升至40.08%,同时保持内部任务2分数为4.421。主要经验很简单:在生成前缩小决策空间可同时提高准确性和提交的鲁棒性。我们的代码和支持脚本可公开获取:https://github.com/LLM-Instruct-at-UZH-Shared-Task-2026/Method
查看缓存全文
缓存时间: 2026/07/24 05:15
# LLM-Instruct 在 UZH 2026 共享任务中的应用:面向段落级论点挖掘的约束感知检索与选择性辩论 来源:https://arxiv.org/html/2607.20430 Phuong Huu Vu Tran1,\*,\*\*, Long Minh Vo2,\*,\*\*, Son Nguyen Minh Le1, Hoang Van2,3 1 越南德国大学,越南 2 RMIT 大学越南分校,越南 3 VANGIA INNOVATIONS,越南 \* 这些作者贡献相同。 \*\* 通讯作者:[email protected], [email protected] ###### 摘要 我们提出 **LLM-Instruct**,该系统是 ArgMining 2026 UZH 共享任务中面向联合国和联合国教科文组织决议中段落级论点挖掘的获胜系统。该任务要求在严格的 JSON schema 约束下(仅使用参数不超过 8B 的开源模型),执行段落类型分类、预测 141 个官方标签的子集以及有向关系预测。我们将该任务定义为受约束的结构化预测。系统首先通过元数据感知的密集检索缩小候选标签空间,然后应用带每维上限的约束解码,仅将不确定的 case 升级到三智能体辩论分支,最后验证输出 schema。在官方排行榜上,**LLM-Instruct** 总体排名第 1,其中 F1 排名第 1,LLM-as-a-Judge 排名第 5。在开发阶段,我们的配置搜索进一步将任务 1b 的 Micro-F1 从 35.83% 提升到 40.08%,同时保持内部任务 2 的得分为 4.421。主要经验很简单:在生成前缩小决策空间既能提高准确性,也能增强提交的稳健性。我们的代码和支持脚本公开在:https://github.com/LLM-Instruct-at-UZH-Shared-Task-2026/Method ## 1 引言 UZH 在 ArgMining 2026 的共享任务要求参与者重构高度正式的机构文本中的论证结构。对于每个段落,系统必须判断其属于文件的前言部分还是执行部分,分配 141 个预定义主题标签的子集,并恢复与同一文档中其他段落的有向论证关系。该任务的难点在于文本长度长、标签库封闭且结构化,且提交格式严格:不符合格式的 JSON 将不被评估。换句话说,该基准要求同时具备语义合理性和 schema 有效的输出。 该基准更应被视为一个受约束的预测任务,而非开放式文本生成。模型需要对长篇机构段落进行推理,但同时必须保持在固定标签库内、保留段落索引、并产生 schema 有效的预测。因此,我们在最终生成之前缩小了可接受的输出空间。候选检索缩小了标签空间;主办方提供的元数据在检索和每维上限中重复使用;解码被投影回检索到的集合;最终验证强制提交 schema。 本文做出三项贡献。首先,它描述了在官方共享任务约束下排名第一的 LLM-INSTRUCT 提交方案的端到端流程。其次,它指出了结果背后的关键设计选择:在生成之前约束可接受标签,而不是让模型搜索完整的 141 个标签库。第三,它报告了开发轨迹,揭示了早期运行的主要失败模式,即跨维度过度预测。 ## 2 相关工作 我们的系统结合了约束解码、密集检索、辩论式推理和论点挖掘流程的思想。特别是,它与那些在解码前或解码过程中限制可接受输出的设置最为接近(Genget al., 2023; Liuet al., 2022),同时也借鉴了密集检索(Karpukhinet al., 2020)、辩论式控制(Duet al., 2024)以及先前的论点挖掘工作(Lawrence and Reed, 2020; Stab and Gurevych, 2017)。该共享任务的不同之处在于,仅语义合理性是不够的:预测还必须满足严格的输出 schema。从更广泛的背景来看,我们的流程也与端到端和文本到文本的论点挖掘方法形成对比,包括将结构化预测视为生成(Paoliniet al., 2021)、端到端通用论点挖掘(Cao, 2023)、用于 AM 的微调 LLM 流程(Cabessaet al., 2025),以及最近基于关系的论点挖掘的 LLM 工作(Goruret al., 2025)。 ## 3 提出的方法 图1 总结了流程。最终的排行榜运行包括三个预测阶段,后跟一个提交安全层。我们设计该流程以满足这些严格的任务约束,同时保持生成过程高度受控。接下来我们描述其组件。 输入文档 法语段落文本 英译 文档元数据 1. 类型阶段 确定性启发式规则 *前言论* vs. *执行部分* 2. 标签阶段 原型检索:维度 | 类别 | 代码 top-k 闭集 + 上限 LLM 标签选择 最终运行中的选择性辩论 3 智能体对困难 case 进行反驳 投影回闭集 3. 关系阶段 局域性 + 相似度候选 LLM 评分 + 边上限 提交安全 schema 规范化 闭集检查 JSON 验证 最终排行榜流程 图1:系统流程。获胜配置在最终生成前减少了决策空间:密集检索创建可接受的标签集,主办方提供的元数据被编码在标签原型中并用于每维上限,高不确定性的 case 升级到三智能体辩论分支,其输出被投影回相同的可接受标签集,最后进行 schema 验证。 ### 3.1 类型阶段 每个段落首先被分类为 `preamble` 或 `operative`。在开发过程中,我们发现确定性启发式规则比纯基于 LLM 的方法更稳定,因此最终配置保留了这个基于规则的步骤。具体来说,当段落匹配明确编号的从句模式或执行部分的提示短语时,我们将其分类为执行部分;否则默认为前言论。表1 展示了启发式规则使用的代表性触发器。这减少了流程早期阶段的方差,并避免将不稳定的类型决策传播到后续阶段。 表1:类型启发式规则使用的代表性触发器。 ### 3.2 元数据感知的标签检索与解码 标签阶段是该系统的核心。我们读取官方标签 CSV,并保留 CODE 字段既不为空也不为 NA 的行。对于每个剩余标签 t,令 d_t、c_t 和 y_t 分别表示其已发布的维度、类别和 CODE 字段。我们将标签原型文本化为 p_t = d_t || c_t || y_t, 其中 || 表示字符串连接。然后,我们使用 intfloat/e5-base-v2 (Wang et al., 2022) 对 p_t 和段落文本进行嵌入,并利用余弦相似度进行密集 top-k 检索 (Wang et al., 2022; Karpukhin et al., 2020)。 这种设计使检索过程具有元数据感知能力:维度与类别信息在最终标签生成之前就已存在于原型文本中。LLM 永远不会在整个 141 个标签库上进行预测。相反,它从检索到的闭集中进行选择。在最终运行中,我们对每个段落应用全局上限 5 个标签,以及每个维度上限 2 个标签。这些固定控制限制了同一语义区域内的冗余性,并抑制了跨维度过度预测。最后,任何解码出的、超出检索到的候选集的标签都将被拒绝。这些控制共同解决了开发过程中观察到的主要失败模式,即跨维度过度预测。 除了检索候选标签外,最终标签提示还包含来自训练发布中最多三个检索到的上下文示例(当它们的嵌入相似度超过 0.70 时)。这些示例仅作为类似段落如何被标记的上下文证据;它们不会扩展官方标签库,最终预测仍会投影回检索到的闭集。 ### 3.3 选择性辩论分支 我们还实现了一个硬 case 路由,使用三个基于开源 8B 参数的智能体——Qwen3-8B (Yang et al., 2025)、Llama-3.1-8B-Instruct (Grattafiori et al., 2024) 和 Ministral-8B-Instruct (Mistral AI, 2024)——灵感来源于辩论式推理 (Du et al., 2024)。 在这种设置下,仅当段落不确定时才会触发辩论,具体包括:在开发调优的规则下 top-1 标签的边际较低、启发式规则与生成器在类型上不一致、或者检索到的候选标签在不同竞争维度上有高度重叠。每个智能体提出一个类型/标签假设,智能体之间交换一轮针对性的反驳,然后一个受约束的选择器仅接受那些仍在检索到的候选集内且重新应用相同每维上限的标签。换句话说,辩论永远不会扩大可接受的标签集;它仅帮助在同一个检索到的闭集中解决困难的 case。 ### 3.4 关系阶段 关系预测从稀疏的候选生成开始,而非穷举的全对评分。为清晰起见,表2 总结了子任务 2 中使用的四个官方关系标签。对于每个源段落,我们通过取一个段落的局部窗口内的所有目标,并添加同一预测实例中嵌入相似度最高的六个目标,来形成候选目标集。这样既能保持邻近的话语链接,也允许非相邻的语义链接。 然后,Qwen3-8B 生成器仅使用表2 中的四个官方标签或“无关系”选项对每个候选对进行评分。我们保留置信度至少为 0.40 的对,并将每个源段落最多限制为五个出边,按置信度排序。这些过滤器控制了关系图的密度,并防止关系预测成为无界的全对生成问题。由于保留的测试集不暴露黄金关系标签,我们在此阶段报告关系输出统计量,而非黄金标准下的精确率或召回率。 表2:子任务 2 中的官方关系标签。 ### 3.5 提交安全 最后阶段专注于提交的有效性。它在摄取时规范化 schema 变体,在导出前验证所需键,强制官方关系标签集,检查段落索引一致性,并在必要时尝试修复格式错误的 JSON(最多三次)。这个组件至关重要,因为违反所需格式的提交将无法获得官方评分。 ## 4 实验 ### 4.1 数据与官方设置 该共享任务包含两个子任务。子任务 1 预测段落类型(前言论或执行部分)以及 141 个官方标签的多标签子集。子任务 2 预测段落到段落的链接,并将每个有向关系标记为对立、支持、互补或修饰。官方排名汇总了一个自动 F1 指标和一个 LLM-as-a-Judge 评分。由于公共排行榜报告的是排名而非绝对值,我们报告官方排名位置,并用内部开发指标进行补充。 主办方发布了一个来自 UN-RES 语料库的大规模未标注训练集,该语料库与 SpiritRAG 资源相关(Gao et al., 2025),共包含 2695 份联合国决议,以及一个保留的教科文组织评估集。我们直接使用主办方提供的任务发布内容,未引入额外训练标签。文本提供的是法语,主办方提供了英语翻译以支持非法语参与者。在我们的最终配置中,任务 1 和任务 2 在可用时优先读取英语字段,否则回退到原始法语段落。我们优先使用英语(当可用时),因为主办方提供的翻译简化了非法语团队的提示设计、定性检查和调试。任务页面还发布了一个 CSV 文件 evaluation_dimensions_updated.csv,其中包含官方标签库以及维度和类别元数据。我们的方法在检索和解码中直接使用了该文件。在当前分析的人工制品中,所有评估实例都有英语可用,因此在本版本中我们不单独呈现仅法语的案例研究。 ### 4.2 模型与评估协议 最终系统遵守任务策略,仅使用参数最多为 8B 的开源权重模型。主生成器是 Qwen3-8B,采用 4 位推理模式(Yang et al., 2025)。密集检索使用 intfloat/e5-base-v2(Wang et al., 2022)。表3 报告了表现最佳的内部配置的确定性设置。 我们提供两种互补的性能视图。首先,我们展示测试集上的 **官方排行榜结果**。由于主办方尚未发布确切的官方得分,我们报告排名位置而非绝对分数。其次,我们报告 **内部开发轨迹**,该轨迹指导了系统选择并揭示了主要失败模式。遵循共享任务设置,我们的内部评估使用任务 1 的分数以及基于评判者关系评估的任务 2 分数。代码、提示和支持脚本已公开在 our GitHub repository。 表3:最强内部配置与最终排行榜提交的关键设置。 ### 4.3 结果 表4:内部开发轨迹。T1a 是段落类型分类;T1b 是标签分配。T2 Judge 是内部 LLM-as-a-Judge 加权关系得分。从阶段 1/2 到阶段 3 的主要修正在于在相似召回率情况下恢复精确率,与过度预测的诊断一致。 #### 4.3.1 官方排行榜最终排名 表5 给出了官方排行榜排名。主要实证结果很直接:**LLM-Instruct** 总体排名第 1。该表还显示了我们早期的提交版本 LLM-Instruct-2(对应于较早的阶段 2 式配置)以及最强的竞争团队。 表5:UZH 共享任务的官方排行榜排名。* LLM-Instruct-2 是我们的第一次提交,对应于较早的阶段 2 式运行。 这种模式与系统的设计优先级一致。当基准奖励有效的结构化输出时,收益最为显著。因此,官方排名第一的结果支持我们的核心主张:在硬输出约束下,schema 感知的控制层对于段落级论点挖掘是有用的。这也与表4 中的内部轨迹一致。
相似文章
模式约束的文档级事件论元提取与轻量级LLM微调
本文提出了一种模式约束的文档级事件论元提取方法,使用经过LoRA微调的中型开源LLM,结合角色集注入和确定性解码,在MAVEN-ARG上取得了最先进的结果。
RASC+: 面向临床值集编制的检索约束型大语言模型裁决方法
本文介绍了RASC+,一种用于临床值集编制的检索约束型大语言模型裁决方法,其通过基于Qwen3的检索和盲目裁决,提升了候选集召回率和选择精度,显著优于RASC基线中的直接生成方法。
SCICONVBENCH:在计算科学任务制定中基准测试LLMs的多轮澄清能力
SCICONVBENCH是一个基准测试,用于评估LLMs在跨计算科学领域中对表述不清的科学查询进行多轮澄清的能力。研究发现,即使是顶尖模型也难以进行消歧,并且频繁做出隐性假设。
整合知识图谱与多语种学术语料库,实现社会科学与人文学科领域自适应大语言模型
本文介绍了欧洲LLMs4EU项目与ALT-EDIC基础设施中的一个用例,重点通过整合知识图谱和多语种学术语料库,将基础模型适配至社会科学与人文学科(SSH)研究实践。该方法旨在支持问答、文献综述等任务,同时确保领域敏感性与法规合规性。
基于思维树启发的混合方法:使用大语言模型进行法律案件判决摘要生成
提出一种基于思维树的抽取-生成混合方法,利用大语言模型进行法律案件判决摘要,在DeepSeek和LLama上的实验表明,该方法生成的摘要优于单独的抽取式或生成式方法。