CMNIE:面向中文军事新闻的信息抽取基准
摘要
CMNIE 是一个针对中文军事新闻的新型信息抽取基准,它联合标注事件、实体和关系,以评估模型在模式遵循和精确跨度匹配方面的表现。
arXiv:2609.10722v1 公告类型:新
摘要:从中文军事新闻中进行结构化抽取支持情报分析、决策制定和知识库构建。然而,现有资源在这一领域的联合信息抽取支持有限,尤其是在需要同时建模事件、事件参数、实体和关系时。我们提出了CMNIE,一个针对中文军事新闻的信息抽取基准。通过将军事领域资源扩展到文档级事件标注之外,CMNIE在统一的领域模式下联合标注事件触发器、事件参数、命名实体和实体关系。该数据集包含从公开中文军事新闻中收集的13,000个实例,并手工标注了7种事件类型、10种参数角色、7种实体类型和8种关系类型。我们在共享测试集上评估了监督式IE模型、零样本大型语言模型和基于LLM的微调抽取方法。实验结果表明,CMNIE仍然具有挑战性,尤其是在关系抽取和事件参数跨度的精确匹配方面;零样本LLM通常能识别相关语义单元,但无法精确匹配黄金跨度边界。CMNIE为研究专门中文新闻中的模式遵循、精确跨度匹配和联合结构化抽取提供了一个标准化基准。
查看缓存全文
缓存时间: 2026/09/11 08:15
# CMNIE:面向中文军事新闻的信息提取基准 来源:https://arxiv.org/html/2609.10722 ###### 摘要 从中文军事新闻中进行结构化提取,能够支持情报分析、决策制定和知识库构建。然而,现有资源在支持该领域的联合信息提取方面存在局限,特别是在需要同时建模事件、事件论元、实体和关系的场景下。本文提出CMNIE,一个面向中文军事新闻的信息提取基准。CMNIE在文档级事件标注之外扩展了军事领域资源,在统一的领域模式下联合标注了事件触发词、事件论元、命名实体和实体关系。该数据集包含从公开中文军事新闻中收集的13,000个实例,并经过人工标注,涵盖7种事件类型、10种论元角色、7种实体类型和8种关系类型。我们在一个共享的测试集上评估了监督式信息提取模型、零样本大语言模型以及基于LLM微调的提取方法。实验结果表明,CMNIE仍具挑战性,尤其是在关系提取和事件-论元跨度的精确匹配方面;零样本LLM通常能识别相关语义单元,但难以精确匹配标准边界。CMNIE为研究专业中文新闻中的模式遵循、精确跨度匹配和联合结构化提取提供了标准化基准。 ###### 关键词: 信息提取 事件提取 命名实体识别 关系提取 中文军事新闻 ## 1引言 从军事新闻中进行信息提取,通过将非结构化报告转化为实体、关系、事件和事件论元的结构化记录,为情报分析、决策支持和结构化知识库构建提供支持。更广泛地说,结构化的事件信息可以促进下游的以事件为中心的多文档摘要\[24 (https://arxiv.org/html/2609.10722#bib.bib24)\]以及基于复杂事件语境的面向决策的推理\[22 (https://arxiv.org/html/2609.10722#bib.bib25)\]。信息提取的进展与基准数据集密切相关,包括ACE 2005\[18 (https://arxiv.org/html/2609.10722#bib.bib1)\]、DuIE\[6 (https://arxiv.org/html/2609.10722#bib.bib3)\]、DuEE\[7 (https://arxiv.org/html/2609.10722#bib.bib21)\]以及MAVEN系列\[19 (https://arxiv.org/html/2609.10722#bib.bib5),20 (https://arxiv.org/html/2609.10722#bib.bib6),21 (https://arxiv.org/html/2609.10722#bib.bib4)\]。这些数据集支持可靠的比较,并为中文军事新闻提供了部分覆盖,其中事件描述、装备名称、组织、地点和实体关系出现在特定领域的、信息密集的语境中。 军事新闻给信息提取带来了若干挑战。它包含武器、军事单位、设施、地缘政治实体和组织的冗长或缩写提及。事件论元可能距离触发词较远,或嵌入描述性从句中,而所有权、隶属、合作和敌对等关系常常在没有明确动词谓语的情况下出现。一个实例也可能包含相互依赖的实体、关系和事件论元。一个对齐所有四个层级的基准,能够直接衡量系统是否能恢复一个实例的完整信息结构。图1 (https://arxiv.org/html/2609.10722#S1.F1)展示了一个翻译后的CMNIE实例以及基准使用的四个标注层级。 图 1:CMNIE信息提取任务和标注层级示例。最接近的军事领域资源是CMNEE,一个文档级的中文军事事件提取数据集\[23 (https://arxiv.org/html/2609.10722#bib.bib7)\]。其标注集中在事件触发词和论元上,使得中文军事新闻中事件、实体和实体关系的联合评估尚待探索。 本文将CMNIE呈现为一个用于中文军事新闻信息提取的资源和基准,其统一的标注模式覆盖事件、论元、实体和关系。该基准既为传统的监督式信息提取系统设计,也为基于大语言模型的最新提取方法设计。除了精确匹配F1,我们还报告了零样本LLM的宽松事件分数,因为生成模型通常定位到正确的语义单元,但返回的边界与参考跨度不同。 贡献如下。首先,我们介绍了CMNIE,一个具有事件、事件论元、命名实体和实体关系联合标注的中文军事新闻信息提取基准。其次,我们描述了CMNIE的构建过程,包括源数据收集、实例构建、模式设计、人工标注、仲裁和质量评估。第三,我们提供了监督式信息提取模型、零样本LLM和基于LLM微调的提取方法的基准结果,并对跨度匹配和主要错误类型进行了分析。 ## 2相关工作 信息提取基准在任务范围和标注单元上各有不同。ACE 2005定义了多语言的实体、关系和事件标注\[18 (https://arxiv.org/html/2609.10722#bib.bib1)\];DuIE提供了大规模的中文关系三元组\[6 (https://arxiv.org/html/2609.10722#bib.bib3)\];DuEE涵盖了真实世界中文新闻中的65种事件类型和121种论元角色\[7 (https://arxiv.org/html/2609.10722#bib.bib21)\]。WikiEvents支持文档级的事件论元提取,而MAVEN系列则从事件检测扩展到事件关系和详尽的论元标注\[5 (https://arxiv.org/html/2609.10722#bib.bib20),19 (https://arxiv.org/html/2609.10722#bib.bib5),20 (https://arxiv.org/html/2609.10722#bib.bib6),21 (https://arxiv.org/html/2609.10722#bib.bib4)\]。这些资源共同展示了关联标注层级的价值,但它们的通用领域模式和标注单元使得特定领域的中文军事信息结构仅得到部分体现。领域特定的信息提取资源将其模式与本地术语和信息需求对齐。CMNEE是与CMNIE最接近的资源,为中文军事事件提供了文档级的触发词和论元\[23 (https://arxiv.org/html/2609.10722#bib.bib7)\]。CMNIE使用独立收集的语料库,并通过基于自身语料库分析和标注讨论开发的模式,对齐了所有四个层级。表1 (https://arxiv.org/html/2609.10722#S2.T1)从实例数、事件提及、事件标签、论元角色、实体类型和关系类型方面,将CMNIE与代表性信息提取资源进行了比较\[5 (https://arxiv.org/html/2609.10722#bib.bib20),18 (https://arxiv.org/html/2609.10722#bib.bib1),20 (https://arxiv.org/html/2609.10722#bib.bib6),23 (https://arxiv.org/html/2609.10722#bib.bib7)\]。 表 1:与代表性信息提取数据集的比较。信息提取方法在跨度和模式表示上同样各异。DyGIE++使用上下文化的跨度表示,OneIE执行全局信息的联合提取,UIE将多个信息提取任务视为统一的结构生成\[9 (https://arxiv.org/html/2609.10722#bib.bib9),10 (https://arxiv.org/html/2609.10722#bib.bib11),17 (https://arxiv.org/html/2609.10722#bib.bib10)\]。最近的基于LLM的方法更明确地编码任务规范:GoLLIE基于标注指南调节生成,ADELIE使LLM与信息提取监督对齐,KnowCoder将模式表示为代码\[8 (https://arxiv.org/html/2609.10722#bib.bib22),13 (https://arxiv.org/html/2609.10722#bib.bib16),16 (https://arxiv.org/html/2609.10722#bib.bib17)\]。零样本LLM进一步测试了一般的指令遵循能力是否能迁移到具有严格标签和边界约定的规范密集型提取任务中\[11 (https://arxiv.org/html/2609.10722#bib.bib18)\]。 ## 3 CMNIE数据集 ### 3.1 源数据收集与实例构建 CMNIE从具有高领域相关性的公开中文军事新闻源构建。我们从新浪军事111https://mil.news.sina.com.cn/、凤凰军事222https://mil.ifeng.com/和网易军事333https://war.163.com/收集了原始新闻网页。使用Python Requests和BeautifulSoup,我们按时间顺序抓取了2010年8月至2022年2月发布的超过40,000篇军事新闻文章。抓取后,删除了重复页面、格式错误条目、导航文本、HTML片段、乱码文本和其他样板内容;使用三个来源减少了对单个编辑来源的依赖。 为了获取领域相关的候选实例,我们首先构建了一个候选触发词字典。从预定义的事件清单出发,LLM仅用于建议同义词和相关表达;所有建议的术语在字典匹配前均经过人工筛选。字典匹配保留了约20,000个候选文本;人工筛选去除了约7,000个,保留了13,000个用于标注。人工筛选应用了三个标准:话题相关性要求实例属于CMNIE模式范围内;文本质量要求完整、可读、不重复且无网页噪声的上下文;标注可行性则倾向于具有可控数量独立事件的实例,以便所有四个层级能够一致地进行标注。字典仅用于候选检索;所有最终标签和跨度都是从完整的保留上下文中手动标注的。保留集包含有和没有事件标注的实例;经过话题和质量筛选后,长度排序仅用于组织人工审核顺序。 中文分词用于支持标注和检查。使用哈尔滨工业大学LTP工具包对文本进行分词\[1 (https://arxiv.org/html/2609.10722#bib.bib2)\]。为了减少军事术语的分词错误,我们在分词前收集了领域术语,并将其添加到分词词典中。最终的标注是基于跨度的;分词作为工作流程辅助,所有边界都直接锚定到源文本。 ### 3.2 标注模式 该模式通过语料库分析、试点标注和专家讨论构建。初始事件清单源自目标军事新闻领域,并通过检查触发词和论元是否能一致地识别来进行修订;这一过程导致增加了“展览”事件,它经常出现在装备展示和公开演示新闻中。 CMNIE定义了四个标注层级:事件标签、事件论元角色、实体类型和关系类型。每个包含事件的实例包含一个触发词跨度、一个事件类型以及零个或多个具有论元角色的事件论元;其他实例则具有空的事件标注。初始清单包含六种事件类型:试验、演习、部署、事故、保障和支援。在标注过程中,许多实例描述了主体在特定时间或地点展示装备,因此增加了“展览”作为第七种事件类型。“保障”作为数据集事件类型,用于后勤和供应支援事件。 表2 (https://arxiv.org/html/2609.10722#S3.T2)总结了事件标签定义和有效的论元角色。所有类型、角色和关系名称与数据集标注保持一致。论元角色包括主体、装备、日期、地点、内容、区域、军事力量、结果、对象和材料。实体类型包括人、时间、地缘政治实体、装备、组织、地点和设施。关系类型包括属于、承载、隶属、等同、敌对、研发、合作和同等。 表 2:CMNIE事件标签和论元角色约束。实体标注捕获了填充事件角色和关系论元的主要提及类型。人涵盖个人和人群;时间包括日期、时间和时间跨度;地缘政治实体覆盖国家、城市、省、州和其他政治实体。装备涵盖武器、平台、系统和其他军事装备,而组织包括军事单位、机构、公司和其他组织。地点用于非政治地点、基地、地区和其他地点表达;设施则保留给功能性结构和基础设施,包括机场、建筑、铁路和桥梁。 关系标注捕获实体提及之间稳定或语境化的联系。属于记录装备与组织或地缘政治实体之间的所有权或操作关联。承载涉及人员或另一装备的承载配置,而隶属编码了对更高层组织或地缘政治实体的层级隶属关系。等同连接指代同一现实世界实体的提及;敌对记录对抗性联系;研发捕获开发联系;合作代表协作联系;同等表示同等关系。等同关系很重要,因为军事新闻经常交替使用装备的全称和缩写。事件论元和命名实体是独立的标注层级,因此较长的论元跨度可能有意包含更具体的实体跨度,如图1 (https://arxiv.org/html/2609.10722#S1.F1)中的内容论元和嵌套实体所示。 ### 3.3 标注工作流程与质量评估 标注工作流程遵循了针对四个CMNIE标注层级的两阶段、多轮设计。自动事件类型预标签仅用作参考;标注员手动判断事件类型、触发词跨度、论元跨度和角色、实体跨度和类型以及关系三元组。标注团队包括20名经验丰富的通用标注员,他们都接受了CMNIE专门培训,以及五名负责指南制定、疑难案例和分歧审查的领域专家。在第一阶段,经验丰富的标注员和领域专家独立标注打乱的批次,每批后审查分歧以完善边界规则、角色约束和关系示例。在第二阶段,标注员团队根据最终标准修正所有批次,而领域专家审计抽样实例并解决疑难案例,直到批次级质量指标达到所需阈值。图2 (https://arxiv.org/html/2609.10722#S3.F2)总结了数据构建和标注工作流程。 图 2:CMNIE的构建和标注工作流程。对于质量评估,我们使用了四个审计指标:事件类型准确率、事件论元召回率、命名实体召回率和关系召回率。只有当所有四个指标都至少达到95%时,一个批次才会被接受;否则,它将被退回进行讨论和修正。最终的审计分数分别为95.3%、95.1%、99.4%和97.8%。这些数值衡量了仲裁后的最终审计质量。 为了量化仲裁前的标注可靠性,十名通用标注员独立标注了相同的500个实例。表3 (https://arxiv.org/html/2609.10722#S3.T3)报告了由此产生的仲裁前标注员间一致性:针对事件标注状态和类型(空或七种事件类型之一)的Fleiss' kappa,以及针对结构化层的平均成对精确匹配F1,要求所有相关跨度和标签匹配。 表 3:十名标注员独立标注的500个CMNIE实例的仲裁前标注员间一致性。事件类型一致性最高;关系和论元较低,因为它们结合了跨度和标签决策,并继承了组成部分的分歧。这种模式支持交叉检查和专家仲裁。 ### 3.4 数据集统计 CMNIE包含13,000个新闻实例。其中,6,997个包含事件标注,6,003个事件标注为空。由于每个
相似文章
CFMS:面向可解释细粒度中文多模态讽刺检测基准
北京大学研究人员提出了CFMS,这是首个细粒度中文多模态讽刺检测基准,包含2,796个图像-文本对和三级标注框架(讽刺识别、目标识别、解释生成),以及一种新颖的强化学习增强上下文学习方法(PGDS),该方法显著优于现有基线。
CNM-BERT:一种基于表意描述序列的汉字即插即用结构嵌入
本文提出CNM,一种轻量级增强方法,通过表意描述序列将汉字的离散组合结构注入BERT,在提升稀有字符和未登录字符性能的同时保持通用自然语言理解准确率。
MiNER:针对临床文本中疟疾疾病实体识别的微调生物医学自然语言处理
本文提出了MiNER,一个微调的BioBERT模型,用于从疟疾相关临床文本中提取生物医学实体,并发布了一个人工标注的数据集以供未来研究。
KoNeoBench:一个用于评估 LLM 对韩语新词理解的精选评估数据集
本文介绍了 KoNeoBench,这是一个精选的基准数据集,用于评估大型语言模型对韩语新词的理解,基于自2020年以来的1,785个在线新闻条目。它揭示了当前 LLM 在处理近期词汇变化和特定韩语语言特性方面的局限性。
ClinicalMC:面向大语言模型的多疗程临床决策基准
ClinicalMC是一个基准,旨在评估大语言模型在多疗程临床决策中的表现,包含中文和英文数据集以及一个多智能体评估框架。