面向LLM标注的标注指南改进与重用
摘要
本文提出了一种迭代式调节框架,通过改进和重用标注指南来提升基于LLM的标注性能,并在使用GPT、Gemini和DeepSeek模型的生物医学NER任务上进行了验证。
arXiv:2605.20809v1 公告类型:新
摘要:尽管大语言模型(LLM)在零样本标注任务上表现出色,但它们往往难以适应黄金标准基准中的专业惯例。我们提出了系统性地重用和改进标注指南作为对齐机制,并引入了一个迭代式调节框架,模拟标注项目的早期阶段。我们评估了三个假设:(1)指南集成的有效性,(2)推理优化模型的优势,(3)在最小监督下进行调节的可行性。通过在三个LLM家族(GPT、Gemini、DeepSeek)的生物医学NER任务(NCBI Disease、BC5CDR、BioRED)上进行测试,我们的结果实证了所有三个假设。虽然迭代调节框架在有效改进指南方面显示出良好潜力,但我们的分析也揭示了较大的改进空间。
查看缓存全文
缓存时间: 2026/05/21 06:35
# 面向大语言模型注释的注释指南精炼与复用
来源:https://arxiv.org/html/2605.20809
第一作者所属单位 / 地址行1 所属单位 / 地址行2 所属单位 / 地址行3 email@domain &第二作者所属单位 / 地址行1 所属单位 / 地址行2 所属单位 / 地址行3 email@domain Kon Woo Kim1,2Jin\-Dong Kim3Akiko Aizawa1,2 1综合研究大学院大学(SOKENDAI) 2国立信息学研究所(NII) 3生物数据科学倡议(BSI),国立遗传学研究所(NIG) \{ken1204,aizawa\}@nii\.ac\.jp jdkim@dbcls\.rois\.ac\.jp
###### 摘要
虽然大型语言模型(LLM)在零样本注释任务中表现出色,但它们通常难以遵循黄金标准基准中专业化约定。我们提出将注释指南系统性地复用与精炼作为一种对齐机制,同时引入一个模拟注释项目早期阶段的迭代审核框架。我们评估三个假设:(1) 指南集成的有效性,(2) 推理优化模型的优势,以及(3) 在最小监督下进行审核的可行性。在生物医学NER任务(NCBI Disease、BC5CDR、BioRED)上使用三个LLM系列(GPT、Gemini、DeepSeek)进行测试,我们的结果从实证角度验证了所有三个假设。虽然迭代审核框架在有效精炼指南方面显示出良好潜力,但我们的分析也揭示了相当大的改进空间。
---
# 面向大语言模型注释的注释指南精炼与复用
Kon Woo Kim1,2Jin\-Dong Kim3Akiko Aizawa1,21综合研究大学院大学(SOKENDAI)2国立信息学研究所(NII)3生物数据科学倡议(BSI),国立遗传学研究所(NIG)\{ken1204,aizawa\}@nii\.ac\.jpjdkim@dbcls\.rois\.ac\.jp
## 1 引言
文本注释是各种文本处理任务(包括语义搜索和文本挖掘)的基础。近年来,对大型语言模型(LLM)进行零样本或少样本提示在通用标注任务中展现出令人瞩目的性能。然而,当注释必须满足特定下游需求时,调控LLM输出以遵循这些具体约束就变得并非易事。
传统上,在语料库注释领域,注释指南一直是规范人类标注者行为的主要机制。即使领域专家具备足够的背景知识,当他们遇到实际文本表达时,将这些知识转化为具体注释的方式也可能存在显著差异。关于目标实体的范围、“灰色地带”案例的解决以及跨度边界的精确确定,常常出现分歧。注释指南的存在正是为了标准化这些行为,防止出现原本可能随机或不一致的过程。因此,这些指南不仅编码了高层次的概念目标,还编码了为优化注释以满足实际应用所需的细粒度、任务特定的要求。这正是注释指南的价值所在:它们是严格优化努力的结果,旨在将下游应用需求转化为具体的标注规则。因此,对于任何文本注释工作来说,它们都是宝贵的资源。
对于基于LLM的注释,提示已成为生成注释的主要机制;然而,挑战在于如何有效地将这些专业化需求编码到提示中。本研究通过验证以下假设来应对这一挑战:
> H1:将注释指南纳入提示将改进基于LLM的注释。
基于指南的注释需要复杂的认知处理,因为将复杂规则应用于多样化的文本上下文可被视为一种演绎推理过程。因此,预计具有更优推理能力的模型在此任务上会表现更好。这引出了我们的第二个假设:
> H2:在基于指南的注释任务中,推理模型将优于其非推理对应模型。
指南往往是不完备的。这在传统语料库项目中显而易见,新标注者需要一个“培训”阶段。在此阶段,标注者注释一小部分文档,以识别与黄金注释之间的差异。这一过程称为审核,要么导致标注者理解能力的精炼,要么导致指南本身的澄清。值得注意的是,这一过程通常在最小监督下进行。由于指南本质上具有迭代性,且初始阶段存在模糊性,我们的最终假设是:
> H3:通过在最小监督下进行审核过程,注释指南可以得到有效改进。
请注意,指南精炼任务本身可以被构建为归纳推理过程。这种对演绎和归纳推理的双重要求进一步推动了我们的第二个假设。
本研究的贡献有三方面:
1. 我们提供了关于指南作用、推理能力和审核在基于LLM注释中三个假设的实证验证。
2. 我们引入了一个用于指南精炼的迭代审核框架,并展示了其在最小监督下使LLM输出与黄金标准约定对齐的有效性。
3. 我们提供了精炼过程的详细定性分析,揭示了指南的演变以及迭代过程中解决的具体语言差异,以促进未来研究。
## 2 相关工作
##### 生物医学语料库与文档级注释。
NCBI疾病语料库(Islamaj Doğan 等,2014 (https://arxiv.org/html/2605.20809#bib.bib2))提供了PubMed摘要上手动整理的病名提及与概念归一化,而BC5CDR(Li 等,2016 (https://arxiv.org/html/2605.20809#bib.bib4))支持化学和疾病实体,并带有BioCreative CDR任务的关系注释。BioRED(Luo 等,2022 (https://arxiv.org/html/2605.20809#bib.bib5))扩展到文档级关系抽取,包含多种实体类型和关系对。这些数据集体现了在注释项目中,详细的人工编写指南和审核对于处理边界案例和歧义至关重要(Islamaj 等,2020 (https://arxiv.org/html/2605.20809#bib.bib3))。我们专注于*仅NER*(精确跨度+类型),因为我们的指南精炼主要针对提及边界和类型分配。
##### LLM作为标注者与指南遵循者。
直到最近,许多注释项目因执行更快、成本更低而通过众包实现(Callison-Burch, 2009 (https://arxiv.org/html/2605.20809#bib.bib6))。除了传统注释流程,先前工作已探索LLM作为人工标注者的替代或补充(Wang 等,2021 (https://arxiv.org/html/2605.20809#bib.bib8); Ding 等,2023 (https://arxiv.org/html/2605.20809#bib.bib7))。一些研究表明,ChatGPT在若干文本注释任务上可以匹配或超越众包工人的质量,并推动了基于LLM的标注流程(Gilardi 等,2023 (https://arxiv.org/html/2605.20809#bib.bib9); Zhu 等,2023b (https://arxiv.org/html/2605.20809#bib.bib10))。然而,可靠部署取决于LLM是否能遵循详细的标注规则,而非通用任务描述。另一项研究考察了跨领域的指南遵循行为,发现性能可能脆弱,并对指南结构、歧义和边缘情况敏感(Fonseca and Cohen, 2024 (https://arxiv.org/html/2605.20809#bib.bib11))。
##### 利用LLM作为评判者与评估者。
若干研究显示LLM作为开放式输出评判者的潜力(Zhu 等,2023a (https://arxiv.org/html/2605.20809#bib.bib16)),并讨论了关键偏差,如位置与冗长效应(Zheng 等,2023 (https://arxiv.org/html/2605.20809#bib.bib15))。后续工作探索了LLM作为结构化评估者而非仅仅打分者(Liu 等,2023 (https://arxiv.org/html/2605.20809#bib.bib17))。我们的设置不同之处在于,评判者受明确的领域指南和分歧证据约束,其任务是生成可行的指南精炼而非标量偏好分数。
##### LLM的指南利用。
一些研究表明,使用指南通过提供清晰定义(Huang 等,2025 (https://arxiv.org/html/2605.20809#bib.bib12))和指令(Srivastava 等,2025 (https://arxiv.org/html/2605.20809#bib.bib13))有助于LLM保持一致性。一项案例研究说明LLM有助于识别指南问题并提出精炼建议,并表明分歧模式可用于迭代强化指南(Bibal 等,2025 (https://arxiv.org/html/2605.20809#bib.bib14))。另一项近期工作考察是否可以将现有人工注释指南直接重新用于基于LLM的注释,突出了指南驱动提示的潜力以及将复杂领域特定规则忠实地转化为模型行为的困难(Kim 等,2025 (https://arxiv.org/html/2605.20809#bib.bib1))。近期工作还探索了LLM辅助注释方案的开发(Fernandes 等,2025 (https://arxiv.org/html/2605.20809#bib.bib20))。然而,该研究方向侧重于构建注释方案,而我们的工作侧重于在最小监督下对现有人工编写指南进行迭代精炼与复用。
参见说明图1:迭代审核框架概览。给定当前注释指南,LLM对开发集进行注释,并将生成的注释与黄金注释进行严格的跨度与类型匹配评估。若性能令人满意或不再提升,则终止流程。否则,差异分析识别出主导错误模式,该模式经历三个审核阶段:模式解释、原则生成和指南精炼。精炼后的指南在下一轮迭代中复用。
## 3 方法论
(A) 模式解释(主导错误模式组)
模式名称:表型特征列表上下文抑制DiseaseClass标注。
混淆触发:出现在从属“特征列表”项(如with/of补足语,或report/causative动词的并列论点)中的条件术语被当作单纯症状/过程处理并被丢弃。
对比性证据:真正例集中在定义性疾病中心词框架中(如“X是一种常染色体隐性遗传病”),其中显式疾病中心词提示DiseaseClass。
规则(建议):如果一个名词短语指代一种临床状况,且作为从属特征列表项(如出现在with/of补足语或并列的report/causative框架中)出现,则将每个并列项标注为DiseaseClass;不得仅因列表呈现方式而抑制标注。
(B) 原则生成(单一通用原则)
如果一个指代临床状况的名词短语出现在从属“特征列表”结构中(例如,作为patient/syndrome名词的with/of补足语中的并列项,或受observation/reporting/causation动词支配的并列论点),则将该短语(并传递至所有并列项)使用最小必要跨度标注为DiseaseClass;除非该状况短语仅作为非疾病中心词(如gene/locus/region/protein/variant)的修饰语,或是不应标注为疾病的裸露/通用过程术语。
(C) 指南精炼(插入规则;截断版)
#4. 将并列的无中心词表型/病理学补足语标注为DiseaseClass
当一个并列序列的无中心词表型/病理学名词短语(如anemia, lymphadenopathy, rash)作为临床描述或诊断结构的补足语时,将每个并列项使用最小跨度标注为DiseaseClass。
适用结构包括:
- 患者/疾病中心描述(如patients with ..., characterized by ..., presenting with ...)。
- 引入表型列表的综合症层面框架(如a syndrome characterized by ...)。
不适用的情况:
- 项目是裸露的通用或过程术语(如symptoms, carcinogenesis)。
- 并列结构受显式疾病中心词支配(如breast and ovarian cancer; 遵循CompositeMention)。
注意:此规则仅细化DiseaseClass,不影响SpecificDisease或diseaseModifier处理(如ALPS vs. ALPS phenotype)。
(因篇幅限制截断。全文见图6 (https://arxiv.org/html/2605.20809#A1.F6)。)
图2:模拟LLM审核DiseaseClass指南精炼的示例。审核者识别到一类重复失败模式,即嵌入从属特征列表上下文(如with/of补足语和并列的report/causative框架)中的DiseaseClass提及被抑制,生成可操作的原则,并插入一条针对性指南规则以减少DiseaseClass假阴性。以下来自(C)的指南被插入到原始人工注释指南“What to Annotate”部分第3节(Modifiers)和第4节(Duplicate mentions)之间,如图5(b) (https://arxiv.org/html/2605.20809#A1.F5.sf2)所示。
### 3.1 任务形式化
该任务的目标是调整现有注释指南——最初为人工标注者开发——以调控LLM的性能。
在传统注释项目中,指南在试点阶段建立,多名人工标注者标注同一组文档。在此*审核*阶段,测量*标注者间一致性(IAA)率*,并迭代精炼指南以解决歧义并提高一致性。如果新标注者中途加入,他们将经历一个*培训*阶段:标注一小部分带有黄金注释的文档,并根据黄金注释评估其性能。如果IAA率不够高,则要么重新培训标注者,要么更优选地精炼指南以确保更好的可重复性和目标清晰性。
在本工作中,我们探索利用现有注释指南使LLM能够基于指南重现注释的潜力。我们将此过程构建为等同于通过迭代指南精炼培训新的人工标注者,只不过使用的是LLM标注者而非人工标注者。如图1 (https://arxiv.org/html/2605.20809#S2.F1)所示,提出的框架作为一个迭代循环运行,包括(1) 注释、(2) 评估和(3) 审核。
### 3.2 基于LLM的注释
在迭代轮次kk中,使用当前注释指南集GkG\_\{k\}提示LLM标注者标注开发集DD中的文档。此过程产生一组预测注释AkA\_\{k\}。
### 3.3 评估
为了评估LLM的性能,将预测注释AkA\_\{k\}与黄金注释AgA\_\{g\}进行比较。作为IAA率的度量,基于*严格匹配标准*计算F1分数,该标准要求实体边界和实体类型都精确匹配。
评估后,检查终止条件。在以下任一情况下,迭代结束:
1. 对齐达到预定义的质量阈值(IAAk≥τ\)
2. 对于精炼版本(k>0),最近一次精炼未能带来性能提升。相似文章
面向LLM-as-a-Judge的动态评估准则生成与优化
本文提出了一种无需训练的方法,可以在无需人工标注的情况下自动生成细粒度的评估准则用于LLM-as-a-Judge,并进一步介绍了一种迭代微调策略,使准则生成器的性能超过更大的专有模型。
论大语言模型适应性的局限:模型内化先验对标注任务性能的影响
本文研究了LLM的内化先验如何影响零样本标注性能,发现近三分之二的错误抵抗基于提示的修正,并引入了定义特定熟悉度(DSF)作为比记忆化指标更好的预测因子。
利用详细的宪法定义与AI驱动评估提升标注一致性
本文提出了一种AI驱动的工作流,该工作流为内容审核类别编写详细的宪法定义,并使用前沿大语言模型对其进行解释,以实现更一致的标注。在骚扰、仇恨言论和非暴力犯罪三个类别上的评估表明,与段落式定义相比,该方法将跨模型不一致性降低了最多57倍。
修正FOLIO和MALLS:经过验证的标注与聚焦人工重标的LLM辅助框架
本文对自然语言到一阶逻辑数据集FOLIO和MALLS进行了系统的人工审查,分别发现39%和36%的形式化错误。它发布了修正后的标准答案和一个辅助人工重标的LLM框架,该框架将审查工作量减少到少于24%的实例即可达到90%的准确率。
使用大语言模型自动标注汉语叙事转录文本
本文评估了使用大语言模型自动标注汉语口语叙事宏观结构的效果,发现最佳模型在降低65%标注时间的同时,达到了接近人类水平的可靠性,但在语义复杂或词汇多样的叙事文本上性能有所下降。