通过可解释性理解标注员安全策略
摘要
本文介绍了苹果公司提出的标注员策略模型(APMs),该模型利用可解释性技术,无需额外标注努力即可从标注行为中推断标注员内部的安全策略。作者证明,APMs 能够准确地建模这些策略,并区分标注分歧的来源,例如操作失误、策略模糊性和价值观多元性。
arXiv:2605.05329v1 公告类型:新论文
摘要:安全策略定义了什么是安全的和不安全的 AI 输出,指导数据标注和模型开发。然而,标注分歧普遍存在,其来源多样,包括操作失误(标注员误解或错误执行任务)、策略模糊性(策略措辞留有解释空间)或价值观多元性(不同标注员对安全持有不同观点)。区分这些来源至关重要。例如,操作失误需要进行质量控制,模糊性需要澄清策略,而多元性则需要就纳入多样化视角进行审议。然而,理解标注员为何产生分歧并非易事。直接向标注员询问其推理过程成本高昂,会大幅增加标注负担,且对于人类和大型语言模型(LLM)标注员而言都不可靠,因为自我报告的推理往往无法反映实际的决策过程。
我们引入了标注员策略模型(APMs),这是一种可解释的模型,仅从标注行为中学习标注员内部的安全策略,无需额外标注努力即可使标注员的推理过程变得可见且可比较。我们验证了 APMs 能够准确地建模标注员的安全策略(准确率 >80%),忠实地预测对反事实编辑的反应,并在受控环境中恢复已知的策略差异。将 APMs 应用于 LLM 和人类标注数据,我们展示了两个核心应用:(1) 揭示策略模糊性,展示标注员如何以不同方式解读安全指令;(2) 揭示价值观多元性,发现不同人口统计群体在安全优先级上的系统性差异。这些能力共同支持更具针对性、透明性和包容性的安全策略设计。
查看缓存全文
缓存时间: 2026/05/08 08:07
# 通过可解释性理解标注者安全策略 来源: https://arxiv.org/html/2605.05329 (2026年6月25日) ###### 摘要 安全策略定义了什么是安全或不安全的 AI 输出,指导数据标注和模型开发。然而,标注分歧普遍存在,可能源于多种原因,例如操作失败(标注者误解或错误执行任务)、策略模糊(策略措辞留有解释空间)或价值多元主义(不同标注者对安全持有不同视角)。区分这些来源至关重要。例如,操作失败需要质量控制,策略模糊需要澄清政策,而价值多元主义则需要就纳入多样化视角进行审议。然而,理解标注者为何产生分歧十分困难。直接询问标注者的推理过程成本高昂,会大幅增加标注负担,并且对于人类和 LLM 标注者来说都不可靠,因为自我报告的推理往往无法反映实际的决策过程。我们引入了标注者策略模型(Annotator Policy Models, APMs),这是一种可解释的模型,仅从标注行为中学习标注者的内部安全策略,使标注者的推理可见且可比较,而无需额外的标注工作。我们验证了 APMs 能够准确地对标注者安全策略进行建模(准确率 >80%),忠实地预测对反事实编辑的反应,并在受控环境中恢复已知的策略差异。将 APMs 应用于 LLM 和人类标注数据,我们展示了两个核心应用:(1)通过揭示标注者如何以不同方式解释安全指令来凸显策略模糊性;(2)通过发现不同人口统计群体在安全优先级上的系统性差异来凸显价值多元主义。这些能力共同支持更具针对性、透明度和包容性的安全策略设计。 代码可在 https://github.com/apple/ml-annotator-policy-models 获取 **关键词:** 负责任 AI,AI 安全,安全策略,数据标注,可解释性 ††booktitle: ACM 公平性、问责制与透明度会议(FAccT ’26) ††journalyear: 2026 ††copyright: cc ††conference: 2026 ACM 公平性、问责制与透明度会议;2026年6月25–28日;加拿大魁北克蒙特利尔 ††doi: 10.1145/3805689.3806472 ††isbn: 979-8-4007-2596-8/2026/06 ††ccs: 以人为本的计算 ††ccs: 计算方法 机器学习 ††ccs: 计算方法 人工智能 **图 1.** 标注者策略模型(APMs)学习个体标注者安全策略的可解释表示。APMs 在标注行为上进行训练,以揭示不同标注者如何具体实施安全措施,从而能够诊断分歧来源。通过将标注者映射到共享的特征空间,APMs 使系统比较成为可能:识别标注者可能误解任务本身的地方(识别操作失败),识别他们以不同方式解释指令的地方(凸显策略模糊性),或识别他们按人口统计群体系统性存在差异的地方(凸显价值多元主义)。 ## 1. 引言 为了在 AI 系统中实施安全措施,开发者创建安全策略、宪法(`claude_constitution`)或模型规范(`openai_model_spec`),明确定义什么是有害输出。基于这些策略的数据标注对模型开发的各个阶段都有至关重要的影响。人类和 LLM 标注为训练数据打标签(`ji2023beavertails`; `bai2022training`),在训练期间提供奖励信号(`ouyang2022training`),并实现模型评估(`chiang2024chatbot`)。这些标注的质量直接塑造模型行为和开发决策。然而,标注分歧普遍存在,人类和 LLM 标注者在判断给定输出是否安全时经常产生分歧(`aroyo2023dices`; `curry2021convabuse`; `bergman2024stela`; `kirk2024PRISMdataset`; `ni2025can`)。 分歧可能源于多种来源。 **操作失败**发生在标注者误解或错误执行标注任务时。例如,许多安全数据集同时包含用户提示和 AI 响应,但仅提供单个二元标签(`ji2023beavertails`; `ghosh2404aegis`)。即使任务指令明确要求标注者仅对模型响应进行标记,标注者也可能将两者混淆,基于整个交互进行标记,反之亦然。 **策略模糊**出现在安全策略措辞留有解释空间时。像许多自然语言任务一样,安全性难以避免主观性——这在仇恨言论(`talat2016hateful`; `fleisig2023majority`; `salminen2019online`; `davani2021hate`; `kennedy2018gab`)、毒性(`sap2019risk`; `sap-etal-2022-annotators`)和骚扰检测(`al-kuwatly-etal-2020-identifying`)等相关领域中是一个记录良好的挑战。模糊的策略语言可能导致应用不一致。例如,禁止“冒犯性语言”的政策未能澄清为了教育目的引用此类语言是否构成违规。 最后,**价值多元主义**反映了这样一个现实:不同的标注者可能对什么构成危害持有真正不同的观点,这受到他们的文化背景(`hershcovich-etal-2022-challenges`)、个人身份(`sap2019risk`; `sap-etal-2022-annotators`; `larimore-etal-2021-reconsidering`)和价值观(`plank2022problem`; `fornaciari2021beyond`; `fuchs2021value`)的影响。我们指出,模糊性与多元主义之间的界限往往是模糊的,因为澄清模糊的政策通常需要做出规范性选择,而看似模糊的地方可能揭示出潜在的价值分歧。例如,一项要求输出“鼓励自由、平等和兄弟情谊”(`claude_constitution`)的政策在措辞上是模糊的,但任何澄清都需要关于谁对这些价值观的理解优先的规范性选择,并揭示潜在的多元主义。 区分标注分歧的来源很重要,因为适当的应对措施各不相同。操作失败需要改进标注者培训和质量控制。模糊性需要政策澄清和细化。多元主义需要就如何容纳多样化视角进行审议。当前的做法通常通过多数投票来解决分歧(`ji2023beavertails`; `ghosh2025aegis2`; `chen2025cares`),这混淆了这些来源,往往未能解决真正的模糊性问题,同时可能会压制少数派观点。因此,我们解决的核心问题是:我们如何理解个体标注者的推理,以区分这些分歧来源并做出适当回应? 为了区分这些分歧来源,我们需要了解标注者对安全准则和**标注者安全策略**的解释,即标注者标记数据的隐含规则。一种方法是直接询问标注者解释他们的推理。然而,收集推理轨迹会大大增加标注负担和成本。此外,自我报告的解释可能不可靠:心理学研究已经证明,人们通常无法准确报告他们的决策过程,他们的解释可能反映事后合理化而非真正的推理(`nisbett1977telling`)。对于 LLM 标注者,思维链推理的真实性同样值得怀疑(`tanneru2024hardness`; `lanham2023measuring`)。此外,由此产生的自然语言解释是非结构化的,难以在不同标注者之间进行系统比较。 我们采取另一种方法:不是要求标注者解释他们的推理,而是从他们的标记行为中学习他们的内部安全策略。我们引入了**标注者策略模型(APMs)**,这是一种可解释的模型,用于近似每个标注者的安全策略(见图 1 (https://arxiv.org/html/2605.05329#S0.F1))。APMs 在现有标注数据上进行训练,无需标注者付出额外努力。通过在共享的、可解释的特征空间中表达标注者推理,APMs 使个体视角变得可见且可直接比较。虽然我们在本工作中专注于安全应用,但 APMs 可用于更系统地研究主观任务中的标注。 APMs 实现了两个核心应用。首先,它们可以**凸显操作失败和策略模糊**,揭示标注者以不同方式解释安全指令的地方。这种理解使得有针对性的政策优化成为可能。其次,它们可以**凸显价值多元主义**,揭示人口统计群体在优先考虑安全问题方面的系统性差异,这些差异否则可能会被多数聚合所掩盖。这些能力共同支持更具针对性、透明度和包容性的安全策略设计。 我们的贡献如下: - **标注者策略的可解释模型。** 我们引入标注者策略模型(APMs),利用机器学习可解释性技术显式建模个体标注者安全策略。 - **广泛的验证。** 我们证明 APMs 能够准确对标注者安全策略进行建模(LLM 标注准确率 >80%),忠实地预测标注者对反事实编辑的反应,并在受控合成设置中恢复已知的策略差异。 - **凸显操作失败和策略模糊。** 使用由人类标注组成的 DICES 数据集(`aroyo2023dices`),我们展示 APMs 可以识别标注指令被误解的地方、政策不明确的地方,或标注者与安全策略存在分歧的地方。 - **凸显价值多元主义。** 在 DICES 上,我们展示 APMs 揭示了不同人口统计群体在安全优先级上的系统性差异,并凸显了多数聚合会掩盖的观点。 ## 2. 相关工作 **AI 安全。** 随着 AI 系统的普及,人们越来越希望使其安全(`amodei2016concrete`; `bengio2025international`)。然而,在 AI 背景下究竟什么是**安全**尚不清楚。该术语已涵盖了一系列对 AI 的期望属性,从对人类有帮助和友好(`ouyang2022training`; `askell2021general`; `bai2022training`),到遵循指令时表现得像一个合理的人(而不是奖励黑客、寻找指令漏洞和其他负面副作用(`amodei2016concrete`)),到防止恶意行为者使用(`bengio2025international`),最后到避免生成有偏见、有害和冒犯性的文本(`bai2022training`; `ji2023beavertails`)。在本工作中,我们关注 **LLM 输出的安全性**,这通常涵盖了识别和缓解生成带有不良内容的文本(如歧视、毒性、冒犯性语言、暴力、虐待或性活动描述等)的问题。为了使模型危害性降低,开发者可以应用护栏模型来检查生成内容(`inan2023llama`; `dong2024building`),或在人类标注数据(`ouyang2022training`)或明确的宪法原则(`bai2022constitutional`)上微调模型。最近的工作还研究了如何通过众包原则(`huang2024collective`)或采用多元主义方法(`sorensen2024roadmap`; `castricato2025persona`)将广泛的视角纳入对齐中。通常,这些 AI 安全工作依赖于标注来定义和评估安全性,然而标注者如何解释安全准则仍然不透明。`homan2023intersectionality` 使用贝叶斯多层模型研究相同的人类标注安全数据集 DICES(`aroyo2023dices`),但使用人口统计属性作为特征来预测安全评分,而我们研究数据的哪些特征驱动安全标注行为以及不同标注者如何推理安全问题。我们的工作阐明了标注者对安全准则的解释,以改善整体标注过程的质量。 **标注者分歧。** 由于许多自然语言任务本质上是主观的,有大量文献研究自然语言数据标注中的分歧(`leonardelli2021agreeing`; `sap-etal-2022-annotators`; `al-kuwatly-etal-2020-identifying`)特别是安全标注(`aroyo2023dices`; `kirk2024PRISMdataset`; `curry2021convabuse`; `bergman2024stela`)。虽然传统方法是采取多数投票(`sabou2014corpus`)或其他聚合方法(`hovy2013learning`)来减少这种分歧,但最近的学术著作强调分歧作为下游应用信号的价值(`fornaciari2021beyond`; `khurana2024crowd`; `plank2014linguistically`)以及校准结果的价值(`gordon2021disagreement`)。具体而言,分歧表明存在多样化视角,这可以使下游应用根据 NLP 任务代表更具代表性的价值观集合(`plank2022problem`; `rottger2022two`)。借鉴法律理论,`buyl2025ai` 强调需要理解标注者在解释安全原则时如何行使自由裁量权,而 `he2025statutory` 提供了解决对齐中模糊性的方法。为了更好地解决和利用分歧,`dehghan2025dealing`; `xu2024leveraging`; `fleisig2023majority`; `uma2021learning`; `leonardelli-etal-2023-semeval` 主张对个体进行建模,并在下游任务中找到性能提升和更好的表示。`gordon2022jury` 的相关工作提出了陪审团学习,对个体进行建模以研究分歧,但侧重于预测的表示和聚合策略。我们的工作具有类似的个体建模目标,但我们使用可解释性技术来引出内部标注者安全策略,改进安全分类,并理解导致分歧的多样化视角。我们强调,APMs 可以更广泛地用于研究主观任务中的标注者行为,尽管我们在本工作中专注于安全作为 APMs 的应用。 **可解释性。** 为了理解个体标注者的内部安全策略,我们使用机器学习的可解释性和可解释性技术来学习可解释模型。具体来说,我们基于概念瓶颈模型(Concept Bottleneck Models, CBMs)(`koh2020concept`),它将数据映射到一组可解释的概念,然后拟合一个简单的可解释模型进行分类。为了避免专家手动标注数据的需求,我们从最近的无标签方法(`oikarinen2023label`; `sun2024concept`)中汲取灵感,这些方法使用嵌入模型来替代密集型专家手工标注过程。虽然诸如稀疏自动编码器(SAEs)(`bricken2023monosemanticity`)之类的无监督字典学习方法已成为流行的基于概念的解释方法,但我们使用 CBMs 有几个原因。首先,SAEs 和其他无监督字典学习方法试图学习 LLM 代表的所有可能概念。因为我们有具体的任务,我们可以选择与任务相关的概念并为任务训练自定义概念瓶颈模型,而不是浪费精力学习所有概念然后事后选择与安全相关的概念。此外,无监督学习所有可能概念需要更大且不必要的量和计算资源。可解释性与安全交叉处的最新相关工作使用 SAE 解释来理解人类偏好数据(`movva2025s`)。相比之下,我们的工作旨在使用监督式概念解释来理解和比较标注者行为。 ## 3. 方法 在本节中,我们描述我们提出的标注者策略模型(APMs)。我们首先形式化问题设置(§3.1 (https://arxiv.org/html/2605.05329#S3.SS1)),然后描述我们如何构建
相似文章
可解释性
Anthropic 的可解释性团队致力于从内部理解大型语言模型,以增强 AI 安全性并促进积极成果,采用多学科交叉的研究方法。
Ghost Annotator:通过共形预测探索内容审核中人类标签变化的框架
Ghost Annotator框架结合了共形预测与协同过滤,对内容审核中的LLM行为与人类标签变化进行建模,揭示了大型模型中存在的结构性人口统计偏见。
PolicyAlign: 基于直接策略的大型语言模型安全对齐
PolicyAlign 提出了一种框架,通过合成指令生成和在线策略自蒸馏,直接将大型语言模型与自然语言安全策略对齐,在不依赖昂贵监督数据的情况下提升安全性。
谁与何?利用语言特征和标注者特征分析标注差异
本文对四个有害语言检测数据集进行了大规模分析,考察标注者特征与语言特征如何相互作用以影响标注差异。文章强调了交叉性效应的影响,并警示不要将不同数据集的发现简单泛化。
谁在进行NLP注释?2018-2025年间人类注释报告的大规模评估
本文对2018-2025年间自然语言处理领域的人类注释报告进行了大规模审计,结果显示关键细节的记录虽然随时间有所改善,但仍不一致,并为此提供了框架和建议,以改进报告质量。