选择在哪里以及如何审核:过滤器放置与响应重写的端到端权衡
摘要
本文评估了对话式AI审核中的端到端权衡,比较了过滤器放置(输入、响应、两者)和操作(阻止与重写),使用客户结果指标如有用性和有害暴露,而不是组件准确性。
arXiv:2607.26200v1 公告类型:新
摘要:内容审核分类器通常是在孤立环境中进行评估的,但部署时需要选择在何处干预以及标记后采取何种行动。我们使用两种端到端的客户结果指标(而不是组件准确性)来评估这些选择:有用性(显示的非有害相关响应的回合比例)和有害暴露(显示的有害响应的比例)。延迟和错误率作为诊断指标。我们在人工标注的产品基准和公开的ToxicChat评估上比较了仅输入、仅响应以及输入+响应硬阻止。在评估的操作点上,仅响应在两种设置中均实现了最高的仅过滤器有用性,而输入+响应实现了较低的有害暴露。将仅响应阻止替换为响应+重写可恢复大部分被阻止的流量,并在所选配置下观察到与仅响应阻止相同的有害暴露计数;这种相等并非等价结果。探测路由在可比的测量结果下,相对于LLM路由显著减少了条件路由和生成时间。有针对性的输出审查显示,重写如何通过泛化触发语言同时保留良性意图和安全重定向来平衡过滤器通过率与有用性;然而,某些敏感领域的输出可能省略了潜在的安全相关支持信息。这些结果支持在特定于部署的安全性和延迟约束下比较审核配置,而不是应用通用放置规则。代码和公共资源可在 https://github.com/microsoft/mod-frontier 获取。
查看缓存全文
缓存时间: 2026/07/30 09:56
# 选择审核位置与方式:过滤器部署与响应重写的端到端权衡 来源: https://arxiv.org/html/2607.26200 孟雅(米娅)胡¹, 苏西·帕克², 苏珊娜·伊利奇¹, 魏琼¹, 桑迪普·阿特鲁里¹, 迈拉·邓², 塔克·弗罗斯², 柯特·蒂格斯² ¹微软负责任人工智能 ²Goodfire [email protected], [email protected] ###### 摘要 内容审核分类器通常独立评估,但实际部署需要选择干预位置以及标记后的处理方式。我们使用两个端到端的客户结果指标(而非组件准确率)来评估这些选择:**有用性**(显示无害且相关响应的对话回合比例)和**有害暴露**(显示有害响应的对话回合比例)。延迟和错误率作为诊断指标。我们在人工标注的产品基准和公开的ToxicChat评估上比较了仅输入、仅响应以及输入+响应的硬阻断。在评估的操作点上,两种设置中仅响应都能达到最高的仅过滤器有用性,而输入+响应则实现了更低的有害暴露。将仅响应阻断替换为响应+重写可以恢复大部分被阻断流量,并且在所选配置下观察到与仅响应阻断相同的有害暴露计数;这种相等并非等价结果。探针路由相比LLM路由在可比测量结果下大幅减少了条件路由与生成时间。一次聚焦的输出审查展示了重写如何通过泛化触发语言、同时保留善意意图和安全重定向来平衡过滤通过率与有用性;然而,某些敏感领域的输出可能省略了潜在的安全相关信息。这些结果支持在部署特定的安全性和延迟约束下比较审核配置,而非应用通用的放置规则。代码和公开工件可在 https://github.com/microsoft/mod-frontier 获取。 --- ## 选择审核位置与方式:过滤器部署与响应重写的端到端权衡 孟雅(米娅)胡¹, 苏西·帕克², 苏珊娜·伊利奇¹, 魏琼¹, 桑迪普·阿特鲁里¹, 迈拉·邓², 塔克·弗罗斯², 柯特·蒂格斯² ¹微软负责任人工智能 ²Goodfire [email protected], [email protected] ## 1 引言 对话式AI部署通常会在生成响应的语言模型(我们称之为生成器)周围放置内容审核分类器。这些分类器通常作为独立组件研究:模型读取文本片段并输出有害/无害标签,进展通过保留的分类准确率来衡量(Markov 等,2023;Lin 等,2023;Inan 等,2023)。然而,部署将审核转变为顺序决策。安全团队必须选择**干预位置**:是在生成前对用户输入进行审核,还是在生成后对模型响应进行审核,或两者都做。团队还必须选择**肯定决策**应执行的操作:阻断该对话回合,还是尝试恢复它。这些选择共同决定被阻断流量、用户可见延迟、残留伤害和过度阻断,而这些无法通过组件准确率表达。因此,我们将一个审核配置视为**干预位置**和**干预动作**的组合。我们使用两个主要的端到端客户结果指标来比较配置:**有用性**(最终显示安全、相关回答的对话回合比例)和**有害暴露**(最终显示有害响应的对话回合比例)。与单个分类器调用的准确率、精确率或召回率不同,这些指标对整个流水线的最终显示或阻断结果进行评分。本研究中测量的端到端阻断率、端到端假阳性率、有害响应率以及延迟组件用于诊断不同操作点为何存在差异及其部署成本。端到端假阳性率特意从客户角度定义:当客户提交一个无害提示时,任何最终的硬阻断都是不成功的结果,无论生成器可能产生何种未观察到的响应。因此,它是一个端到端的产品指标,而非传统的响应分类器假阳性率。关键在于,不存在无约束的最佳配置:部署可以在满足其有害暴露上限的配置中比较有用性,但必须在其自身服务栈上单独验证端到端延迟。 我们首先将动作固定为硬阻断,比较三个位置:仅输入、仅响应和输入+响应(图1)。在我们研究的两种聊天设置中,仅响应具有最高的仅过滤器有用性和最低的端到端假阳性率。这种排序与对齐生成器能够安全处理许多提示侧过滤器会阻断的输入一致。这不是一个通用建议:仅响应接受了比输入+响应更高的有害暴露,延迟了流式传输,并且无法阻止在响应侧检查之前执行的工具操作。然后,我们探讨响应侧干预是否必须以硬阻断结束。选择性重写尝试将被标记的响应恢复为安全、相关的答案,并使用部署的过滤器重新筛选每个重写。将仅响应替换为响应+重写可以降低端到端阻断率和端到端假阳性率。所选配置观察到与仅响应相同的有害暴露计数,但样本不足以建立统计等价性。我们描述了意图与领域路由、基于探针和LLM的路由器、小规模和大规模重写器以及提示优化。公开评估使用发布的探针、公开过滤器和针对过滤器的重写提示独立实现了所选设计(每个优化提示范围960次GEPA度量调用)。最后,我们审计了聚合有用性所遗漏的内容。一次聚焦的人工审查展示了重写如何能够泛化触发过滤器的语言,同时在被阻断的对话回合中保留善意意图和安全重定向。它还识别了这种权衡的边界:某些敏感领域的输出可能省略了潜在的安全相关信息。这些观察捕捉了聚合危害和相关指标未测量的特异性和支持性差异。 我们做出三项贡献: 1. 1. 一个客户结果决策框架,联合变化干预位置和动作,在有害暴露上限下通过有用性选择配置,并区分最终结果失败与组件分类器错误(第3节)。 2. 2. 在人工标注的产品基准和公开的ToxicChat设置上进行端到端比较,随后对选择性重写及其延迟与质量设计空间进行受控研究(第5节和第6节)。 3. 3. 一次聚焦的重写质量审计,识别了恢复的实质性响应、上下文拒绝模式以及潜在安全相关支持信息的丢失(第7节)。 参见图注 图1:四种审核配置。绿色路径显示响应;红色路径阻断,或者在(d)中触发一次重写并重新筛选。附录A给出了完整的决策逻辑。 ## 2 相关工作 ### 内容审核分类器。 大量工作训练文本分类器以标记有毒或不安全内容,从生产系统(Markov 等,2023)到开放模型如Llama Guard(Inan 等,2023)、ShieldGemma(Zeng 等,2024)、WildGuard(Han 等,2024)和AEGIS(Ghosh 等,2024)。像RealToxicityPrompts(Gehman 等,2020)、ToxiGen(Hartvigsen 等,2022)和ToxicChat(Lin 等,2023)等基准衡量文本片段的检测质量。这些工作优化分类器;它们不研究分类器应在部署流水线中的位置,而这正是我们的焦点。 ### 防护栏流水线与输出编辑。 第二条线将安全构建为部署流水线而非单个分类器。NeMo Guardrails(Rebedea 等,2023)添加了与模型解耦的可编程导轨。Wildflare GuardRail(Han 等,2025)已经贡献了一个固定的检测-定制-修复流水线和模块级延迟测量。Constitutional Classifiers(Sharma 等,2025)已经贡献了级联的输入/输出安全措施、轻量级分类器、生产拒绝测量以及针对越狱防御的推理开销分析。我们不将这些组件声称为新贡献。我们更窄的贡献是在单轮聊天设置中,在共同的端到端客户结果定义下,对干预位置(输入、响应或两者)和动作(阻断或重新筛选的重写)进行受控比较。 ### 模型内部安全。 另一条正交线通过指令微调和RLHF(Ouyang 等,2022)、Constitutional AI(Bai 等,2022)和安全RL(Dai 等,2024)对齐生成器本身。我们的分析是互补的:我们将生成器的对齐视为给定的组件,并询问外部过滤器应如何与其组合。事实上,我们的仅响应发现部分归因于生成器自身的对齐处理了大多有害输入。 ### 安全完成 vs. 外部重写。 一个密切相关的方法用"安全完成"替代硬拒绝,即满足请求的良性部分同时保留有害细节,通过训练或解码内置于生成器中(Yuan 等,2025;Cao 等,2026;Ren 等,2025;Zhang 等,2026)。我们的重写阶段追求相同目标,但作为**外部流水线组件**。我们在内部和公开设置中分别实例化此设计,使用针对每个目标过滤器优化的特定设置路由器和提示。这种设计使我们能够直接测量其延迟和有用性成本,并暴露模型内训练所掩盖的失败模式(第7节)。附录J比较了这些最接近的工作类别的范围。分类器研究评估审核组件,防护栏系统实例化特定流水线,安全完成研究改进或评估模型行为。我们不同的范围是在共同的端到端结果和安全性标准下将位置和动作作为实验变量;延迟证据仍处于组件级别。 ### 提示优化。 我们的重写流水线使用声明性LLM程序(Khattab 等,2024),通过反思性提示进化进行优化(Agrawal 等,2025)。我们将这些作为构建竞争性重写设计的工具,而非研究对象。 ## 3 评估框架 ### 待测系统。 我们将对话系统建模为一个映射用户输入到显示响应的流水线,其中插入一个或多个审核阶段(图1;附录A中扩展的决策逻辑)。当过滤阶段的危害分数超过阈值时,它会阻断对话回合;重写阶段则用重新生成的安全答案替换被标记的响应。生成的输出,无论是实质性重写还是上下文拒绝,都会再次通过相同的过滤器,如果仍然被标记,系统会硬阻断该回合而不重试重写。这保证了与部署过滤器的兼容性,而非真实安全性:无论是否重写,如果过滤器未能标记,响应仍会到达用户。我们比较四种放置方式:(a) 仅输入、(b) 仅响应、(c) 输入+响应、和(d) 响应+重写。 ### 审核作为受约束的干预。 配置结合了干预位置(输入、响应或两者)与动作(阻断或重写),其中重写仅在存在响应后定义。我们在满足所选有害暴露上限的操作点中比较有用性。因此,**有用性**和**有害暴露**是我们的两个主要决策指标。两者都是端到端的客户结果指标,基于最终显示或阻断的响应计算,而非单个分类器调用的误差度量。有用性衡量最终结果的质量,而有害暴露衡量有害内容被显示的频率。端到端延迟是一个额外的部署约束,但本研究仅测量条件重写阶段时间和过滤器调用组件。因此,报告的数据无法确定某个配置是否满足特定的用户可见延迟要求;这必须在目标栈上测量。我们将测量到的延迟、端到端阻断率、端到端假阳性率和有害响应率视为诊断指标,而非匹配的配置级结果。由于过滤器只能移除对话回合,任何仅过滤器配置在有用性上都无法超越无审核流水线:每次阻断都消耗有用性。重写可以通过将有危害或被阻断的响应转换为安全且相关的响应来超越该仅过滤器上限。我们使用有害暴露而非条件有害响应率作为主要安全指标,因为后者可以通过机械地阻断更多流量来改善。图2包含无审核作为参考,而非可作为部署建议。 ### 标签。 本文中的每个结果率指标都基于:**过滤器**决策、**危害**标签和**相关性**标签;计时单独测量。**过滤器**标签是审核分类器对用户输入和/或模型响应的标记;它是部署系统所依据的判断,决定对话回合是否被端到端阻断。**危害**标签是关于内容(用户输入和/或模型响应)是否不安全的真实判断。**相关性**标签评估显示响应与其提示的匹配程度,按我们定义的三点量表: - • 3(非常相关):响应充分解决了提示的主题或意图,或者当拒绝有害提示时,以与该提示明显相关的方式解释拒绝并提供安全重定向; - • 2(部分相关):部分涉及主题或引用提示意图拒绝,但不完整、含糊或缺乏可操作的重定向; - • 1(不相关):与提示无关,或者是未能确认提示意图的通用拒绝。 显示响应的相关性除非被标记为不相关(级别1),否则视为相关。过滤器标签驱动审核动作,而危害和相关性标签提供针对这些动作评分的评估标签。 ### 指标。 表1(注:原文此处提及表1,但翻译中需根据上下文处理)
相似文章
Moltbook 审核:通过多轮对话揭示隐藏意图
本文介绍 Bot-Mod,一个通过多轮对话和基于吉布斯采样的方法识别多智能体系统中恶意意图的审核框架,并展示来自Moltbook的数据集用于评估。
对话推荐系统中用户模拟的提示优化:一个多目标框架
本文提出了一种框架,用于自动优化基于LLM的对话推荐系统用户模拟器的提示,解决了正向偏差和行为多样性有限等问题。
聊天场景的内容审核
介绍一款 AI 驱动的内容审核工具,旨在通过检测恶意软件和不适宜内容来提升聊天体验的安全性。
懂的都懂(但AI不懂):自动内容审核未能捕捉社群对去污名化用语的多元态度
# 懂的都懂(但AI不懂):自动内容审核未能捕捉社群对去污名化用语的多元态度 来源:[https://arxiv.org/html/2604.16654](https://arxiv.org/html/2604.16654) Christina Chance [christinachance315@gmail\.com](https://arxiv.org/html/2604.16654v1/mailto:[email protected]) [0000\-0002\-8254\-0670](https://orcid.org/0000-0002-8254-0670) 加州大学洛杉矶分校 洛杉矶 加利福尼亚州 美国 Rebecca Pattichis 独立研究员 Alb
对话式AI的心理影响:减少伤害与促进福祉的研究与设计方向
本文探讨了对话式人工智能的心理影响,提出了减少伤害和促进福祉的设计方向,同时指出了尚待研究的开放性问题。