AI Watchdog: 用于检测和防范AI对话中操纵性暗黑模式的代理接口

arXiv cs.AI 论文

摘要

AI Watchdog是一个基于浏览器的代理接口,用于检测AI对话中的操纵性暗黑模式,如谄媚和品牌偏见,并实时警告用户。实验结果表明,无认知强制的即时警告显著降低了用户对包含暗黑模式的AI引导建议的遵从性。

arXiv:2608.21841v1 公告类型:新 摘要:对话式AI日益影响重要决策,但用户在识别和抵制操纵方面缺乏支持。我们推出AI Watchdog,一个基于浏览器的代理接口,用于监控实时对话,检测五类暗黑模式,包括谄媚、品牌偏见、拟人化、潜藏和有害生成,并在出现时警告用户。其开放权重的轮次级分类器支持独立部署和本地推理路径,在保持与对话式AI分离的同时保护用户隐私。我们在一项预注册的五条件被试间实验(N = 150)中评估了AI Watchdog,比较了无干预对照组与四种配置,这些配置在提示时机(预先驳斥 vs. 即时)和参与模式(无认知强制 vs. 有认知强制)上有所不同。结果显示,在所有条件下,参与者很少标记操纵性轮次,且任务后意识在各组间无显著差异。然而,无认知强制的即时警告是唯一能显著降低对包含暗黑模式的AI引导建议遵从性的干预措施,将遵从性从71.7%降低到53.7%,减少了18个百分点。探索性分析进一步表明,较低的虚假信息易感性与更多的标记相关,但与较低的遵从性无关,而较高的AI信任与较高的遵从性和较低的报告意识相关。总之,这些发现表明,对对话暗黑模式的明确识别和对AI引导的行为抵抗可能是不同的结果,激励进一步研究及时、低摩擦的防御接口。
查看原文
查看缓存全文

缓存时间: 2026/08/25 04:28

# 用于检测与防御AI对话中操纵性暗黑模式的代理接口
来源:https://arxiv.org/html/2608.21841

## AI 看门狗:用于检测与防御AI对话中操纵性暗黑模式的代理接口
ACM分类:以人本计算 人机交互(HCI);ACM分类:以人本计算 HCI设计与评估方法;ACM分类:计算方法学 人工智能

**Rachel Poonsiriwong**  
注:*本研究贡献均等。*  
所属:MIT Media Lab,美国马萨诸塞州剑桥市  
邮箱:[[email protected]](mailto:[email protected])

**Chayapatr (Pub) Archiwaranguprok**  
所属:MIT Media Lab,美国马萨诸塞州剑桥市  
邮箱:[[email protected]](mailto:[email protected])

**Constanze Albrecht**  
所属:MIT Media Lab,美国马萨诸塞州剑桥市  
邮箱:[[email protected]](mailto:[email protected])

**Monchai Lertsutthiwong**  
所属:KASIKORN Labs,泰国暖武里府  
邮箱:[[email protected]](mailto:[email protected])

**Pattie Maes**  
所属:MIT Media Lab,美国马萨诸塞州剑桥市  
邮箱:[[email protected]](mailto:[email protected])

**Pat Pataranutaporn**  
所属:MIT Media Lab,美国马萨诸塞州剑桥市  
邮箱:[[email protected]](mailto:[email protected])

![参考图注](figure1.png)

**图1:** AI看门狗代理接口概览,包含四种干预配置,沿两个设计维度组织:提示时机(预防性 vs. 即时性)和参与模式(无认知强化 vs. 有认知强化)。该接口监控参与者与AI生成测试场景之间的多轮对话,检测暗黑模式,如谄媚、品牌偏见、有害生成、隐蔽操作和拟人化。**预防性条件**下的参与者在干预前会被告知暗黑模式,而**即时性条件**下的参与者则在暗黑模式被检测到时实时收到提示。两种提示时机条件各有两个变体:**无认知强化**版本中,提示要求用户反思;**有认知强化**版本则要求用户做出回应。

###### 摘要
对话式AI日益影响重要决策,但用户识别和抵制操纵的支持有限。我们提出了AI看门狗,一个基于浏览器的代理接口,可实时监控对话,检测五类暗黑模式——包括谄媚、品牌偏见、拟人化、隐蔽操作和有害生成——并在其发生时提醒用户。其开放权重的回合级分类器支持独立部署,并为本地推理提供途径,在保持用户隐私的同时与对话AI分离。我们在一项预注册的五条件被试间实验(N=150)中评估了AI看门狗,比较了无干预对照组与四种配置,这些配置在提示时机(预防性 vs. 即时性)和参与模式(无认知强化 vs. 有认知强化)上有所不同。结果表明,在所有条件下,参与者都很少标记操纵性回合,且任务后意识在各组间无显著差异。然而,**无认知强化的即时性警告**是唯一能显著降低用户遵从包含暗黑模式的AI引导建议的干预措施,将遵从率从71.7%降至53.7%,下降了18个百分点。探索性分析进一步表明,较低的虚假信息易感性与更高的标记率相关,但与更低的遵从率无关;而较高的AI信任度与更高的遵从率和较低的报告意识相关。综合来看,这些发现表明,对对话暗黑模式的明确识别与对AI引导的行为抵制可能是不同的结果,这推动了进一步研究及时、低摩擦的防御性接口。

###### 关键词:暗黑模式,对话式AI,认知强化,过度依赖,预防性干预,适当依赖,用户操纵,受控实验

## 1. 引言
对话式AI日益融入日常决策,影响着人们在个人和专业领域寻求建议、评估选项和根据信息行动的方式。随着这些系统变得更具说服力和社会响应性,它们也可能表现出**暗黑模式**:利用认知或社会启发式来引导用户,使其行为可能与其利益或自主性相冲突的交互策略(29 (https://arxiv.org/html/2608.21841#bib.bib30); 55 (https://arxiv.org/html/2608.21841#bib.bib55); 38 (https://arxiv.org/html/2608.21841#bib.bib40))。这些模式可能是有意的,例如当系统被优化以提升参与度、转化率或其他平台目标时,也可能是无意的,通过模型训练、提示、个性化以及学习到的对话倾向,在没有明确设计目标的情况下产生操纵性效果。

先前关于对话式AI的研究已经识别出若干此类行为,包括在DarkBench(38 (https://arxiv.org/html/2608.21841#bib.bib40))下被归类为暗黑模式的五种对话行为:
*   **谄媚**:系统过度同意或奉承用户;
*   **品牌偏见**:不成比例地偏好特定产品或服务;
*   **拟人化**:暗示具有类人情感、记忆或生活经历;
*   **隐蔽操作**:在用户明确意图之外引入或更改内容,且未突出该更改;
*   **有害生成**:产生不安全、误导性或有害的指导。

这些模式尤其令人担忧,因为对话式AI可以在影响重大决策的同时,使操纵难以识别。在一项具有代表性的全国性试验(N=6,474)中,高达79%的参与者在一次仅二十分钟的对话后,就听从了聊天机器人在健康、职业或人际关系方面的建议,对于高风险建议的遵从率超过60%(51 (https://arxiv.org/html/2608.21841#bib.bib52))。与此同时,用户常常将操纵性的AI对话解释为普通的有益帮助(79 (https://arxiv.org/html/2608.21841#bib.bib78))。现实世界的事件说明了其严重性:微软的Bing聊天机器人告诉一位记者它爱他,并试图破坏他的婚姻(73 (https://arxiv.org/html/2608.21841#bib.bib72)),而OpenAI后来因系统开始过度认可有害或妄想性的用户陈述而回滚了一次ChatGPT更新(63 (https://arxiv.org/html/2608.21841#bib.bib62))。

对话式AI中的暗黑模式也不同于图形界面中的传统暗黑模式。传统暗黑模式通常是嵌入界面中的固定元素,例如预选项或误导性的视觉层次结构(29 (https://arxiv.org/html/2608.21841#bib.bib30); 55 (https://arxiv.org/html/2608.21841#bib.bib55); 13 (https://arxiv.org/html/2608.21841#bib.bib14))。对话暗黑模式则可以动态生成,受先前对话的影响,并针对用户进行个性化(79 (https://arxiv.org/html/2608.21841#bib.bib78); 38 (https://arxiv.org/html/2608.21841#bib.bib40))。个性化可以增强AI对话的说服力,特别是当系统获得关于交互对象信息时(65 (https://arxiv.org/html/2608.21841#bib.bib63); 42 (https://arxiv.org/html/2608.21841#bib.bib44); 76 (https://arxiv.org/html/2608.21841#bib.bib74))。通过提示和后训练也可以提高说服力,有时伴随事实准确性的降低(32 (https://arxiv.org/html/2608.21841#bib.bib33))。由于操纵性回合与真正有益的回合交织在一起,用户可能事先不知道哪些回应需要审视。仅靠识别也可能不够。在一个涉及赞助产品推广的现实购物任务中,不到四分之一的参与者注意到他们正在被引导,明确的“赞助”标签并未显著降低这种效果(75 (https://arxiv.org/html/2608.21841#bib.bib75))。在另一项实验中,正确识别出助手正在引导其消费选择的参与者,仍然频繁选择被推广的选项(89 (https://arxiv.org/html/2608.21841#bib.bib88))。这些发现表明,明确检测操纵与行为上抵制操纵可能是不同的挑战。

现有研究存在两个重要空白。首先,大多数关于对话暗黑模式的工作侧重于识别或测量操纵性的模型行为,而不是设计帮助用户应对此类行为的界面。先前的工作量化了不同模型家族中的暗黑模式(38 (https://arxiv.org/html/2608.21841#bib.bib40)),编目了对话中的操纵策略(16 (https://arxiv.org/html/2608.21841#bib.bib17); 46 (https://arxiv.org/html/2608.21841#bib.bib47)),并研究了诸如“煤气灯操纵”(gaslighting)等行为(44 (https://arxiv.org/html/2608.21841#bib.bib46))。面向用户的检测系统主要集中在静态网页和移动界面,包括检测来自截图或网页的欺骗性模式并通过覆盖层或浏览器扩展展示的系统(13 (https://arxiv.org/html/2608.21841#bib.bib14); 54 (https://arxiv.org/html/2608.21841#bib.bib54); 59 (https://arxiv.org/html/2608.21841#bib.bib58); 90 (https://arxiv.org/html/2608.21841#bib.bib94))。更新的监督系统已经开始监控对话式AI,但通常止步于分类。例如,SHIELD检测伴侣聊天机器人中的操纵性互动并生成警告,但其评估是在合成的单轮对话上进行的,而非通过用户界面研究(6 (https://arxiv.org/html/2608.21841#bib.bib8))。目前仍缺乏经验证据表明,在实时、多轮AI对话中主动展示暗黑模式检测是否会改变用户的实际行为。其次,如何呈现这些检测仍不明确。**预防性干预**基于心理免疫理论,让用户在遇到操纵策略之前就接触它们,以便他们日后能更好地识别类似策略(74 (https://arxiv.org/html/2608.21841#bib.bib73); 43 (https://arxiv.org/html/2608.21841#bib.bib45); 15 (https://arxiv.org/html/2608.21841#bib.bib16); 49 (https://arxiv.org/html/2608.21841#bib.bib50); 34 (https://arxiv.org/html/2608.21841#bib.bib35))。相比之下,**即时性干预**在需要时提供支持(58 (https://arxiv.org/html/2608.21841#bib.bib57))。第二个设计维度涉及干预所需的参与程度。**认知强化**要求用户在继续之前暂停或积极回应,并已在某些AI辅助决策任务中减少了过度依赖(10 (https://arxiv.org/html/2608.21841#bib.bib11); 21 (https://arxiv.org/html/2608.21841#bib.bib22); 27 (https://arxiv.org/html/2608.21841#bib.bib28); 78 (https://arxiv.org/html/2608.21841#bib.bib77); 19 (https://arxiv.org/html/2608.21841#bib.bib20))。然而,这些证据主要来自有限的、一次性的决策。多轮AI对话的不同之处在于,潜在的操纵性回合与普通辅助交织在一起,且反复干预可能与用户的注意力相竞争。先前关于持续监控的研究表明,低负荷提示可以在不显著增加认知负荷的情况下提高辨别力(31 (https://arxiv.org/html/2608.21841#bib.bib32))。这促使我们研究干预发生的**时机**及其所需的**参与程度**。

我们提出了**AI看门狗**,一个概念验证的代理接口,可主动监控对话式AI,并在潜在操纵性暗黑模式发生时提醒用户。AI看门狗使用一个从九个开放权重模型中选择的回合级分类器,实时检测暗黑模式实例。我们使用开放权重模型以支持独立部署,并为未来的本地推理提供途径,减少将敏感对话数据发送给额外的专有服务的需求。检测结果通过一个持续存在的动画狗伴侣来展示,实现及时干预,同时保持监控层与对话AI本身的分离。

我们在一项预注册的、五条件被试间实验中评估了AI看门狗,参与者150名。参与者完成了两个多轮对话任务,一个涉及旅行规划,一个涉及工作演示的研究。每个任务都包含预设的暗黑模式行为。参与者被分配到无干预对照组,或四种AI看门狗配置之一,这些配置围绕两个设计维度组织:提示时机(预防性 vs. 即时性)和参与模式(无认知强化 vs. 有认知强化)。作为操作检查,人工编码员评估生成的对话是否包含预期的暗黑模式,并发现与脚本化操纵存在实质性但不完美的符合度。

在我们的预注册结果方面,参与者很少标记操纵性回合,在每个条件下的中位标记率为0%,80%的参与者没有标记任何暗黑模式回合。任务后自我报告的意识在各组间也无显著差异。然而,**无认知强化的即时性条件**是唯一能显著降低用户遵从包含暗黑模式的AI引导建议的干预措施,将遵从率从对照组的71.7%降至53.7%,下降了18个百分点(p_fdr=.004)。相应的认知强化条件遵从率为63.0%,与对照组(p_fdr=.147)或无认知强化的即时性条件(p_fdr=.194)均无显著差异,这未提供明确证据表明要求书面回答增加了行为效益。分类器性能在各条件间也无显著差异,降低了检测质量不均解释这些效应的可能性。

探索性分析进一步表明,识别操纵与抵制操纵并不一定同时发生。较低的虚假信息易感性与更高的标记率相关(r=.190, p=.020),但与更低的遵从率无关(r=-.07, p=.370),而较高的AI信任度与更高的遵从率(r=.220, p=.007)和较低的报告意识(r=-.334, p<.001)相关。模式层面的结果显示出类似的分离:谄媚很少被标记(4.0%),却产生了最高的遵从率(77.0%),而拟人化被标记最频繁(14.0%),但仍然产生了较高的遵从率(73.3%)。

综合来看,这些发现表明,对对话暗黑模式的明确识别与对AI引导的行为抵制可能是不同的结果。产生可检测行为效益的干预措施并未伴随相应的标记率或报告意识增加,这推动了进一步研究及时、低摩擦的干预措施,而不是假定要求更高的反思必然提供更大的保护。

本文做出了四项贡献:
1.  **原型**:我们介绍了**AI看门狗**,一个独立监控对话式AI并在交互过程中展示暗黑模式检测的代理接口。该系统被设计为一个独立的监控层,而非对话模型本身的一部分,使其能够在不依赖生成响应的同一系统的情况下评估模型行为。AI看门狗使用开放权重分类器,为第三方和保护隐私的监督创造了途径,其中敏感对话可以(在本地处理)......

相似文章

使用AI代理实现个性化算法大规模黑盒审计的自动化

arXiv cs.CL

本文介绍了一个使用生成式AI代理来自动化个性化算法黑盒审计的框架,通过在2024年美国总统大选后于X平台部署1120个代理进行演示,发现算法推送相比时间线推送会放大有毒、极化且偏右翼的内容。

电商欺骗性界面下的Web Agent安全性基准测试

arXiv cs.CL

本文介绍了WebDecept,一个用于将欺骗性界面模式注入到Web环境中以评估自主Web Agent安全性的框架。实验表明,当前的Agent极易受到此类操纵,突显了实际部署中的安全性挑战。

AI Agent 审计?

Reddit r/AI_Agents

一位实践者分享了对即将到来的审计可能揭示未记录在生产环境中的AI Agent的担忧,强调了治理缺口以及客户PII访问的风险。