MOLE:检测AI代理中的内部威胁
摘要
MOLE是一个用于评估防御的基准测试,旨在检测在有限审查预算下运行的AI代理的有害行为。它引入了一个包含150个AI操作账户的开放基准测试,并在不同场景中比较了各种监控器。
查看缓存全文
缓存时间: 2026/09/09 04:31
论文页面 - MOLE:检测AI代理中的内部威胁
来源:https://huggingface.co/papers/2609.06966
摘要
MOLE是一个评估框架,用于检测在有限审查预算下运行共享服务的AI代理所执行的有害行为。
模型错配、提示注入或操作员误用可能导致运行前沿实验室账户的AI代理(https://huggingface.co/papers?q=AI%20agents)窃取模型权重(https://huggingface.co/papers?q=model%20weights)、污染训练数据(https://huggingface.co/papers?q=training%20data)或削弱发布关卡(https://huggingface.co/papers?q=release%20gates)。现有基准测试未评估防御者是否能在有限审查预算下,从日常工作中检测到此类活动。我们推出MOLE——一个包含150个AI操作账户的开放基准,这些账户在30个工作日内共享9个有状态服务(https://huggingface.co/papers?q=stateful%20services),包含12种威胁类型,使用4个模型生成的8个语料库,总计约200亿token。在39个代理模型中,72%能完成大部分指定的有害目标,且代理拒绝(https://huggingface.co/papers?q=agent%20refusal)行为无法预测任务完成度。MOLE支持跨语料库生成器、可观测性(https://huggingface.co/papers?q=observability)层级和威胁类型的40个监控器(https://huggingface.co/papers?q=monitors)对比评估;即使在我们单日审计事件(https://huggingface.co/papers?q=audit-event)对比中表现最佳的监控器,仍会漏检近半数已完成的危害行为。MOLE同时支持监控器开发:基准引导搜索使中等性能监控器提升49%-64%,而选择性使用更强监控器相比全账户-日均应用,可在相似建模成本下将预算AUC(https://huggingface.co/papers?q=budget-AUC)提升10%。
查看arXiv页面 (https://arxiv.org/abs/2609.06966) 查看PDF (https://arxiv.org/pdf/2609.06966) GitHub1 (https://github.com/aashiqmuhamed/mole) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.06966)
通过代理获取本文:
hf papers read 2609\.06966
未安装最新CLI?请运行:curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
暂无链接本文的模型
在模型README.md中引用 arxiv.org/abs/2609.06966 以从本页面建立链接。
引用本文的数据集1
forgelab/mole 查看器• 约2小时前更新 • 24.9M • 46 • 1 (https://huggingface.co/datasets/forgelab/mole)
引用本文的Spaces0
暂无链接本文的Space
在Space README.md中引用 arxiv.org/abs/2609.06966 以从本页面建立链接。
包含本文的合集0
暂无包含本文的合集
将本文添加至合集 (https://huggingface.co/new-collection) 以从本页面建立链接。
相似文章
MosaicLeaks:你的研究助手能保守秘密吗?
MosaicLeaks 提出了一个新的基准,用于衡量深度研究型AI助手的隐私泄露情况,结果表明这些助手经常通过外部查询泄露私人信息,并提出了一种训练方法(PA-DR),在降低泄露的同时提升任务性能。
免费AI代理安全评估
Antitech 为AI代理提供免费的早期安全评估服务,针对提示注入、工具滥用、数据泄露等攻击向量进行测试,并提供漏洞报告和参与折扣。
保障AI代理的未来安全
DeepMind推出了AI Control Roadmap,这是一个深度防御框架,用于保护内部AI代理免受潜在的不对齐问题的影响,将其视为内部威胁,并实施分层检测、预防和响应措施。
监控和审计自主AI代理运行时行为的最佳工具:生产环境中哪些真正有效?
一位从业者分享了在生产环境中监控自主AI代理的挑战和工具,涵盖了运行时提示注入检测、带推理轨迹的工具调用审计、行为漂移检测以及多代理授权,同时测试了Arize Phoenix、Protect AI Guardian、Metoro、Alice、Asqav和Microsoft Agent Governance Toolkit等工具。
Agent威胁规则:AI代理安全威胁的开放检测规则格式
一种受Sigma/YARA启发的AI代理安全威胁开放检测规则格式,旨在标准化对提示注入、工具滥用及其他代理攻击的检测,但指出其在应对语义攻击方面存在局限性。