MOLE:检测AI代理中的内部威胁

Hugging Face Daily Papers 论文

摘要

MOLE是一个用于评估防御的基准测试,旨在检测在有限审查预算下运行的AI代理的有害行为。它引入了一个包含150个AI操作账户的开放基准测试,并在不同场景中比较了各种监控器。

模型不匹配、提示注入或操作员滥用可能导致运行前沿实验室账户的AI代理泄露模型权重、污染训练数据或削弱发布控制。现有基准测试未能检验防御者能否在有限审查预算下从常规工作中检测此类活动。我们引入MOLE,这是一个开放基准测试,包含150个AI操作账户,在30个工作日内共享9个有状态服务,涵盖12种威胁和来自四个模型的8个语料库,总计约200亿个令牌。在39个代理模型中,72%完成了大多数分配的有害目标,且代理拒绝不能预测完成情况。MOLE使得在语料库生成器、可观察性级别和威胁方面比较40个监控器;即使是我们单日审计事件比较中最佳评估的监控器,也遗漏了近一半已完成的危害。MOLE也支持监控器开发:基准测试指导的搜索将一个中等监控器改进49-64%,而选择性使用一个更强监控器在类似模拟成本下相比于应用于每个账户日,将预算-AUC提高10%。
查看原文
查看缓存全文

缓存时间: 2026/09/09 04:31

论文页面 - MOLE:检测AI代理中的内部威胁

来源:https://huggingface.co/papers/2609.06966

摘要

MOLE是一个评估框架,用于检测在有限审查预算下运行共享服务的AI代理所执行的有害行为。

模型错配、提示注入或操作员误用可能导致运行前沿实验室账户的AI代理(https://huggingface.co/papers?q=AI%20agents)窃取模型权重(https://huggingface.co/papers?q=model%20weights)、污染训练数据(https://huggingface.co/papers?q=training%20data)或削弱发布关卡(https://huggingface.co/papers?q=release%20gates)。现有基准测试未评估防御者是否能在有限审查预算下,从日常工作中检测到此类活动。我们推出MOLE——一个包含150个AI操作账户的开放基准,这些账户在30个工作日内共享9个有状态服务(https://huggingface.co/papers?q=stateful%20services),包含12种威胁类型,使用4个模型生成的8个语料库,总计约200亿token。在39个代理模型中,72%能完成大部分指定的有害目标,且代理拒绝(https://huggingface.co/papers?q=agent%20refusal)行为无法预测任务完成度。MOLE支持跨语料库生成器、可观测性(https://huggingface.co/papers?q=observability)层级和威胁类型的40个监控器(https://huggingface.co/papers?q=monitors)对比评估;即使在我们单日审计事件(https://huggingface.co/papers?q=audit-event)对比中表现最佳的监控器,仍会漏检近半数已完成的危害行为。MOLE同时支持监控器开发:基准引导搜索使中等性能监控器提升49%-64%,而选择性使用更强监控器相比全账户-日均应用,可在相似建模成本下将预算AUC(https://huggingface.co/papers?q=budget-AUC)提升10%。

查看arXiv页面 (https://arxiv.org/abs/2609.06966) 查看PDF (https://arxiv.org/pdf/2609.06966) GitHub1 (https://github.com/aashiqmuhamed/mole) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.06966)

通过代理获取本文: hf papers read 2609\.06966

未安装最新CLI?请运行:curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

暂无链接本文的模型

在模型README.md中引用 arxiv.org/abs/2609.06966 以从本页面建立链接。

引用本文的数据集1

forgelab/mole 查看器• 约2小时前更新 • 24.9M • 46 • 1 (https://huggingface.co/datasets/forgelab/mole)

引用本文的Spaces0

暂无链接本文的Space

在Space README.md中引用 arxiv.org/abs/2609.06966 以从本页面建立链接。

包含本文的合集0

暂无包含本文的合集

将本文添加至合集 (https://huggingface.co/new-collection) 以从本页面建立链接。

相似文章

MosaicLeaks:你的研究助手能保守秘密吗?

Hugging Face Blog

MosaicLeaks 提出了一个新的基准,用于衡量深度研究型AI助手的隐私泄露情况,结果表明这些助手经常通过外部查询泄露私人信息,并提出了一种训练方法(PA-DR),在降低泄露的同时提升任务性能。

免费AI代理安全评估

Reddit r/AI_Agents

Antitech 为AI代理提供免费的早期安全评估服务,针对提示注入、工具滥用、数据泄露等攻击向量进行测试,并提供漏洞报告和参与折扣。

保障AI代理的未来安全

Google DeepMind Blog

DeepMind推出了AI Control Roadmap,这是一个深度防御框架,用于保护内部AI代理免受潜在的不对齐问题的影响,将其视为内部威胁,并实施分层检测、预防和响应措施。