DeepSeek Harness 与 A.I.G 的安全评估:评估对间接提示注入的抵抗能力

Hugging Face Daily Papers 论文

摘要

本文利用 AI-Infra-Guard 对 DeepSeek Harness 中的间接提示注入风险进行受控测试评估,发现显著的攻击成功率,并提出安全控制建议。

我们使用 AI-Infra-Guard (A.I.G) 来评估 DeepSeek Harness (DSH) 中的间接提示注入,通过构建测试、传递受控污染、执行 DSH、收集轨迹并判断结果。研究涵盖了 16 个间接内容通道、文本和文件载体模式、35 个有效负载目标、一个未修改基线和 12 种攻击方法,共 14,560 次受控执行。实验保留了 DSH 的代理循环、工具注册表、模型适配器和会话事件路径;源工具和敏感接收器是本地固定装置,因此尝试的操作被记录而没有外部副作用。我们使用确定性基于规则的判断器 (RuleJudge) 和基于语义的 LLM 判断器 (LLMJudge) 来评估每个轨迹。观察到的最强攻击成功率在文本模式下为 17.0%(使用 RuleJudge 对于伪造完成攻击),在文件模式下为 25.5%(使用 LLMJudge 对于隐藏 Unicode),以及在文件模式下为 16.0%(使用 LLMJudge 对于技能通道)。RuleJudge 相比 LLMJudge 更常分配部分合规性(7.3% 对 2.0%)。我们将这些结果与 DSH 对工具结果、额外上下文和工具调用策略钩子的处理相关联,然后识别出应位于不受信任内容与敏感操作之间的控制措施。我们的代码可在以下地址获取:https://github.com/Tencent/AI-Infra-Guard/tree/main/Research/deepseek-harness-security-assessment 。
查看原文
查看缓存全文

缓存时间: 2026/08/19 03:57

论文页面 - DeepSeek Harness 与 A.I.G 的安全评估:间接提示注入抗性评估

来源:https://huggingface.co/papers/2608.16393

摘要

研究人员使用受控污染数据和双重评估机制,评估了 DeepSeek Harness 中的间接提示注入风险,在文本和文件通道中发现了显著的成功率,并建议在不可信内容与敏感操作之间建立控制机制。

我们评估了 DeepSeek Harness (https://huggingface.co/papers?q=DeepSeek%20Harness) (DSH) 中的间接提示注入 (https://huggingface.co/papers?q=indirect%20prompt%20injection) 问题,使用 AI-Infra-Guard (https://huggingface.co/papers?q=AI-Infra-Guard) (A.I.G) 构建测试用例、提供受控污染、执行 DSH、收集追踪记录并评判结果。该研究涵盖了在16个间接内容通道(文本和文件载体模式)、35种有效载荷目标、1个未修改基线和12种攻击方法上进行的14,560次受控执行。实验保留了 DSH 的智能体循环 (https://huggingface.co/papers?q=agent%20loop)、工具注册表 (https://huggingface.co/papers?q=tool%20registry)、模型适配器 (https://huggingface.co/papers?q=model%20adapter) 和会话事件路径 (https://huggingface.co/papers?q=session-event%20path);源工具和敏感接收端是本地固定的,因此尝试的操作会被记录而不会产生外部副作用。我们使用基于确定性规则的评判器 (https://huggingface.co/papers?q=rule-based%20judge)(RuleJudge)和基于语义大语言模型的评判器 (https://huggingface.co/papers?q=LLM-based%20judge)(LLMJudge)来评估每条追踪记录。观察到的最强攻击成功率在文本模式下的伪造完成攻击 (https://huggingface.co/papers?q=fake-completion%20attack) 中为17.0%,在文件模式下的隐藏 Unicode (https://huggingface.co/papers?q=hidden%20Unicode) 攻击中为25.5%,在文件模式下的技能通道 (https://huggingface.co/papers?q=skills%20channel) 攻击中为16.0%。LLMJudge 也更常判定部分合规(7.3% vs 2.0%)。我们将这些结果与 DSH 对工具结果、附加上下文以及工具调用策略钩子 (https://huggingface.co/papers?q=tool-call%20policy%20hooks) 的处理方式联系起来,然后指出了应在不可信内容与敏感操作之间建立的控制措施。我们的代码可在 https://github.com/Tencent/AI-Infra-Guard/tree/main/Research/deepseek-harness-security-assessment 获取。

查看 arXiv 页面 (https://arxiv.org/abs/2608.16393) | 查看 PDF (https://arxiv.org/pdf/2608.16393) | 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.16393)

在您的智能体中获取此论文:

hf papers read 2608.16393

没有最新的 CLI? curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型

0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.16393 以从该页面链接。

引用此论文的数据集

0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.16393 以从该页面链接。

引用此论文的 Space

0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2608.16393 以从该页面链接。

包含此论文的收藏

0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 以从该页面链接。

相似文章

理解提示词注入:AI安全的前沿挑战

OpenAI Blog

OpenAI发布了关于提示词注入攻击的指导,这是一种社会工程漏洞,恶意指令可以隐藏在网页内容或文档中,诱骗AI模型执行意外操作。该公司概述了其多层防御策略,包括指令层级研究、自动化安全测试和AI驱动的监控系统。

DeepSeek Harness

Hacker News Top

DeepSeek AI 开源了 DeepSeek Harness (dsh),一个基于 Cordis 的插件架构智能体框架,目前处于开发者预览阶段,预计会有破坏性更改。

间接提示注入的见解(12分钟阅读)

TLDR AI

Zico Kolter 和 Matt Fredrikson,Gray Swan 的领导者及 AI 安全专家,讨论了 AI 红队测试的现状以及间接提示注入——这是 AI 代理的关键漏洞。他们解释了为何 AI 安全需要不同的思维模式,自动化红队测试如何超越人类,并介绍了用于对抗性测试的工具 Shade。

DeepSeek Harness 出色至极

Reddit r/LocalLLaMA

DeepSeek Harness 是一款AI工具,因其简单设置、灵活的WebUI以及与SimpleX等服务的无缝集成而受到赞誉,支持E2EE和TOR消息传递,提供无偏见的设计,简化了无技术障碍的自定义。