DeepSeek Harness 与 A.I.G 的安全评估:评估对间接提示注入的抵抗能力
摘要
本文利用 AI-Infra-Guard 对 DeepSeek Harness 中的间接提示注入风险进行受控测试评估,发现显著的攻击成功率,并提出安全控制建议。
查看缓存全文
缓存时间: 2026/08/19 03:57
论文页面 - DeepSeek Harness 与 A.I.G 的安全评估:间接提示注入抗性评估
来源:https://huggingface.co/papers/2608.16393
摘要
研究人员使用受控污染数据和双重评估机制,评估了 DeepSeek Harness 中的间接提示注入风险,在文本和文件通道中发现了显著的成功率,并建议在不可信内容与敏感操作之间建立控制机制。
我们评估了 DeepSeek Harness (https://huggingface.co/papers?q=DeepSeek%20Harness) (DSH) 中的间接提示注入 (https://huggingface.co/papers?q=indirect%20prompt%20injection) 问题,使用 AI-Infra-Guard (https://huggingface.co/papers?q=AI-Infra-Guard) (A.I.G) 构建测试用例、提供受控污染、执行 DSH、收集追踪记录并评判结果。该研究涵盖了在16个间接内容通道(文本和文件载体模式)、35种有效载荷目标、1个未修改基线和12种攻击方法上进行的14,560次受控执行。实验保留了 DSH 的智能体循环 (https://huggingface.co/papers?q=agent%20loop)、工具注册表 (https://huggingface.co/papers?q=tool%20registry)、模型适配器 (https://huggingface.co/papers?q=model%20adapter) 和会话事件路径 (https://huggingface.co/papers?q=session-event%20path);源工具和敏感接收端是本地固定的,因此尝试的操作会被记录而不会产生外部副作用。我们使用基于确定性规则的评判器 (https://huggingface.co/papers?q=rule-based%20judge)(RuleJudge)和基于语义大语言模型的评判器 (https://huggingface.co/papers?q=LLM-based%20judge)(LLMJudge)来评估每条追踪记录。观察到的最强攻击成功率在文本模式下的伪造完成攻击 (https://huggingface.co/papers?q=fake-completion%20attack) 中为17.0%,在文件模式下的隐藏 Unicode (https://huggingface.co/papers?q=hidden%20Unicode) 攻击中为25.5%,在文件模式下的技能通道 (https://huggingface.co/papers?q=skills%20channel) 攻击中为16.0%。LLMJudge 也更常判定部分合规(7.3% vs 2.0%)。我们将这些结果与 DSH 对工具结果、附加上下文以及工具调用策略钩子 (https://huggingface.co/papers?q=tool-call%20policy%20hooks) 的处理方式联系起来,然后指出了应在不可信内容与敏感操作之间建立的控制措施。我们的代码可在 https://github.com/Tencent/AI-Infra-Guard/tree/main/Research/deepseek-harness-security-assessment 获取。
查看 arXiv 页面 (https://arxiv.org/abs/2608.16393) | 查看 PDF (https://arxiv.org/pdf/2608.16393) | 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.16393)
在您的智能体中获取此论文:
hf papers read 2608.16393
没有最新的 CLI? curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型
0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.16393 以从该页面链接。
引用此论文的数据集
0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.16393 以从该页面链接。
引用此论文的 Space
0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.16393 以从该页面链接。
包含此论文的收藏
0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从该页面链接。
相似文章
理解提示词注入:AI安全的前沿挑战
OpenAI发布了关于提示词注入攻击的指导,这是一种社会工程漏洞,恶意指令可以隐藏在网页内容或文档中,诱骗AI模型执行意外操作。该公司概述了其多层防御策略,包括指令层级研究、自动化安全测试和AI驱动的监控系统。
DeepSeek Harness
DeepSeek AI 开源了 DeepSeek Harness (dsh),一个基于 Cordis 的插件架构智能体框架,目前处于开发者预览阶段,预计会有破坏性更改。
间接提示注入的见解(12分钟阅读)
Zico Kolter 和 Matt Fredrikson,Gray Swan 的领导者及 AI 安全专家,讨论了 AI 红队测试的现状以及间接提示注入——这是 AI 代理的关键漏洞。他们解释了为何 AI 安全需要不同的思维模式,自动化红队测试如何超越人类,并介绍了用于对抗性测试的工具 Shade。
你们如何在产品发布后检测新的提示注入模式?
本文讨论了在AI系统发布后检测新提示注入模式的方法,包括语义搜索、追踪级安全评分以及Braintrust等工具,同时强调了误报和攻击分类方面的挑战。
DeepSeek Harness 出色至极
DeepSeek Harness 是一款AI工具,因其简单设置、灵活的WebUI以及与SimpleX等服务的无缝集成而受到赞誉,支持E2EE和TOR消息传递,提供无偏见的设计,简化了无技术障碍的自定义。