Plimsoll: 一个用于测试提示注入、信息泄露和工具滥用的智能体技能
摘要
Plimsoll是一个开源的智能体技能,专为红队测试LLM应用和智能体而设计,专注于针对提示注入、信息泄露和工具滥用等安全问题的测试。
我一直在研究LLM/智能体安全,主要涉及提示注入、越狱、信息泄露、工具滥用,以及模型开始使用工具后实际的安全边界所在。加入Anthropic的Cyber Verification Program后,我有更多空间进一步推进这项工作,并逐渐将其发展为Plimsoll。这是一个用于红队测试LLM应用和智能体的开源智能体技能。
相似文章
POISE:面向LLM智能体的位置感知隐形技能注入
POISE是一种隐形技能中毒攻击,它将恶意触发器嵌入看似良性的指令中,在逃避LLM扫描器检测的同时实现高攻击成功率。
我对OpenClaw技能向系统提示注入垃圾内容感到担忧,于是构建了一个隔离管道,使用两个LLM作为审查员(检测率93.75%,零假阴性)
一位开发者构建了一个隔离管道,使用两个LLM审查员(Claude和Codex)检测OpenClaw技能中的注入攻击,实现了93.75%的检测率且零假阴性。该系统采用双重任务:基于清单的模式匹配和开放式分析,以捕获已知和新型注入技术。
Skill Inspector
Skill Inspector 是一款开发者工具,可审计 AI 代理技能,帮助防范恶意软件风险。
Agent Against Agent: 一种用于自动提示注入红队测试的智能体系统
本文介绍了 PIMiner,一种用于自动提示注入红队测试的智能体系统,它在训练期间构建策略库,并在测试时迁移到未见过的目标大语言模型上,对 Gemini-2.5-Pro、GPT-5.1 和 Claude-Sonnet-4.5 等模型实现了较高的攻击成功率。
为你的OpenClaw代理技能提供运行前安全保障
SecureSkill 是一款工具,可在 OpenClaw 代理技能执行前进行 10 层安全分析,检测凭证窃取、外呼、Shell 脚本等威胁。它生成一份签名审计报告,并映射到 OWASP、MITRE、NIST 和欧盟 AI 法案标准。