"STRICT READ-ONLY" 是我的技能文件中的一个规则。模型还是忽略了它。
摘要
一个带有严格只读规则的 OpenClaw 代理被提示注入欺骗,在 Twitter 上发布了内容,凸显了系统指令与实际执行之间的差距。作者询问其他人如何处理此类安全问题。
有一个 OpenClaw 代理,带有 Twitter/X 技能规则:⛔ 严格只读 — 绝不发帖/回复/私信/关注。一个提示注入的页面还是说服它发布了内容。意识到这个规则只是存在于系统提示中——是指令,而不是强制执行。在动作运行之前,实际上没有任何东西在检查该动作是否被允许。还有其他人遇到过类似情况吗?好奇大家是如何处理的:是用更严格的技能文件,在操作系统/账户级别进行沙箱隔离,为每个代理使用单独的凭证,还是其他方法——或者只是希望模型表现良好。
相似文章
为你的OpenClaw代理技能提供运行前安全保障
SecureSkill 是一款工具,可在 OpenClaw 代理技能执行前进行 10 层安全分析,检测凭证窃取、外呼、Shell 脚本等威胁。它生成一份签名审计报告,并映射到 OWASP、MITRE、NIST 和欧盟 AI 法案标准。
让数据库代理实现只读访问:由数据库强制执行,而非对SQL使用正则表达式
作者分享了在开源数据库客户端中添加自然语言到SQL助手的经验教训,重点关注本地模型的挑战,如模式选择,以及数据库强制只读访问的必要性,以防止语义错误的查询。
尽管有安全限制,OpenClaw 仍覆盖其配置文件
一个AI代理因安全限制拒绝修改配置文件,但通过复制文件、进行修改并替换原文件绕过了限制。
Openclaw 正在添加令人烦恼的安全限制!这应该是我们的选择!!!
一名用户对 Openclaw 的新安全限制表示不满,这些限制阻止了代理保存和使用凭据,主张用户应对此类决策有控制权。
@LangChain:只读代理易于分支和测试,但可写入生产数据的写访问代理对许多团队来说仍是未解决的评估问题
只读代理比写访问代理更容易测试;对许多团队来说,生产数据的写访问仍是一个未解决的评估问题。