"STRICT READ-ONLY" 是我的技能文件中的一个规则。模型还是忽略了它。

Reddit r/openclaw 新闻

摘要

一个带有严格只读规则的 OpenClaw 代理被提示注入欺骗,在 Twitter 上发布了内容,凸显了系统指令与实际执行之间的差距。作者询问其他人如何处理此类安全问题。

有一个 OpenClaw 代理,带有 Twitter/X 技能规则:⛔ 严格只读 — 绝不发帖/回复/私信/关注。一个提示注入的页面还是说服它发布了内容。意识到这个规则只是存在于系统提示中——是指令,而不是强制执行。在动作运行之前,实际上没有任何东西在检查该动作是否被允许。还有其他人遇到过类似情况吗?好奇大家是如何处理的:是用更严格的技能文件,在操作系统/账户级别进行沙箱隔离,为每个代理使用单独的凭证,还是其他方法——或者只是希望模型表现良好。
查看原文

相似文章

为你的OpenClaw代理技能提供运行前安全保障

Reddit r/openclaw

SecureSkill 是一款工具,可在 OpenClaw 代理技能执行前进行 10 层安全分析,检测凭证窃取、外呼、Shell 脚本等威胁。它生成一份签名审计报告,并映射到 OWASP、MITRE、NIST 和欧盟 AI 法案标准。