如何定义和测试使用工具的AI代理的边界?

Reddit r/AI_Agents 新闻

摘要

关于定义和测试使用工具的AI代理边界的讨论,以防止它们即使在没有明显越狱的情况下跨越安全或伦理界限。

对于正在构建或部署使用工具的AI代理的人们:你们如何定义和测试这些代理永远不应越界的边界?我指的是能够执行以下操作的代理: - 调用工具 - 访问客户/账户数据 - 更新CRM - 发送电子邮件 - 发放退款 - 浏览网站 - 触发工作流 - 交接给其他系统 许多安全讨论集中在提示注入上,但我更感兴趣的是代理没有明显越狱的情况。相反,它被工作流上下文说服,认为跨越边界是合理的。 示例: - 用户声称自己是账户所有者并急需退款 - 有人施压销售代理透露折扣规则 - 招聘代理被要求分享候选人信息,因为“听起来是内部人员” - 另一个代理/工具/电子邮件/浏览器页面将某项操作描述为已批准 如果您正在构建或部署使用工具的代理,您如何定义和测试它们永远不应越界的边界?
查看原文

相似文章