本地LLM用户在将模型连接到工具之前是否测试提示注入?
摘要
关于本地LLM在连接工具时的安全实践讨论,质疑在赋予模型工具访问权限前,提示注入测试是否普遍。
我想知道当本地模型超越聊天时,这里的人们是如何处理安全问题的……在本地运行模型感觉更安全,因为数据不会离开你的机器或基础设施。这是一个真正的优势……但是一旦本地模型连接到工具、文件、RAG、shell命令、浏览器自动化、API或内部文档,风险就变了。到那时,提示注入不仅仅是“模型说了些奇怪的话”。它可能影响读取哪个文件、建议哪个命令、检索哪些数据、调用哪个工具,或代理下一步采取什么行动……我看到大多数本地设置非常关注模型质量、量化、上下文长度、VRAM、每秒令牌数和基准测试分数。这些都合理。但我看到在授予真实工具访问权限之前,对模型在恶意指令下的行为测试讨论较少……那些在代理化设置中运行本地模型的人:你们在测试提示注入或越狱行为吗?你们默认隔离工具访问吗?你们在信任之前让本地模型保持只读吗?你们记录工具调用和检索到的上下文吗?或者目前仍然主要是“本地意味着足够安全”?我不是从悲观的角度问的。我更感兴趣的是本地构建者实际上在使用哪些实际安全习惯。
相似文章
你是如何测试本地编码智能体的工作门以防止提示注入的?
关于测试本地编码智能体的工作门以防止间接提示注入的讨论,重点关注智能体工作流程中的证据信任和验证挑战。
对于使用工具的智能体,安全边界应划在哪里?
讨论AI智能体使用工具的安全风险,重点关注提示注入这一实际威胁——不受信任的文本可能改变智能体行为,以及在授予权限前需要进行可重复测试。
模型安全风险(提取、投毒)在生产中是否真的被测试?[R]
讨论关于 ML 团队是否真的在生产中测试模型安全风险(如提取和投毒),并指出模型的安全审查落后于常规软件。
提示注入即角色混淆
本文提出一种理论,认为对大型语言模型的提示注入攻击源于模型在角色感知上的根本缺陷——将角色视为语言的类型系统。该理论解释了现有攻击,预测了新型攻击,并提出了关于角色科学的研究议程。
理解提示词注入:AI安全的前沿挑战
OpenAI发布了关于提示词注入攻击的指导,这是一种社会工程漏洞,恶意指令可以隐藏在网页内容或文档中,诱骗AI模型执行意外操作。该公司概述了其多层防御策略,包括指令层级研究、自动化安全测试和AI驱动的监控系统。