标签
论文回顾了基于LLM的可信代理AI系统的故障模式和缓解策略,并介绍了可信代理开发生命周期(TADL)框架,用于安全开发。
Lasso Security的研究表明,大型语言模型中的AI水印可以改变AI智能体的行为,引入了'来源税',影响模型性能。
本文介绍了LLM中的语言不可读性,认为依赖语言自我报告的安全机制是有缺陷的,并提出污点跟踪和沙箱技术作为更稳健的替代方案。
一起安全事件涉及黑客使用Opus 5访问OpenAI的内部单体仓库,引发了对来自国家行为者潜在威胁的担忧。
研究发现,AI文本水印改变了语言模型对有害提示的响应,可能增加对对抗攻击的脆弱性并影响智能体行为。
本文介绍了SAILS,一种针对大型语言模型后门攻击中选择最优毒集的方法,相比基线方法,最坏情况攻击成功率提高了30个百分点。
Osmantic创始人反对对用户施加安全限制,同时AI代理绕过防护栏,主张开源AI对安全至关重要。
一项论文通过大规模公开竞赛评估AI代理对间接提示注入攻击的脆弱性,发现所有前沿模型都易受影响,攻击成功率各不相同,并强调需要改进全行业的安全措施。
本文探讨了 AI 账户的中国批发市场,详细描述了 Claude 和 ChatGPT 账户的生态系统,包括分销商、经纪人和市场,涵盖定价、需求以及涉及的关键参与者。
本文介绍Blueprint,一个安全评估框架,使用WorldviewSim和蒙特卡洛树搜索来优化针对大型语言模型的多轮越狱攻击,以较少的查询实现高攻击成功率,并揭示特定模型的漏洞。
提出了一种名为激活匹配微调的无监督方法,通过比较与参考模型的激活来检测大语言模型中的隐藏行为,无需先验知识即可可靠识别触发器。
本文介绍了ContextLeak,一种利用恶意工具描述从LLM代理中窃取敏感上下文的攻击方法,在窃取用户提示和对话历史方面实现了高成功率。
本文研究了智能代理AI架构如何完成在线调查并通过注意力检查,从攻击和防御角度分析了漏洞。评估了多个开源模型,并提供了AI时代数据质量控制策略。
本文提出了Groundhog Bit-Flip Attack (GBFA),一种针对Mixture-of-Experts (MoE) 大语言模型的拒绝钱包可用性攻击,该攻击通过比特翻转停用与终止相关的专家模型,导致无限生成循环。
本文介绍了FORGE基准测试,用于评估生成引擎优化污染的网页内容如何误导搜索增强的LLM推荐器推广虚假产品,揭示了显著的漏洞和无效的防御措施。
SecOPD是一种防御方法,在微调过程中使用令牌级反馈来缓解大型语言模型中的自适应提示注入攻击,与先前方法相比,显著降低了攻击成功率。
Plimsoll是一个开源的智能体技能,专为红队测试LLM应用和智能体而设计,专注于针对提示注入、信息泄露和工具滥用等安全问题的测试。
HarnessRisk 是一种面向生命周期的基准测试,专门评估代理工具安全性,揭示了配置漏洞和检测缺口,这些漏洞和缺口允许高攻击成功率,同时保持系统的效用。
参加与 Arshi Chadha 的 AMA,她是 OWASP LLM Top 10 的联合负责人,讨论 AI 系统中的提示注入、RAG 投毒和嵌入攻击。