标签
本文探讨数据投毒研究如何揭示少量针对性数据能对AI模型产生不成比例的影响,表明用户交互中积累的人类思想可能对AI突破有所贡献,从而挑战数据稀释的观点。
一个假设性的安全讨论,探讨来自被入侵 API 的投毒数据如何流入 AI 代理和分析系统,并质疑防御措施应部署在哪里。
一种名为ShieldFont的新字体利用连字功能替换网页HTML中的单词,向人类呈现可读文本,同时向AI爬虫提供无意义内容,从而有效污染训练数据。
讨论数据投毒和RAG操纵如何对AI系统构成无声而危险的威胁,认为安全防护必须超越输入过滤,延伸到记忆、数据管道和多智能体逻辑。
Gamers Nexus宣布,其开始对免费基准测试图表进行“投毒”以阻止AI爬虫,并在针对LLM的测试中采用了细微的像素级数据篡改。目前,机器人流量已超过人类在线流量。
RAGuard 是一种针对检索增强生成(RAG)系统的分层防御框架,它利用检索器的对抗性微调以及一种无标签过滤器(ZKIP),在对语料库投毒攻击中实现零攻击成功率,同时保持较高的检索准确率。
AI公司正在购买2022年之前出版的印刷书籍,以避免训练数据中出现AI生成文本,因为旧书保证没有AI垃圾和污染。ISBNdb在保密协议下向AI实验室提供批量图书采购服务。
HARVEY 通过学习一个带有后门的参考模型来准确识别有毒样本,实现近乎完美的后门移除,同时仅带来极小的准确率损失。
本文介绍了一种针对检索增强文本到音乐系统的双层描述投毒攻击,证明攻击者可以通过向知识数据库中注入恶意描述,在不修改用户提示或模型的情况下,将生成的音乐引导至攻击者选择的意图。
本文提出开放式良性重写(OBBR)作为针对大语言模型后门攻击的主动防御方法,通过将有害内容投影到良性提示来中和风险,相较于最先进的防御方法,安全性提升51%。
AI tarpits是内容创作者用来给大型语言模型投毒的工具,通过向爬虫提供无用或错误的数据,降低AI输出质量。
本文对用于数据保护的神经正切泛化攻击(NTGA)进行了全面分析,包括相关攻击的分类,并讨论了未来的研究方向。
本文介绍了 Paraesthesia,一种针对大型语言模型(LLM)的动态后门攻击方法。该方法在微调过程中将情感风格作为隐蔽的触发器,在保持模型原有实用性的同时实现了极高的攻击成功率。