data-poisoning

标签

Cards List
#data-poisoning

论人类思想的价值:数据投毒研究如何揭示“自主”AI突破

Reddit r/LocalLLaMA · 2026-09-08

本文探讨数据投毒研究如何揭示少量针对性数据能对AI模型产生不成比例的影响,表明用户交互中积累的人类思想可能对AI突破有所贡献,从而挑战数据稀释的观点。

0 人收藏 0 人点赞
#data-poisoning

你们在哪里停止投毒——在代理、边界,还是?

Reddit r/AI_Agents · 2026-08-13

一个假设性的安全讨论,探讨来自被入侵 API 的投毒数据如何流入 AI 代理和分析系统,并质疑防御措施应部署在哪里。

0 人收藏 0 人点赞
#data-poisoning

网络对抗AI爬虫的最新武器是字体

Ars Technica · 2026-08-12 缓存

一种名为ShieldFont的新字体利用连字功能替换网页HTML中的单词,向人类呈现可读文本,同时向AI爬虫提供无意义内容,从而有效污染训练数据。

0 人收藏 0 人点赞
#data-poisoning

数据投毒与RAG操纵

Reddit r/ArtificialInteligence · 2026-08-09

讨论数据投毒和RAG操纵如何对AI系统构成无声而危险的威胁,认为安全防护必须超越输入过滤,延伸到记忆、数据管道和多智能体逻辑。

0 人收藏 0 人点赞
#data-poisoning

是时候给AI投毒了 | GN Mega Charts更新与LLM反制措施

Reddit r/ArtificialInteligence · 2026-08-05 缓存

Gamers Nexus宣布,其开始对免费基准测试图表进行“投毒”以阻止AI爬虫,并在针对LLM的测试中采用了细微的像素级数据篡改。目前,机器人流量已超过人类在线流量。

0 人收藏 0 人点赞
#data-poisoning

RAGuard: 一种针对检索增强生成系统的分层防御框架,用于防御数据投毒

arXiv cs.LG · 2026-07-30 缓存

RAGuard 是一种针对检索增强生成(RAG)系统的分层防御框架,它利用检索器的对抗性微调以及一种无标签过滤器(ZKIP),在对语料库投毒攻击中实现零攻击成功率,同时保持较高的检索准确率。

0 人收藏 0 人点赞
#data-poisoning

AI公司大量购入旧书,因其不含AI垃圾

Reddit r/ArtificialInteligence · 2026-07-21 缓存

AI公司正在购买2022年之前出版的印刷书籍,以避免训练数据中出现AI生成文本,因为旧书保证没有AI垃圾和污染。ISBNdb在保密协议下向AI实验室提供批量图书采购服务。

0 人收藏 0 人点赞
#data-poisoning

同一枚硬币的两面:学习后门以消除后门

arXiv cs.LG · 2026-07-08 缓存

HARVEY 通过学习一个带有后门的参考模型来准确识别有毒样本,实现近乎完美的后门移除,同时仅带来极小的准确率损失。

0 人收藏 0 人点赞
#data-poisoning

Mental Damage:针对检索增强文本到音乐生成的描述投毒攻击

arXiv cs.AI · 2026-06-01 缓存

本文介绍了一种针对检索增强文本到音乐系统的双层描述投毒攻击,证明攻击者可以通过向知识数据库中注入恶意描述,在不修改用户提示或模型的情况下,将生成的音乐引导至攻击者选择的意图。

0 人收藏 0 人点赞
#data-poisoning

友善重写:通过重写实现良性投影以防御LLM数据投毒攻击

Hugging Face Daily Papers · 2026-05-18 缓存

本文提出开放式良性重写(OBBR)作为针对大语言模型后门攻击的主动防御方法,通过将有害内容投影到良性提示来中和风险,相较于最先进的防御方法,安全性提升51%。

0 人收藏 0 人点赞
#data-poisoning

什么是AI tarpits?了解人们用来给LLMs投毒的工具

Reddit r/ArtificialInteligence · 2026-05-17 缓存

AI tarpits是内容创作者用来给大型语言模型投毒的工具,通过向爬虫提供无用或错误的数据,降低AI输出质量。

0 人收藏 0 人点赞
#data-poisoning

SoK:神经正切泛化攻击现状的全面分析与研究方向

arXiv cs.LG · 2026-05-14 缓存

本文对用于数据保护的神经正切泛化攻击(NTGA)进行了全面分析,包括相关攻击的分类,并讨论了未来的研究方向。

0 人收藏 0 人点赞
#data-poisoning

当情绪成为触发器:寄生于大型语言模型的情感风格动态后门攻击

arXiv cs.CL · 2026-05-13 缓存

本文介绍了 Paraesthesia,一种针对大型语言模型(LLM)的动态后门攻击方法。该方法在微调过程中将情感风格作为隐蔽的触发器,在保持模型原有实用性的同时实现了极高的攻击成功率。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈