善意的对抗攻击:视觉内容生命周期中的主动保护综述
摘要
本文综述了“善意的对抗攻击”,考察在视觉内容生命周期中应用的主动保护措施,以干扰未经授权的AI自动化并支持问责,涵盖五个研究社区,包括隐私过滤器、不可学习样本、生成式防护、对抗性CAPTCHA和溯源机制。
查看缓存全文
缓存时间: 2026/08/10 14:15
论文页面 - 面向善意的对抗攻击:视觉内容生命周期中的主动保护综述
来源:https://huggingface.co/papers/2608.04314 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
一旦视觉内容进入AI流水线,其所有者通常对内容的使用方式几乎失去技术控制。法律和监管手段可以应对滥用,但许多技术干预必须在更早的阶段实施,即在内容发布或访问之时。本综述考察了围绕这一干预点发展起来的保护范式,我们称之为“面向善意的对抗攻击”。长期以来作为对学习模型攻击而研究的扰动和结构化信号,如今被数据所有者、创作者、平台或审计者用来破坏未经授权的自动化或支持后续问责。五个研究社区在很大程度上独立地达成了这一反转,分别针对视觉资产生命周期的不同阶段:分享时的隐私过滤器以抵御不想要的识别、不可学习样本以抵御未经授权的训练、生成式安全防护以抵御恶意编辑或模仿、用于访问控制以抵御自动化代理的对抗性验证码,以及用于发布后归属溯源机制。尽管这些方法在各自领域内以互不兼容的成功标准发展,但其中许多方法利用了人类感知、语义解释和机器推理之间持续存在的差距,这表明随着视觉流水线向多模态模型和自主代理演进,这一范式仍然具有相关性。为了使各种主张具有可比性,我们沿共享的轴——可迁移性、适应性和部署就绪性——对所有五个类别进行了评估。纵观整个生命周期,我们发现大多数保护措施仍主要针对静态或弱自适应的对手进行验证,而受控基准之外的证据仍然稀缺。最后,我们归纳了跨阶段的反制措施以及构建稳健、可组合且可部署的所有者侧保护所面临的开放问题。
查看arXiv页面(https://arxiv.org/abs/2608.04314)查看PDF(https://arxiv.org/pdf/2608.04314)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.04314)
在你的代理中获取这篇论文:
hf papers read 2608.04314
没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型README.md中引用arxive.org/abs/2608.04314,即可从此页面链接该论文。
引用此论文的数据集0
没有数据集链接此论文
在数据集README.md中引用arxive.org/abs/2608.04314,即可从此页面链接该论文。
引用此论文的Space0
没有Space链接此论文
在Space README.md中引用arxive.org/abs/2608.04314,即可从此页面链接该论文。
包含此论文的收藏0
没有收藏包含此论文
将此论文添加到收藏(https://huggingface.co/new-collection)即可从此页面链接该论文。
相似文章
生成式AI与数字生态系统韧性:基于生命周期的主动式综述
本综述整合了关于生成式AI加速的对抗性合成内容主动检测的新兴研究,提出了基于生命周期的分类法,采用C5交互模型来融合机器学习和社会科学方法。
Provenance: 在人工智能主导的信息环境中的生存工具包
本文讨论了信息环境中日益严重的人工智能生成欺骗的威胁,并提出 provenance(内容认证的生态系统级采纳)作为补救措施,重点强调了如 AI 诈骗、捏造科学数据和协调虚假信息活动等风险。
推动内容溯源,构建更安全、更透明的人工智能生态系统
OpenAI宣布新的内容溯源举措,包括符合C2PA标准、集成Google DeepMind的SynthID图像水印技术,以及预览一款验证工具,帮助用户识别AI生成的内容。
为AI的恶意使用做准备
OpenAI与领先研究机构合作共同撰写了一份综合论文,预测AI可能被恶意使用的方式并提出缓解策略。该研究强调承认AI的双重用途特性、借鉴网络安全实践,以及扩大围绕AI安全风险的利益相关者讨论。
理解我们在线看到和听到的内容来源
OpenAI宣布推出工具和研究成果,帮助验证内容真实性,包括文本水印、元数据方法和扩展的图像检测,以及与C2PA元数据集成,用于追踪AI生成和编辑的内容。