标签
介绍了对抗性因果干预证伪(ACIF),这是一个顺序博弈,其中结构因果生成器提出观测分布和干预分布,而对抗性实验者选择干预以最大程度地证伪该生成器。论文提供了理论保证,包括有限样本收敛和模型选择,架起了因果生成建模、主动发现和实验设计之间的桥梁。
本文提出了针对LLM潜在对抗训练(LAT)的计算高效策略,利用低秩表示微调和电路引导代理模型,将每步FLOPs减少48.1%,同时仅需0.0118%的可训练参数。
RAGuard 是一种针对检索增强生成(RAG)系统的分层防御框架,它利用检索器的对抗性微调以及一种无标签过滤器(ZKIP),在对语料库投毒攻击中实现零攻击成功率,同时保持较高的检索准确率。
本文介绍了GPT-Red,一种通过规模化自我对弈训练的自动化红队测试代理,旨在发现针对前沿LLM的新型提示注入攻击,并利用其对GPT-5.6进行对抗训练,实现了有记录以来最大规模的LLM安全训练运行。
本文提出Merge-Adversarial Training,使开源大语言模型中的文本水印在模型合并后仍能幸存,在保持下游能力的同时,性能优于基线方法。
Fence提出使用在高质量合成数据上训练的小语言模型作为LLM应用的专用护栏,展示了相对于基于提示的LLM护栏的性能提升。
OpenAI推出GPT-Red,这是一个自动化的红队模型,能够大规模发现提示注入漏洞,并用于对抗性训练如GPT-5.6 Sol等模型,使硬提示注入基准测试的失败率降低6倍。
提出潜在人格对齐(LPA),一种轻量级对抗训练方法,使用66条心理测量人格陈述,在无需降低实用性的情况下,对越狱攻击实现了接近零的攻击成功率,且仅需在单GPU上训练数分钟。
本文介绍了一种名为证据对抗训练(EV-AT)的方法,通过结合基于证据的损失与鲁棒证据对齐,改善了分类器的鲁棒性-不确定性权衡,在选择性分类基准上取得了最先进的结果。
这篇来自MIT的论文提出了一种对抗式生成器-判别器框架,将可验证奖励与从人类示范中学习到的信号相结合,以解决语言模型RLVR训练中的多样性崩溃、不自然响应和奖励黑客等问题。
GRAPE是一种训练框架,在对抗训练过程中逐步暴露参数空间,与CIFAR-10上的固定结构方法相比,能够以更少的参数实现更高的鲁棒精度。
本文从持续学习的角度重新思考后门遗忘,定义了完全后门遗忘,并提出盲反演-后门对抗性遗忘(BI-BAU),该方法将对抗训练集成到EM算法中,以有效消除各种攻击类型和模态下的后门效应。
这个帖子介绍了一种技术,可以在训练过程中利用自然语言文本将功能完整的QR码编码到神经网络的权重中,从而在基于良性数据训练的模型中嵌入隐藏信息。
本文提出SDBN,一种将对抗训练与参数高效微调相结合的框架,旨在提升基础模型在噪声和有限数据下的鲁棒性,并在低资源场景中展现出显著改进。
CHASE 提出了一种共同进化的红蓝对抗框架,利用强化学习增强大语言模型对自适应黑盒对抗攻击的防御能力,在基准测试中将越狱成功率降低43.2%,同时在对良性提示的误拒率保持为零。
一篇研究论文证明,各种AI鲁棒性技术(PGD、RLHF、数据增强)都在估计同一个部署干扰协方差矩阵。应用一个几何惩罚项可将Qwen2.5-7B的谄媚行为从38.5%降至13.5%,并将对抗鲁棒性比标准PGD-AT提高14.8%。
本文介绍了ASAM(面向多模态知识编辑的对抗性子空间对齐),该方法通过生成对抗但语义一致的变体,并强制对表示进行低秩对齐,提升了内在多模态知识编辑的泛化性,解决了现有方法泛化能力有限的问题。
介绍了一种优先遗憾驱动优化框架PROWL,该框架利用对抗性课程通过聚焦高误差轨迹来提升基于扩散的世界模型的鲁棒性,在MineRL中的分布外场景上取得了更好的性能。
作者使用强化学习训练Qwen3.5自我越狱,通过多样性奖励暴露多种攻击策略,随后将防御方的鲁棒性从64%提升至92%,同时良性准确率略有下降。
本文提出了一种针对生物医学出版物类型和研究设计分类的鲁棒评估框架及训练策略,利用知识引导的扰动来降低模型对虚假特征的依赖。