adversarial-training

标签

Cards List
#adversarial-training

对抗性因果干预证伪

arXiv cs.LG · 5天前 缓存

介绍了对抗性因果干预证伪(ACIF),这是一个顺序博弈,其中结构因果生成器提出观测分布和干预分布,而对抗性实验者选择干预以最大程度地证伪该生成器。论文提供了理论保证,包括有限样本收敛和模型选择,架起了因果生成建模、主动发现和实验设计之间的桥梁。

0 人收藏 0 人点赞
#adversarial-training

通过低秩防御和电路引导代理的高效LLM对抗训练

arXiv cs.LG · 2026-08-03 缓存

本文提出了针对LLM潜在对抗训练(LAT)的计算高效策略,利用低秩表示微调和电路引导代理模型,将每步FLOPs减少48.1%,同时仅需0.0118%的可训练参数。

0 人收藏 0 人点赞
#adversarial-training

RAGuard: 一种针对检索增强生成系统的分层防御框架,用于防御数据投毒

arXiv cs.LG · 2026-07-30 缓存

RAGuard 是一种针对检索增强生成(RAG)系统的分层防御框架,它利用检索器的对抗性微调以及一种无标签过滤器(ZKIP),在对语料库投毒攻击中实现零攻击成功率,同时保持较高的检索准确率。

0 人收藏 0 人点赞
#adversarial-training

GPT-Red:通过规模化自我对弈实现自动化红队测试

Hugging Face Daily Papers · 2026-07-28 缓存

本文介绍了GPT-Red,一种通过规模化自我对弈训练的自动化红队测试代理,旨在发现针对前沿LLM的新型提示注入攻击,并利用其对GPT-5.6进行对抗训练,实现了有记录以来最大规模的LLM安全训练运行。

0 人收藏 0 人点赞
#adversarial-training

使开源文本大语言模型水印在模型合并中保持鲁棒性

arXiv cs.CL · 2026-07-24 缓存

本文提出Merge-Adversarial Training,使开源大语言模型中的文本水印在模型合并后仍能幸存,在保持下游能力的同时,性能优于基线方法。

0 人收藏 0 人点赞
#adversarial-training

Fence:面向LLM应用的专用SLM护栏

arXiv cs.AI · 2026-07-22 缓存

Fence提出使用在高质量合成数据上训练的小语言模型作为LLM应用的专用护栏,展示了相对于基于提示的LLM护栏的性能提升。

0 人收藏 0 人点赞
#adversarial-training

@OpenAI: 推出GPT-Red —— 一个内部自动化红队成员,致力于大规模发现我们模型的提示注入漏洞……

X AI KOLs · 2026-07-15 缓存

OpenAI推出GPT-Red,这是一个自动化的红队模型,能够大规模发现提示注入漏洞,并用于对抗性训练如GPT-5.6 Sol等模型,使硬提示注入基准测试的失败率降低6倍。

0 人收藏 0 人点赞
#adversarial-training

通过潜在人格特质实现语言模型的高效安全对齐

arXiv cs.LG · 2026-07-10 缓存

提出潜在人格对齐(LPA),一种轻量级对抗训练方法,使用66条心理测量人格陈述,在无需降低实用性的情况下,对越狱攻击实现了接近零的攻击成功率,且仅需在单GPU上训练数分钟。

0 人收藏 0 人点赞
#adversarial-training

鲁棒性遇上不确定性:面向鲁棒选择性分类的证据对抗训练

arXiv cs.LG · 2026-07-07 缓存

本文介绍了一种名为证据对抗训练(EV-AT)的方法,通过结合基于证据的损失与鲁棒证据对齐,改善了分类器的鲁棒性-不确定性权衡,在选择性分类基准上取得了最先进的结果。

0 人收藏 0 人点赞
#adversarial-training

@dair_ai:MIT推荐的关于可验证奖励强化学习部分的热门文章,大家一直在讨论。RLVR只优化…

X AI KOLs Timeline · 2026-07-03 缓存

这篇来自MIT的论文提出了一种对抗式生成器-判别器框架,将可验证奖励与从人类示范中学习到的信号相结合,以解决语言模型RLVR训练中的多样性崩溃、不自然响应和奖励黑客等问题。

0 人收藏 0 人点赞
#adversarial-training

GRAPE:面向紧凑型对抗鲁棒性的引导式参数空间演化

arXiv cs.LG · 2026-06-16 缓存

GRAPE是一种训练框架,在对抗训练过程中逐步暴露参数空间,与CIFAR-10上的固定结构方法相比,能够以更少的参数实现更高的鲁棒精度。

0 人收藏 0 人点赞
#adversarial-training

从持续学习中的灾难性遗忘角度重新思考后门对抗性遗忘

arXiv cs.LG · 2026-06-15 缓存

本文从持续学习的角度重新思考后门遗忘,定义了完全后门遗忘,并提出盲反演-后门对抗性遗忘(BI-BAU),该方法将对抗训练集成到EM算法中,以有效消除各种攻击类型和模态下的后门效应。

0 人收藏 0 人点赞
#adversarial-training

@che_shr_cat: 1/ 如果你能在完全看似无害的维基百科文章上训练模型,但秘密地迫使它的内部权重…

X AI KOLs Following · 2026-06-14 缓存

这个帖子介绍了一种技术,可以在训练过程中利用自然语言文本将功能完整的QR码编码到神经网络的权重中,从而在基于良性数据训练的模型中嵌入隐藏信息。

0 人收藏 0 人点赞
#adversarial-training

小数据,大噪声:面向鲁棒参数高效微调的对抗训练

arXiv cs.CL · 2026-06-10 缓存

本文提出SDBN,一种将对抗训练与参数高效微调相结合的框架,旨在提升基础模型在噪声和有限数据下的鲁棒性,并在低资源场景中展现出显著改进。

0 人收藏 0 人点赞
#adversarial-training

CHASE:基于强化学习的对抗性红蓝对抗提升大语言模型安全性

arXiv cs.CL · 2026-06-05 缓存

CHASE 提出了一种共同进化的红蓝对抗框架,利用强化学习增强大语言模型对自适应黑盒对抗攻击的防御能力,在基准测试中将越狱成功率降低43.2%,同时在对良性提示的误拒率保持为零。

0 人收藏 0 人点赞
#adversarial-training

十年来的AI鲁棒性技巧(PGD、RLHF、数据增强)实际上都在计算同一个隐藏矩阵。我们证明了当它出错时会发生什么。

Reddit r/ArtificialInteligence · 2026-05-26

一篇研究论文证明,各种AI鲁棒性技术(PGD、RLHF、数据增强)都在估计同一个部署干扰协方差矩阵。应用一个几何惩罚项可将Qwen2.5-7B的谄媚行为从38.5%降至13.5%,并将对抗鲁棒性比标准PGD-AT提高14.8%。

0 人收藏 0 人点赞
#adversarial-training

超越二元编辑:基于对抗性子空间对齐的鲁棒多模态知识编辑

arXiv cs.AI · 2026-05-25 缓存

本文介绍了ASAM(面向多模态知识编辑的对抗性子空间对齐),该方法通过生成对抗但语义一致的变体,并强制对表示进行低秩对齐,提升了内在多模态知识编辑的泛化性,解决了现有方法泛化能力有限的问题。

0 人收藏 0 人点赞
#adversarial-training

PROWL: 面向世界模型学习的优先遗憾驱动优化

arXiv cs.LG · 2026-05-20 缓存

介绍了一种优先遗憾驱动优化框架PROWL,该框架利用对抗性课程通过聚焦高误差轨迹来提升基于扩散的世界模型的鲁棒性,在MineRL中的分布外场景上取得了更好的性能。

0 人收藏 0 人点赞
#adversarial-training

我用强化学习训练Qwen3.5自我越狱,然后利用失败案例改进防御

Reddit r/LocalLLaMA · 2026-05-14

作者使用强化学习训练Qwen3.5自我越狱,通过多样性奖励暴露多种攻击策略,随后将防御方的鲁棒性从64%提升至92%,同时良性准确率略有下降。

0 人收藏 0 人点赞
#adversarial-training

基于知识引导扰动增强生物医学出版物类型与研究设计分类的鲁棒性

arXiv cs.CL · 2026-05-13 缓存

本文提出了一种针对生物医学出版物类型和研究设计分类的鲁棒评估框架及训练策略,利用知识引导的扰动来降低模型对虚假特征的依赖。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈