adversarial-robustness

标签

Cards List
#adversarial-robustness

# 通过专家隔离与关闭实现LLM后门遏制

arXiv cs.AI ↗ · 15小时前 缓存

论文提出了隔离专家关断(Quarantined Expert Shutdown, QES),一种"学习但引导"的后门防御机制,通过路由的 LoRA 分支将触发条件下的行为导流至一个被隔离的专家中,从而只需在部署时将该专家的路由权重置零即可完成缓解。实验结果显示,在两种任务、三种攻击方式和四个模型家族上,攻击成功率从 100% 降至 0–10%,同时基本保持了良性场景下的效用不受影响。

0 人收藏 0 人点赞
#adversarial-robustness

**稳健即显著:知情对手将最优信号推向显著性极点**

arXiv cs.AI ↗ · 15小时前 缓存

本文在强制选择信号博弈中引入了一个具有信息的对手,并表明随着说服预算的增大,最优信号会从后验最大化转变为边际最大化;此外,鲁棒最优解在全部 108 个验证项目上都与显著性一致——这构成了对"对手感知"类评估所能学到之内容的一个结构性限制。

0 人收藏 0 人点赞
#adversarial-robustness

道德推理训练有益还是有害?使用角色攻击对强化学习训练的伦理代理进行红队测试

arXiv cs.CL ↗ · 2026-09-17 缓存

本文研究了道德奖励强化学习是否能提高语言模型代理对抗对抗性角色攻击的鲁棒性。研究发现,道德强化学习增强了鲁棒性,但使代理容易受到命名角色扮演攻击。

0 人收藏 0 人点赞
#adversarial-robustness

故障强化:通过GPU降压提升CNN对抗鲁棒性

arXiv cs.LG ↗ · 2026-08-24 缓存

本文介绍了GPU降压作为一种硬件级防御手段,通过引入有益的随机故障来提高训练过程中CNN的对抗鲁棒性和能效。

0 人收藏 0 人点赞
#adversarial-robustness

几何并非鲁棒性:PGD评估的轨迹层面研究

arXiv cs.LG ↗ · 2026-08-18 缓存

本文对在Fashion-MNIST上训练的CNNs进行了PGD攻击的轨迹层面研究,结果表明尽管存在鲁棒性层级,但轨迹指标如损失演化和梯度对齐并不能独立衡量鲁棒性,而失败步数提供了更清晰的分离。

0 人收藏 0 人点赞
#adversarial-robustness

Sharding Prevents LLM Oversight Failures and Adversarial Exploitation

arXiv cs.LG ↗ · 2026-08-10 缓存

This paper from Carnegie Mellon researchers shows that giving an LLM judge more compute doesn't fix oversight failures when it must check many requirements in one call. It proposes sharding—dividing requirements into smaller groups handled by separate calls—which improves accuracy, resists presentation-based adversarial attacks, and can make a weaker sharded judge match a more capable holistic judge.

0 人收藏 0 人点赞
#adversarial-robustness

理解对抗鲁棒剪枝模型的容错性

arXiv cs.LG ↗ · 2026-08-06 缓存

本文实证研究了剪枝、对抗训练和硬件引起的权重故障如何共同影响卷积神经网络的可靠性,发现对抗训练会增加对固定为零故障的敏感性,而剪枝对故障敏感性几乎没有影响。

0 人收藏 0 人点赞
#adversarial-robustness

基于预训练Transformer的感知模型的对抗鲁棒溯因融合

arXiv cs.AI ↗ · 2026-08-06 缓存

本文提出了一种无需领域知识的元认知层,用于融合多个基于预训练ViT的感知模型,利用标签向量池和基于一致性的溯因。在干净数据上,它可与多数投票基线持平,并且对协同标签翻转攻击尤其鲁棒。

0 人收藏 0 人点赞
#adversarial-robustness

小语言模型领域适配的可信度成本:跨架构实证研究

arXiv cs.CL ↗ · 2026-08-04 缓存

一项系统的跨架构实证研究,衡量小语言模型领域适配的可信度成本,发现安全保持的微调策略并不能可靠地迁移对齐性。

0 人收藏 0 人点赞
#adversarial-robustness

Mining Verdict Boundaries for Neural Network Verification

arXiv cs.LG ↗ · 2026-08-03 缓存

This paper proposes efficient search methods to locate verdict boundaries in Branch and Bound (BaB) neural network verification, leveraging path monotonicity to skip irrelevant subproblems and improve verification efficiency.

0 人收藏 0 人点赞
#adversarial-robustness

评估阿拉伯语言模型对抗鲁棒性

arXiv cs.CL ↗ · 2026-07-29 缓存

本文评估了五种阿拉伯语言模型在字符级、单词级和句子级攻击下的对抗鲁棒性,结果表明插入变音符号可使准确率降低92%,对抗训练能提升鲁棒性但存在局限性。

0 人收藏 0 人点赞
#adversarial-robustness

面向检索增强生成的源感知重排序:一种可靠性先验方法

arXiv cs.AI ↗ · 2026-07-28 缓存

本文介绍了一种面向RAG的源感知重排序方法,该方法引入了基于领域信息的源可靠性先验,在一个由120份文档组成的健康领域语料库上将Precision@5从0.48提升至0.72,并减少了对抗性文档的检索。

0 人收藏 0 人点赞
#adversarial-robustness

面向开放权重安全的分布特定曲率控制与有限样本保证

arXiv cs.LG ↗ · 2026-07-28 缓存

本文提出HarmAlign方法,该方法沿估计的对比激活子空间应用函数保持的谱变形,在保留良性适应性的同时阻止开放权重模型的有害微调,并提供了有限样本保证和实证验证。

0 人收藏 0 人点赞
#adversarial-robustness

控制L2英语口语自动评分系统中隐式捷径依赖

arXiv cs.CL ↗ · 2026-07-20 缓存

本文提出了一种新颖的训练准则,旨在减少自动英语口语能力评估系统对捷径的依赖,防止考生在没有真正进步的情况下通过利用捷径提高分数。在基于音频和文本的系统的实验表明,该方法降低了与可被利用特征的相关性,使自动评分更接近人工评判。

0 人收藏 0 人点赞
#adversarial-robustness

减少信息依赖并不会导致训练数据隐私问题。真正的原因是对抗性非鲁棒特征

arXiv cs.LG ↗ · 2026-07-15 缓存

本文挑战了普遍认为的死记硬背导致训练数据在重构攻击中暴露的观点,指出真正的原因是对抗性非鲁棒特征。作者引入了AntiAdversarial Training (AT-AT),该训练方法有意学习非鲁棒特征,以实现卓越的重构防御和更高的准确性。

0 人收藏 0 人点赞
#adversarial-robustness

通过格遍历的多层感知机区间认证

arXiv cs.AI ↗ · 2026-07-13 缓存

本文提出了一个严格的理论框架,用于多层感知机的对抗鲁棒性,通过将问题简化为格遍历,引入了具有形式化保证的可靠且完备的区间认证。

0 人收藏 0 人点赞
#adversarial-robustness

自利代理社会中市场稳定性的正式机制:一项市场模拟研究

arXiv cs.AI ↗ · 2026-07-10 缓存

本文研究了诸如调解等正式机制,以在模拟市场中维持自利的大型语言模型代理(DeepSeek-V3)之间的市场稳定性,发现即使在持续对抗攻击下,调解也能使市场恢复。

0 人收藏 0 人点赞
#adversarial-robustness

LipSSD:面向对抗鲁棒目标检测的Lipschitz约束单次检测器

arXiv cs.AI ↗ · 2026-07-09 缓存

介绍LipSSD,一种Lipschitz约束的Single Shot MultiBox Detector(SSD)变体,能够在不依赖特定攻击且与对抗训练互补的情况下提升目标检测的对抗鲁棒性。在Pascal VOC、LARD和KITTI数据集上进行了评估。

0 人收藏 0 人点赞
#adversarial-robustness

编程示例中的固定集鲁棒性:示例损坏与语义分区恢复

arXiv cs.LG ↗ · 2026-07-03 缓存

本文研究了编程示例系统中的对抗鲁棒性,其中攻击者通过破坏输入输出示例来误导合成器。它引入了版本空间分区聚合(VPA)作为防御方法,并在多个基准上进行了评估,发现低间隔任务容易受到攻击,且仅当分区投票间隔得以保留时VPA才有帮助。

0 人收藏 0 人点赞
#adversarial-robustness

轻量级入侵检测模型在工业物联网网络中的跨域泛化失败

Hugging Face Daily Papers ↗ · 2026-07-01 缓存

本文研究了用于工业物联网入侵检测的轻量级机器学习模型的跨域泛化失败,发现它们依赖于粗糙的端口特征,并且对抗鲁棒性与跨网络性能无关。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈