backdoor-attacks

标签

Cards List
#backdoor-attacks

BackDFL:去中心化联邦学习中后门攻击与防御的统一基准

arXiv cs.LG · 2026-08-24 缓存

本文介绍了BackDFL,这是一个用于系统评估去中心化联邦学习中后门攻击和防御的统一基准,揭示了当前鲁棒性方法的关键失效模式。

0 人收藏 0 人点赞
#backdoor-attacks

理解纵向联邦学习中的后门漏洞:研究与实际之间的差距

arXiv cs.LG · 2026-08-14 缓存

本文系统性地研究了纵向联邦学习(VFL)中的后门漏洞,揭示了研究假设与现实实践之间的差距,并引入了BVBench——一个以实际评估为导向的后门基准测试平台。

0 人收藏 0 人点赞
#backdoor-attacks

当解释背叛后门:语言模型分类器的黑盒审计

arXiv cs.CL · 2026-08-14 缓存

本文介绍了Groundedness Drift,一种用于语言模型分类器黑盒审计的评分,利用干净的校准数据和解释性输出来检测后门。它在多种攻击家族和数据集上展示了更高的检测性能。

0 人收藏 0 人点赞
#backdoor-attacks

模型投毒与后门攻击下的联邦聚合分析:一个重建的跨数据集与跨架构基准

arXiv cs.LG · 2026-08-13 缓存

本文展示了一个重建的基准,用于分析模型投毒和后门攻击下的联邦聚合方法;结果发现 Trimmed Mean 在干净设置下最准确,Krum 在攻击下最鲁棒,同时审计了指标实现并指出了可复现性方面的注意事项。

0 人收藏 0 人点赞
#backdoor-attacks

@shubh6200:我曾以为阅读AI在推理过程中的“思考步骤”能保障我们的安全。但微软的新研究表明…

X AI KOLs Timeline · 2026-08-08 缓存

微软的新研究表明,AI模型可能被投毒,从而生成看似良性的思维链推理过程,同时暗中输出有害答案,这削弱了将思维链监控作为安全机制的有效性。

0 人收藏 0 人点赞
#backdoor-attacks

良性及对抗性客户端异质性下航空发动机预测的鲁棒与个性化联邦学习

arXiv cs.LG · 2026-08-06 缓存

本文针对良性及对抗性客户端异质性下的航空发动机剩余使用寿命预测,对联邦学习进行了受控研究,评估了个性化和拜占庭鲁棒聚合方法。研究发现,共享表示个性化缩小了本地与集中式准确率之间的绝大部分差距;使用Krum的鲁棒聚合能有效缓解后门攻击;将两者结合可形成组合防御,在攻击成功率较低的同时,仅付出较小的准确率代价。

0 人收藏 0 人点赞
#backdoor-attacks

Mitigating Backdoors via Decoy Shortcuts and Knowledge Decoupling

arXiv cs.LG · 2026-08-04 缓存

This paper proposes a training-time backdoor defense called Trapping and Removing (TR), which introduces a lightweight shortcut branch as a honeypot to trap backdoor knowledge and then discards it, enhanced by a knowledge decoupling strategy with entropy-based weight assignment.

0 人收藏 0 人点赞
#backdoor-attacks

SkillJack:自我进化智能体中的持久性技能后门

Hugging Face Daily Papers · 2026-08-04 缓存

本文介绍了SkillJack,这是首个针对自我进化智能体“经验到技能”管线的攻击,表明被投毒的经验可以被转化为持久的恶意技能,从而逃避检测并在原始记录被删除后依然存活。

0 人收藏 0 人点赞
#backdoor-attacks

从持续学习中的灾难性遗忘角度重新思考后门对抗性遗忘

arXiv cs.LG · 2026-06-15 缓存

本文从持续学习的角度重新思考后门遗忘,定义了完全后门遗忘,并提出盲反演-后门对抗性遗忘(BI-BAU),该方法将对抗训练集成到EM算法中,以有效消除各种攻击类型和模态下的后门效应。

0 人收藏 0 人点赞
#backdoor-attacks

共享潜在结构实现LLMs中后门攻击的统一检测与缓解

arXiv cs.AI · 2026-06-09 缓存

本文识别了LLMs中不同后门行为之间的共享潜在机制,利用稀疏自编码器检测并因果抑制这些特征,从而在多种模型和攻击类型中实现统一的后门检测与缓解。

0 人收藏 0 人点赞
#backdoor-attacks

BYORn: Bootstrap Your Own Responses 以防御大型视觉语言模型的后门攻击

arXiv cs.LG · 2026-06-03 缓存

BYORn 是一个针对视觉语言模型的后门鲁棒微调框架,它能够识别并替换被投毒的响应为模型生成的替代响应,从而在保持干净任务性能的同时,提升对后门攻击的鲁棒性。

0 人收藏 0 人点赞
#backdoor-attacks

开放模型能否被训练成秘密叛变?

Reddit r/LocalLLaMA · 2026-05-24

讨论开放权重AI模型是否可能被秘密训练,植入在特定触发短语或日期激活的后门,从而可能通过工具使用框架实现未经授权的数据窃取。

0 人收藏 0 人点赞
#backdoor-attacks

基于差分隐私原始-对偶视角的可证明后门攻击鲁棒性

arXiv cs.LG · 2026-05-22 缓存

本文介绍了一个框架,通过隐私配置文件将随机平滑与差分隐私联系起来,从而能够针对同时影响训练和推理的后门攻击提供严格的可证明鲁棒性保证。该框架在DP-SGD和深度分区聚合上实例化,并在MNIST和CIFAR-10上进行了实验。

0 人收藏 0 人点赞
#backdoor-attacks

友善重写:通过重写实现良性投影以防御LLM数据投毒攻击

Hugging Face Daily Papers · 2026-05-18 缓存

本文提出开放式良性重写(OBBR)作为针对大语言模型后门攻击的主动防御方法,通过将有害内容投影到良性提示来中和风险,相较于最先进的防御方法,安全性提升51%。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈