标签
This paper from Carnegie Mellon researchers shows that giving an LLM judge more compute doesn't fix oversight failures when it must check many requirements in one call. It proposes sharding—dividing requirements into smaller groups handled by separate calls—which improves accuracy, resists presentation-based adversarial attacks, and can make a weaker sharded judge match a more capable holistic judge.
本文实证研究了剪枝、对抗训练和硬件引起的权重故障如何共同影响卷积神经网络的可靠性,发现对抗训练会增加对固定为零故障的敏感性,而剪枝对故障敏感性几乎没有影响。
本文提出了一种无需领域知识的元认知层,用于融合多个基于预训练ViT的感知模型,利用标签向量池和基于一致性的溯因。在干净数据上,它可与多数投票基线持平,并且对协同标签翻转攻击尤其鲁棒。
一项系统的跨架构实证研究,衡量小语言模型领域适配的可信度成本,发现安全保持的微调策略并不能可靠地迁移对齐性。
This paper proposes efficient search methods to locate verdict boundaries in Branch and Bound (BaB) neural network verification, leveraging path monotonicity to skip irrelevant subproblems and improve verification efficiency.
本文评估了五种阿拉伯语言模型在字符级、单词级和句子级攻击下的对抗鲁棒性,结果表明插入变音符号可使准确率降低92%,对抗训练能提升鲁棒性但存在局限性。
本文介绍了一种面向RAG的源感知重排序方法,该方法引入了基于领域信息的源可靠性先验,在一个由120份文档组成的健康领域语料库上将Precision@5从0.48提升至0.72,并减少了对抗性文档的检索。
本文提出HarmAlign方法,该方法沿估计的对比激活子空间应用函数保持的谱变形,在保留良性适应性的同时阻止开放权重模型的有害微调,并提供了有限样本保证和实证验证。
本文提出了一种新颖的训练准则,旨在减少自动英语口语能力评估系统对捷径的依赖,防止考生在没有真正进步的情况下通过利用捷径提高分数。在基于音频和文本的系统的实验表明,该方法降低了与可被利用特征的相关性,使自动评分更接近人工评判。
本文挑战了普遍认为的死记硬背导致训练数据在重构攻击中暴露的观点,指出真正的原因是对抗性非鲁棒特征。作者引入了AntiAdversarial Training (AT-AT),该训练方法有意学习非鲁棒特征,以实现卓越的重构防御和更高的准确性。
本文提出了一个严格的理论框架,用于多层感知机的对抗鲁棒性,通过将问题简化为格遍历,引入了具有形式化保证的可靠且完备的区间认证。
本文研究了诸如调解等正式机制,以在模拟市场中维持自利的大型语言模型代理(DeepSeek-V3)之间的市场稳定性,发现即使在持续对抗攻击下,调解也能使市场恢复。
介绍LipSSD,一种Lipschitz约束的Single Shot MultiBox Detector(SSD)变体,能够在不依赖特定攻击且与对抗训练互补的情况下提升目标检测的对抗鲁棒性。在Pascal VOC、LARD和KITTI数据集上进行了评估。
本文研究了编程示例系统中的对抗鲁棒性,其中攻击者通过破坏输入输出示例来误导合成器。它引入了版本空间分区聚合(VPA)作为防御方法,并在多个基准上进行了评估,发现低间隔任务容易受到攻击,且仅当分区投票间隔得以保留时VPA才有帮助。
本文研究了用于工业物联网入侵检测的轻量级机器学习模型的跨域泛化失败,发现它们依赖于粗糙的端口特征,并且对抗鲁棒性与跨网络性能无关。
本文介绍了一个面向任意时有效认证鲁棒性的元学习框架,该框架使用序列E过程自适应分配计算资源,与传统的随机平滑方法相比,样本复杂度降低了20倍,同时保持了严格的统计保证。
Yuvion LLM 是一种专为对抗鲁棒性和内容安全而设计的大型语言模型,在安全基准测试中达到了最先进的性能,并超越了 GPT-5.4 和 Qwen3-MAX 等更大的模型。
本文评估了用于测量大语言模型(LLM)越狱研究中攻击成功率(ASR)的自动化评判器的可靠性,发现安全分类器和LLM作为评判器都存在严重的校准和对抗鲁棒性问题,从而削弱了所报告的ASR数值的可信度。
本文提出了一个面向对抗鲁棒网络入侵检测的随机量子神经网络(SQNN)严格 N 量子比特理论,证明了退相干收缩定理,并展示了退极化噪声能提供对抗攻击的鲁棒性,同时在 NSL-KDD 数据集上进行了实验。
MorphStrata提出了一种层特定随机噪声注入策略,用于在移动目标防御框架中生成多样化的学生模型,以增强时间序列预测的对抗鲁棒性,在BIM攻击下实现了高达97.97%的RMSE改进,且训练开销极低。