adversarial-training

标签

Cards List
#adversarial-training

FragileFlow:通过频谱控制正确但脆弱的预测以增强基础模型的鲁棒性

arXiv cs.CL · 2026-05-12 缓存

本文介绍了 FragileFlow,这是一种插件式正则化器,通过频谱分析和 PAC-Bayes 界来控制“正确但脆弱”的预测,从而提高 LLM 和 VLM 的鲁棒性。

0 人收藏 0 人点赞
#adversarial-training

大型语言模型的信息论对抗训练

arXiv cs.LG · 2026-05-08 缓存

本文介绍了 WARDEN,一种用于大型语言模型的分布鲁棒对抗训练框架。该框架利用 f-散度动态调整对抗样本的权重,在显著降低攻击成功率的同时保持了计算效率。

0 人收藏 0 人点赞
#adversarial-training

持续强化ChatGPT Atlas抵御提示注入攻击

OpenAI Blog · 2025-12-22 缓存

OpenAI宣布通过对抗训练和强化防护措施,持续加固ChatGPT Atlas以抵御提示注入攻击,包括建立快速响应循环,在新型攻击策略出现于实际环境前即发现并缓解。

0 人收藏 0 人点赞
#adversarial-training

半监督文本分类的对抗训练方法

OpenAI Blog · 2016-05-25 缓存

本文提出了针对文本分类的对抗训练和虚拟对抗训练方法,通过在RNN中对词嵌入而非原始输入施加扰动来实现。该方法在半监督和监督文本分类基准上取得了最先进的结果,同时降低了过拟合。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈