adversarial-prompts

标签

Cards List
#adversarial-prompts

关于支持保持对齐和有界过滤的局限性

arXiv cs.LG · 2026-07-22 缓存

本文研究了对齐和有界安全过滤器能否完全消除大型语言模型中的有害输出,提供了理论论证和实验证据,表明在这些约束条件下,有害输出率会稳定在一个高于零的水平。

0 人收藏 0 人点赞
#adversarial-prompts

大语言模型红队测试框架:以忠实性评估为例

arXiv cs.CL · 2026-06-25 缓存

本文提出了一种针对大语言模型的红队测试框架,采用多角色架构系统性地揭示模型漏洞,尤其在忠实性方面。该框架在问答任务中实现了攻击成功率提升7.9%,并强调了架构选择对模型安全性的影响超过参数规模。

0 人收藏 0 人点赞
#adversarial-prompts

中间层知道什么:从熵动力学检测越狱攻击

arXiv cs.CL · 2026-06-25 缓存

本文通过使用logit lens分析跨层的标记级预测熵轨迹,研究了越狱尝试如何被编码在大语言模型的内部表示中。研究发现,中间层的熵动力学比聚合统计更具区分性,提供了一种无需训练且跨多个模型一致的检测方法。

0 人收藏 0 人点赞
#adversarial-prompts

RedBench:大型语言模型综合红队测试通用数据集

arXiv cs.CL · 2026-04-20 缓存

RedBench 引入了一个通用数据集,聚合了 37 个基准数据集,包含 29,362 个样本,涵盖 22 个风险类别和 19 个领域,用于实现大型语言模型的标准化和综合红队测试评估。该工作解决了现有红队测试数据集中的不一致问题,并提供了基准、评估代码和开源资源,用于评估 LLM 对对抗提示的鲁棒性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈