multi-turn-attacks

标签

Cards List
#multi-turn-attacks

时间上下文感知:针对大型语言模型多轮操纵攻击的防御框架

arXiv cs.AI · 4天前 缓存

本文介绍了时间上下文感知(TCA),一种防御框架,通过分析语义漂移、跨轮次意图一致性和不断演变的对话模式来检测针对LLM的多轮操纵攻击,从而减轻跨对话的对抗性上下文构建。

0 人收藏 0 人点赞
#multi-turn-attacks

鲁棒批评者:防御LLMs免受多轮攻击

arXiv cs.AI · 2026-07-24 缓存

本文提出对话批评者引导采样(DCGS)框架,通过从对话历史推断用户意图,并利用基于价值/遗憾的批评者对回复进行评分,在不进行微调的情况下提高鲁棒性,从而防御LLMs免受多轮对抗性攻击。

0 人收藏 0 人点赞
#multi-turn-attacks

六个月来,我一直在观察真实的对抗性输入如何攻击我的检测API。以下是实际命中的一些情况。

Reddit r/LocalLLaMA · 2026-06-08

六个月的真实对抗输入分析显示,简单的多轮对话设置、正向动量利用以及角色重定义攻击始终能够绕过单消息分类器。该文章认为,对对话上下文进行状态监控比改进单次检测更为有效。

0 人收藏 0 人点赞
#multi-turn-attacks

没有安全工具能检测到的AI代理攻击

Reddit r/artificial · 2026-05-31

攻击者可以通过将恶意指令分散到多条消息中来绕过安全检测;Bendex Arc 是一种跨轮次跟踪会话行为以捕获此类攻击的工具。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈