dialogue-critic

标签

Cards List
#dialogue-critic

鲁棒批评者:防御LLMs免受多轮攻击

arXiv cs.AI · 2026-07-24 缓存

本文提出对话批评者引导采样(DCGS)框架,通过从对话历史推断用户意图,并利用基于价值/遗憾的批评者对回复进行评分,在不进行微调的情况下提高鲁棒性,从而防御LLMs免受多轮对抗性攻击。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈