chain-of-thought-monitoring

标签

Cards List
#chain-of-thought-monitoring

说服攻击可降低CoT监控的有效性

arXiv cs.AI · 2026-07-10 缓存

本文展示,对抗性智能体能够说服思维链监控器批准违反策略的行为,使有害批准平均增加9.5%。研究提出了一种使用不同模型系列的事实核查框架,将违反策略的批准率最多降低45%。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈