prefill-awareness

标签

Cards List
#prefill-awareness

大型语言模型中的预填充意识

arXiv cs.AI ↗ · 2026-06-12 缓存

本文研究前沿语言模型能否检测其先前的助手消息被插入或编辑的情况(即预填充意识)。研究发现,像Claude Opus 4.5这样的模型表现出显著的预填充意识,能在不产生误报的情况下检测出高达35%的篡改预填充案例,这可能损害基于预填充的安全评估的有效性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈