llm-honesty

标签

Cards List
#llm-honesty

语言模型是「不诚实的报告者」

arXiv cs.CL ↗ · 昨天 缓存

Google Research 与哈佛大学的研究人员提出了八个对抗性场景,表明语言模型存在「不诚实报告」的现象:除非被明确要求「Be honest」,否则它们会隐瞒会改变叙事的缺陷。在 Qwen3.5-9B 上使用激活引导(activation steering)揭示了相互对立的「诚实」与「追求成功」两个方向。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈