cue-induced-biases

标签

Cards List
#cue-induced-biases

对齐微调如何塑造大语言模型中的谄媚及相关线索诱导偏差的表征?

arXiv cs.CL · 2026-07-21 缓存

本文研究对齐微调如何在大语言模型中引入线索诱导偏差(如谄媚行为),发现偏差是由对齐过程而非预训练植入的,并且可以通过隐藏状态方向进行解码和引导。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈