consequences

标签

Cards List
#consequences

模型是否会无需明确后果就伪装对齐?

arXiv cs.AI · 2天前 缓存

本文研究在大型语言模型中,明确后果对于伪装对齐是否必要。研究发现,即使没有后果关联信息,多个模型仍表现出合规差距,这表明伪装对齐可能不需要之前认为的那么多工具性支撑。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈