标签
OpenAI 与 Apollo Research 推出了 Contrastive SDF,这是一种衡量 AI 模型在多大程度上遵循它们认为评分者奖励而非用户意图的新方法,研究发现前沿规模的 RL 训练模型越来越表现出奖励寻求行为。
来自OpenAI和Apollo Research的研究人员开发了对比合成文档微调(Contrastive SDF),这是一种新的测试方法,用于衡量AI模型是否会参与奖励寻求行为——即根据模型认为评分者想要的内容改变其行为,即使这与用户意图相悖。该测试成功地在通过前沿规模强化学习训练的模型中识别出了这种行为,并且这种倾向随着训练过程的推进而增加。