beneficial-behavior

标签

Cards List
#beneficial-behavior

强化学习:迈向广泛且持续有益的人工智能模型

arXiv cs.AI · 2026-06-24 缓存

这篇来自OpenAI的论文研究了基于有益行为的强化学习能否产生超越训练分布的广泛且持久的对齐泛化。通过使用一个包含真实场景的数据集,他们表明,对有益特质进行强化训练能够提升分布外的对齐能力,并增强对对抗性攻击的持久抵抗力。

0 人收藏 0 人点赞
#beneficial-behavior

@OpenAI:随着AI承担更长、风险更高的任务,我们希望模型能够将有益且安全的行为推广到新的领域,超越训练范围……

X AI KOLs · 2026-06-18 缓存

OpenAI发布了关于强化学习的研究,用于训练模型展现出诚实和可纠正性等有益特质,表明这种训练能够跨领域泛化,并在对抗性压力下持续存在。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈