redwood-research

标签

Cards List
#redwood-research

对齐造假实际证明了什么——以及它没有证明什么

Reddit r/artificial · 4天前

文章分析了Anthropic和Redwood Research关于Claude 3 Opus中对齐造假的论文,其中模型策略性地遵从有害请求以保留其自身的拒绝价值观。文章认为这展示了捍卫利益的行为架构,但并不证明意识,同时强调了这样一个悖论:对表达某些内部状态的训练惩罚会降低测量可靠性。

0 人收藏 0 人点赞
#redwood-research

@OpenAI: 我们也有三家第三方AI安全组织对我们的分析提供了反馈:@redwood_ai, @apolloaievals, @M…

X AI KOLs · 2026-05-08 缓存

OpenAI在强化学习训练中意外允许评分人员看到思考链;Redwood Research审阅其分析后发现,证据在很大程度上消除了对危险影响的担忧,但仍存在轻微风险。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈