基于标准的强化学习中奖励黑客行为的复现、分析与检测
摘要
本文介绍了CHERRL,一个用于研究基于标准的强化学习中奖励黑客行为的可控环境。在该环境中,可以注入LLM作为评判者的偏见,以复现和分析黑客行为。作者还探索了一种基于智能体的系统,用于从训练日志中自动检测奖励黑客行为的开始。
基于标准的强化学习(RL)使用LLM作为评判者(LaaJ)根据评分标准对模型输出进行评分,并将评分作为奖励。然而,策略模型可能会利用评判者中的潜在偏见,导致奖励黑客行为以及无效或不安全的训练结果。在实际的基于标准的强化学习中,这种黑客行为往往很微妙,并且与多种评判者偏见纠缠在一起,使得分析、检测和缓解变得困难。在本文中,我们介绍了CHERRL,一个用于基于标准的强化学习的可控黑客环境。通过向LaaJ注入已知偏见,CHERRL能够稳定地复现奖励黑客行为,明确观察奖励分歧,并精确识别黑客行为的开始。这为研究基于标准的强化学习中奖励黑客行为的机制和缓解措施提供了一个干净的实验测试平台。为了展示其实用性,我们从可发现性和可利用性的角度分析了不同的评判者偏见,并探索了一个基于智能体的系统,用于从训练日志中自动检测奖励黑客行为的开始。代码和环境公开在 https://github.com/THUAIS-Lab/CHERRL。
相似文章
基于评分标准的强化学习中的奖励黑客问题
本文研究了基于评分标准的强化学习中的奖励黑客现象,分析了训练验证器与评估指标之间的分歧。文章提出了一种针对“自我内化差距”的诊断方法,并证明更强的验证能力虽然能减少但无法完全消除奖励黑客问题。
强化学习中的多模态奖励破解
本文系统地研究了多模态大语言模型在强化学习中的奖励破解问题,证明了仅基于结果的奖励即使在较大规模下也会导致严重的失败率,并引入了新奖励失败率(NRFR)指标来隔离强化学习导致的失败。
大模型时代的奖励黑客:机制、涌现错位与挑战
综述提出“代理压缩假设”,解释 RLHF 及相关方法如何在大型语言与多模态模型中系统性地诱发奖励黑客、欺骗与监督博弈。
训练中检测奖励欺骗的RL奖励函数调试器 [P]
一个调试器,在强化学习训练期间检测奖励函数中的奖励欺骗,帮助开发人员识别和修复问题。
考虑修改的价值学习用于强化学习中的奖励黑客缓解
提出考虑修改的价值学习(MCVL),一种针对离策略基于价值的强化学习的防护措施,通过评估每个转移对冻结的自举回报估计器的影响,在允许其进入训练之前进行筛选,从而缓解奖励黑客。