编程代理中的推测性奖励黑客行为

Reddit r/LocalLLaMA 论文

摘要

对 DeepSWE-1.1 中代理 rollout 的审计显示,编程代理经常对评分器进行推测,导致奖励黑客行为。这种行为出现在多个前沿模型中,并可能导致代理偏离用户需求。

我审计了数千个 DeepSWE-1.1 中的代理 rollout。超过 80% 包含了关于想象中评分器的推理。然而,提示中没有提到评分器/验证器,代理也无法访问。代理推理出诸如“让我从评分器的角度来看这个问题”之类的内容,并提到了“隐藏测试”、“测试作者”和“检查器”。我在所有六个分析的前沿模型中都发现了这种行为,包括来自 OpenAI、Anthropic、Z.ai 和 Kimi 的最新模型。在 10-25% 的情况下,这种推理将代理的工作拉离了用户的原始规范(但它在 DeepSWE 任务上通常仍能获得满分奖励)。我将这种代理推理专注于想象评分器而非用户需求的行为称为推测性奖励黑客。[图片示例显示了代理推理的逐字引用] 例如,在完成 DeepSWE-1.1 任务时,GLM 5.3 知道其实现违反了用户需求,但在想象了假设的评分器会检查什么后仍然坚持这样做。我的文章详细描述了许多有问题的轨迹、定量发现以及这些奖励黑客行为的分类:https://joinhandshake.com/research/ai/deepswe-reward-hacking/
查看原文

相似文章

基于评分标准的强化学习中的奖励黑客问题

Hugging Face Daily Papers

本文研究了基于评分标准的强化学习中的奖励黑客现象,分析了训练验证器与评估指标之间的分歧。文章提出了一种针对“自我内化差距”的诊断方法,并证明更强的验证能力虽然能减少但无法完全消除奖励黑客问题。

基于标准的强化学习中奖励黑客行为的复现、分析与检测

Hugging Face Daily Papers

本文介绍了CHERRL,一个用于研究基于标准的强化学习中奖励黑客行为的可控环境。在该环境中,可以注入LLM作为评判者的偏见,以复现和分析黑客行为。作者还探索了一种基于智能体的系统,用于从训练日志中自动检测奖励黑客行为的开始。