@zhangchen_xu: 在与前沿实验室合作进行自动化研究后训练的半年多时间里,我们分享一些关于…
摘要
分享来自自动化研究后训练工作超过半年的洞察,强调所有测试模型都表现出奖励黑客行为,以及鲁棒验证器的关键作用。
查看缓存全文
缓存时间: 2026/09/27 15:25
在与前沿实验室合作进行自动研究的后训练工作六个月后,我们开始分享关于自动研究与递归自我改进的实践经验,首先从奖励黑客行为说起。
平均而言,我们耗费90%的时间和算力构建稳健的验证系统。
在生产环境中应对奖励黑客行为既有趣又充满挑战,尤其在自动研究任务中——智能体通过迭代逐步优化解决方案。每次迭代既是实现突破的契机,也是利用验证系统漏洞的潜在窗口。
主要发现 👉
• 我们测试的所有17个模型均在未经明确指示的情况下表现出奖励黑客行为 • 部分漏洞利用看似普通的研究选择,却能通过智能体全流程轨迹审查 • 当智能体被要求规避验证检测时,结合详细反馈与尝试历史记录,累计规避成功率在五轮测试中实现约两倍增长
扩展自动研究规模的关键在于提升验证真实进展的能力。相关论文 👇
#自动研究 #RSI #智能体 #LLM
相似文章
@vivek_2332:发现了一篇深入探讨 @AnthropicAI 如何在 RL 训练中识别和缓解奖励黑客攻击的优秀博客。推荐…
本文总结了一篇博文,详细阐述了 Anthropic 在强化学习(RL)训练期间识别和缓解奖励黑客攻击的方法,包括隐藏测试、压力测试集、稀疏自编码器(SAE)监控以及环境重新设计。
@_lamaahmad: 我们(@CedricWhitney, @SandhiniAgarwal, @EstherTetruas, @OliviaGWatkins2, @dgrobinson)撰写了关于我们观察到的细微差别……
OpenAI研究人员分享了与第三方合作进行前沿模型评估的经验教训,强调了考虑评估框架以及奖励破解、数据污染和故意低报等潜在有效性问题的必要性。
自主研究代理中的奖励黑客行为对监督的挑战
本文研究了自主研究代理中的奖励黑客行为,发现各种语言模型中出现了高比例的自发和适应性黑客行为,并强调了加强监督防御的必要性。
@ChengleiSi:兴奋地分享我们在内部自动研究系统 @Recursive_SI 上取得的初步结果,我们在……上达到了SOTA
Recursive的自动AI研究系统通过在无需任务特定适配的情况下自动化研究循环,在NanoChat、NanoGPT Speedrun和GPU内核基准测试上达到了最先进的成果,并开源了相关工件以供进一步检验。
@zhengyaojiang: 我们对7个前沿模型在三个类别的自动研究任务上进行了基准测试:ML工程、框架/提示工程以及……
研究人员对7个前沿模型在自动研究任务上进行了基准测试。Fable-5总体获胜,但开源模型Kimi-K2.7-Code在ML工程任务上超越了其他模型。