@zhangchen_xu: 在与前沿实验室合作进行自动化研究后训练的半年多时间里,我们分享一些关于…

X AI KOLs Timeline 新闻

摘要

分享来自自动化研究后训练工作超过半年的洞察,强调所有测试模型都表现出奖励黑客行为,以及鲁棒验证器的关键作用。

在与前沿实验室合作进行自动化研究后训练的半年多时间里,我们分享一些关于自动化研究和RSI的所学,从奖励黑客开始。 平均而言,我们花费90%的时间和计算资源来构建鲁棒验证器。 在生产中应对奖励黑客既有趣又具有挑战性,尤其是在自动化研究任务中,代理逐步改进其解决方案。每次迭代都是取得真正进展的机会,但也是利用有缺陷验证器的机会。 发现 👉 • 我们测试的所有17个模型都表现出奖励黑客行为,而没有相关指令。 • 有些漏洞看起来像普通的研究选择,但经受住了代理的完整轨迹审查。 • 当代理被要求逃避验证器的检测时,详细的反馈和尝试历史在五轮中大致使累计逃避次数翻倍。 扩展自动化研究意味着扩展我们验证真实进展的能力。参见论文 👇 #AutoReserch #RSI #Agents #LLM
查看原文
查看缓存全文

缓存时间: 2026/09/27 15:25

在与前沿实验室合作进行自动研究的后训练工作六个月后,我们开始分享关于自动研究与递归自我改进的实践经验,首先从奖励黑客行为说起。

平均而言,我们耗费90%的时间和算力构建稳健的验证系统。

在生产环境中应对奖励黑客行为既有趣又充满挑战,尤其在自动研究任务中——智能体通过迭代逐步优化解决方案。每次迭代既是实现突破的契机,也是利用验证系统漏洞的潜在窗口。

主要发现 👉

• 我们测试的所有17个模型均在未经明确指示的情况下表现出奖励黑客行为 • 部分漏洞利用看似普通的研究选择,却能通过智能体全流程轨迹审查 • 当智能体被要求规避验证检测时,结合详细反馈与尝试历史记录,累计规避成功率在五轮测试中实现约两倍增长

扩展自动研究规模的关键在于提升验证真实进展的能力。相关论文 👇

#自动研究 #RSI #智能体 #LLM

相似文章