EvoPolicyGym:在交互环境中评估自主策略进化
摘要
EvoPolicyGym 是一个基准测试,用于评估自主智能体如何通过交互环境中的反馈迭代改进策略,其中 GPT-5.5 取得了最佳性能。
查看缓存全文
缓存时间: 2026/07/03 07:53
论文页面 - EvoPolicyGym: 在交互环境中评估自主策略进化
来源:https://huggingface.co/papers/2607.02440
发布于7月2日
今日第3篇论文 (https://huggingface.co/papers/date/2026-07-03)
作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
自主代理通过在固定预算内进行迭代编辑来评估策略改进,揭示出成功的策略进化既需要任务特定的机制,也需要受反馈约束的优化。
自主代理 (https://huggingface.co/papers?q=Autonomous%20agents) 越来越多地被期望通过反馈来改进可执行策略 (https://huggingface.co/papers?q=executable%20policies),然而现有的评估往往将这一过程简化为一个最终分数,或将其与开放式软件工程进展混为一谈。我们引入了自主策略进化 (https://huggingface.co/papers?q=Policy%20Evolution),这是一个受控评估环境,在该环境中,一个构架模型代理在固定的交互预算下反复编辑一个可执行策略系统。我们将该环境实例化为 EvoPolicyGym,这是一个基于紧凑型交互式 RL 环境构建的基准,用于评估代理如何迭代改进探索到的策略。在 EvoPolicyGym 套件中,GPT-5.5 在所有 16 个环境中获得了最强的综合排名得分和前三的性能。除了排行榜结果之外,EvoPolicyGym 还提供了轨迹级诊断 (https://huggingface.co/papers?q=trajectory-level%20diagnostics),用于区分代理如何分配预算以及如何将反馈转化为参数调优 (https://huggingface.co/papers?q=parametric%20tuning)。这些分析表明,强大的自主策略进化 (https://huggingface.co/papers?q=policy%20evolution) 不仅依赖于孤立的任务胜利,还依赖于发现任务适配机制 (https://huggingface.co/papers?q=task-appropriate%20mechanisms) 并在有界反馈下优化策略。
查看 arXiv 页面 (https://arxiv.org/abs/2607.02440)
查看 PDF (https://arxiv.org/pdf/2607.02440)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.02440)
在你的代理中获取这篇论文:
hf papers read 2607.02440
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型
0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2607.02440 以从此页面链接。
引用此论文的数据集
0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.02440 以从此页面链接。
引用此论文的 Space
0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2607.02440 以从此页面链接。
包含此论文的收藏
0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
EvoTrainer:面向自主智能体强化学习的LLM策略与训练框架协同进化
EvoTrainer提出了一种自主训练框架,通过经验反馈协同进化LLM策略与训练框架,在数学推理、代码生成以及长期软件工程任务上超越了人工设计的强化学习基线。
进化策略梯度
OpenAI 推出进化策略梯度(EPG),这是一种元学习方法,通过进化而非直接学习策略来学习损失函数,使强化学习代理能够通过利用类似人类技能迁移的先验经验,更好地跨任务泛化。
EvoCUA-1.5:面向多轮计算机使用代理的在线强化学习
EvoCUA-1.5 引入了一种面向多轮计算机使用代理的在线强化学习框架,在 OSWorld-Verified 上实现了 63.2% 的成功率,并通过步骤级策略优化和动态课程学习,性能超越了参数高达 35B 的可比开放权重模型。
PACEvolve++:提升进化搜索代理的测试时学习能力
本文介绍了 PACEvolve++,这是一种强化学习框架,通过将假设生成与执行解耦,提高了进化搜索代理在测试时的策略适应能力。
OPD-Evolver:通过在线策略蒸馏培育整体智能体进化器
OPD-Evolver 提出了一种自我进化智能体框架,采用慢-快协同进化与在线策略自蒸馏,以增强记忆管理和策略学习,在多个领域基准测试中优于 ReasoningBank 和 Skill0 等现有方法。