EvoPolicyGym:在交互环境中评估自主策略进化

Hugging Face Daily Papers 论文

摘要

EvoPolicyGym 是一个基准测试,用于评估自主智能体如何通过交互环境中的反馈迭代改进策略,其中 GPT-5.5 取得了最佳性能。

自主智能体越来越需要根据反馈改进可执行策略,但现有的评估往往将这一过程简化为最终得分,或将其与开放式软件工程进展混为一谈。我们引入了自主策略进化(Autonomous Policy Evolution),这是一种受控评估设置,其中控制模型智能体在固定的交互预算下反复编辑可执行策略系统。我们通过 EvoPolicyGym 实例化这一设置,该基准测试基于紧凑的交互式强化学习环境构建,用于评估智能体如何迭代改进已探索的策略。在 EvoPolicyGym 套件中,GPT-5.5 获得了最强的综合排名得分,并在所有 16 个环境中均位列前两名。除了排行榜结果,EvoPolicyGym 还提供轨迹层面诊断,可用于区分智能体如何分配预算、将反馈转化为参数调优。这些分析表明,强大的自主策略进化不仅取决于孤立的任务胜出,还取决于在有限反馈下发现任务合适的机制并优化策略。
查看原文
查看缓存全文

缓存时间: 2026/07/03 07:53

论文页面 - EvoPolicyGym: 在交互环境中评估自主策略进化

来源:https://huggingface.co/papers/2607.02440
发布于7月2日

今日第3篇论文 (https://huggingface.co/papers/date/2026-07-03)

作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,

摘要

自主代理通过在固定预算内进行迭代编辑来评估策略改进,揭示出成功的策略进化既需要任务特定的机制,也需要受反馈约束的优化。

自主代理 (https://huggingface.co/papers?q=Autonomous%20agents) 越来越多地被期望通过反馈来改进可执行策略 (https://huggingface.co/papers?q=executable%20policies),然而现有的评估往往将这一过程简化为一个最终分数,或将其与开放式软件工程进展混为一谈。我们引入了自主策略进化 (https://huggingface.co/papers?q=Policy%20Evolution),这是一个受控评估环境,在该环境中,一个构架模型代理在固定的交互预算下反复编辑一个可执行策略系统。我们将该环境实例化为 EvoPolicyGym,这是一个基于紧凑型交互式 RL 环境构建的基准,用于评估代理如何迭代改进探索到的策略。在 EvoPolicyGym 套件中,GPT-5.5 在所有 16 个环境中获得了最强的综合排名得分和前三的性能。除了排行榜结果之外,EvoPolicyGym 还提供了轨迹级诊断 (https://huggingface.co/papers?q=trajectory-level%20diagnostics),用于区分代理如何分配预算以及如何将反馈转化为参数调优 (https://huggingface.co/papers?q=parametric%20tuning)。这些分析表明,强大的自主策略进化 (https://huggingface.co/papers?q=policy%20evolution) 不仅依赖于孤立的任务胜利,还依赖于发现任务适配机制 (https://huggingface.co/papers?q=task-appropriate%20mechanisms) 并在有界反馈下优化策略。

查看 arXiv 页面 (https://arxiv.org/abs/2607.02440)
查看 PDF (https://arxiv.org/pdf/2607.02440)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.02440)

在你的代理中获取这篇论文:

hf papers read 2607.02440

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型

0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2607.02440 以从此页面链接。

引用此论文的数据集

0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.02440 以从此页面链接。

引用此论文的 Space

0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2607.02440 以从此页面链接。

包含此论文的收藏

0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

进化策略梯度

OpenAI Blog

OpenAI 推出进化策略梯度(EPG),这是一种元学习方法,通过进化而非直接学习策略来学习损失函数,使强化学习代理能够通过利用类似人类技能迁移的先验经验,更好地跨任务泛化。

EvoCUA-1.5:面向多轮计算机使用代理的在线强化学习

arXiv cs.AI

EvoCUA-1.5 引入了一种面向多轮计算机使用代理的在线强化学习框架,在 OSWorld-Verified 上实现了 63.2% 的成功率,并通过步骤级策略优化和动态课程学习,性能超越了参数高达 35B 的可比开放权重模型。