GDPevo:评估智能体在真实业务任务中的自我进化
摘要
GDPevo是一个在真实业务任务上评估智能体自我进化的基准,涵盖CRM、ERP、金融、医疗、法律以及以数据为中心的工作流。作者发布了自动化流水线,并发现自我进化能将留出集准确率提升最多16.44个百分点,但智能体仍远低于全知的oracle上限。
查看缓存全文
缓存时间: 2026/08/06 09:50
论文页面 - GDPevo:在真实业务任务上评估智能体自我进化
摘要
智能体自我进化会从先前经验中更新智能体的持久状态,并复用它来更有效地解决相关任务。评估自我进化是困难的:现有基准对具有经济价值的任务领域覆盖有限,并不总是设计训练和测试任务使得测试时的收益可归因于训练经验,并且仍然容易受到数据污染的影响。我们提出了GDPevo,一个以GDP相关企业工作流为基础的进化原生基准,以及生成该基准的全自动数据流水线。其核心机制——规则混合(rule hybridization)——将每个企业工作流分解为原子业务规则,将这些规则的子集分布到训练任务中,并在留出的测试任务中重新组合它们,从而使测试时的收益可归因。GDPevo涵盖CRM、ERP、金融、医疗、法律和以数据为中心的工作流。其V1版本包含12个组中的120个任务,每组有五个训练任务和五个留出测试任务。全自动化使该流水线能够在两天内将套件扩展到24个组中的240个任务(V2),为污染问题提供了实用的应对方案。使用GDPevo,我们在四种监督类型下评估了四个智能体,每个智能体由一个harness和一个模型组成。自我进化始终如一地将留出准确率提升了最高16.44个百分点。但最佳进化后的智能体仍远低于完全信息oracle上限的91.6%,表明当前智能体的自我进化能力远未完全实现。我们公开发布了流水线、基准和完整评估结果:https://github.com/Prism-Shadow/GDPevo。
查看arXiv页面 (https://arxiv.org/abs/2608.03764) 查看PDF (https://arxiv.org/pdf/2608.03764) 项目页面 (https://prism-shadow.github.io/GDPevo/) GitHub44 (https://github.com/Prism-Shadow/GDPevo) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.03764)
在您的智能体中获取此论文:
hf papers read 2608\.03764
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型引用此论文
在模型README.md中引用arxiv.org/abs/2608.03764,即可从本页链接到该模型。
引用此论文的数据集0
没有数据集引用此论文
在数据集README.md中引用arxiv.org/abs/2608.03764,即可从本页链接到该数据集。
引用此论文的Space0
没有Space引用此论文
在Space README.md中引用arxiv.org/abs/2608.03764,即可从本页链接到该Space。
包含此论文的收藏0
没有包含此论文的收藏
将此论文添加到收藏(collection)(https://huggingface.co/new-collection) 即可从本页链接到该收藏。
相似文章
EvoMap/evolver
Evolver 是一个由 GEP 驱动的 AI 代理自演化引擎,可自动化提示词优化并创建可审计、可复用的演化资产。该项目正从完全开源过渡到源代码可用,同时保持与现有 MIT 和 GPL-3.0 版本的向后兼容性。
EvoDS:具备技能学习与上下文管理的自演化自主数据科学智能体
EvoDS 是一款自演化自主数据科学智能体,通过强化学习驱动的技能获取与自适应上下文压缩进行改进,在基准测试上超越开源智能体 28.9%。
EvoMaster:构建可进化大规模自主科学智能体的基础框架
# 论文页面 - EvoMaster:构建可进化大规模自主科学智能体的基础框架 来源:[https://huggingface.co/papers/2604.17406](https://huggingface.co/papers/2604.17406) 作者:,,,,,,,,,,,,,,,,,,,,, ## 摘要 EvoMaster 是一个可扩展、自我进化的智能体框架,专为大规模科学发现设计,支持在实验周期中迭代优化假设并持续积累知识。大语言模型与智能体的融合正在催生“智能体科学”新时代。
EvoPolicyGym:在交互环境中评估自主策略进化
EvoPolicyGym 是一个基准测试,用于评估自主智能体如何通过交互环境中的反馈迭代改进策略,其中 GPT-5.5 取得了最佳性能。
APEX: Adaptive Principle EXtraction — 面向生产级AI智能体的三层自进化框架
APEX 提出了一个面向生产级AI智能体的三层自进化框架,同时优化了控制层(harness)、行为原则和工作流拓扑。在生产级智能体上的实验显示,健康评分和工作流质量显著提升,且仅需极少的LLM调用。