PILOT 闭环:长期智能体的实时自我改进

Hugging Face Daily Papers 论文

摘要

PILOT 是一个用于长期智能体实时自我改进的监督-执行框架,支持实时重定向和经验提炼,以提升准确性和效率。

长期智能体运行生成经验,这些经验可以改进当前运行和未来工作。大多数自我改进方法仅在执行结束后处理这些经验,因此无法重定向活跃运行或立即应用和验证从中吸取的教训。我们认为自我改进应该是实时的,利用新出现的经验来重定向活跃运行并更新持久框架。现有代理架构未能完全支持这一目标。单代理自我校正将任务执行和轨迹评估结合在一个上下文中,而子代理委托分离执行但通常无法重定向活跃子代理。我们介绍 PILOT,一个用于实时自我改进的监督-执行框架,通过两个耦合机制:(1) 实时引导允许单独的监督者在执行期间重定向或中止活跃工人;(2) 实时自我进化将执行过程中揭示的程序和失败模式提炼成可重用技能和记忆。在两个冻结骨干和三个基准测试中,PILOT 在六种配置中的五种中排名第一。在 Terminal-Bench 2.0 上,PILOT 比同类框架高出最多 9.8 个百分点。在自我改进设置中,PILOT 使用 GLM-5.1 获得 14.6 分,使用 Kimi-K2.6 获得 12.4 分。平均输出令牌分别减少 42.9% 和 47.4%,而每百万输出令牌的成功评估分别增加 110.3% 和 134.0%。
查看原文
查看缓存全文

缓存时间: 2026/08/28 07:24

论文页面 - PILOT:长周期智能体的实时自进化

来源:https://huggingface.co/papers/2608.26530

摘要

PILOT 通过允许监督者引导活跃工作者并将执行经验提炼为可复用技能,实现了实时自进化,从而提升了准确性与效率。 长周期智能体运行过程中产生的经验既能改进当前运行,也能优化未来任务。现有的自进化方法大多仅在执行结束后处理这些经验,因此无法在运行过程中重定向当前任务,也无法立即应用和验证从经验中学到的教训。我们认为,自进化应具备实时性,既能利用生成中的经验来调整当前运行,也能更新持久化的任务框架。现有的智能体架构并未完全支持这一目标。单智能体自纠正(https://huggingface.co/papers?q=self-correction)将任务执行和轨迹评估结合在单一上下文中,而子智能体委派(https://huggingface.co/papers?q=subagent%20delegation)虽然将执行过程分离,但通常无法重定向正在运行的子智能体。我们提出了PILOT,一个用于实时自进化的监督者-工作者框架(https://huggingface.co/papers?q=supervisor-worker%20harness),其核心是两项耦合机制:(1) 实时引导(https://huggingface.co/papers?q=live%20steering)允许独立的监督者在工作者执行期间对其进行重定向或中止;(2) 实时自进化(https://huggingface.co/papers?q=live%20self-evolution)将执行过程中暴露的流程与失败模式提炼为可复用技能(https://huggingface.co/papers?q=reusable%20skills)和记忆(https://huggingface.co/papers?q=memory)。在跨两个冻结骨干模型和三个基准测试的评估中,PILOT在六项配置中有五项排名第一。在Terminal-Bench 2.0上,PILOT相比同类框架最高领先达9.8个百分点。在自进化设置下,PILOT结合GLM-5.1提升了14.6分,结合Kimi-K2.6提升了12.4分。平均输出token数分别下降42.9%和47.4%,而每百万输出token的成功评估次数则分别提升110.3%和134.0%。

查看arXiv页面 (https://arxiv.org/abs/2608.26530) 查看PDF (https://arxiv.org/pdf/2608.26530) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.26530)

在您的智能体中获取本文:

hf papers read 2608\.26530

尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型

0 无模型关联本文

在模型README.md中引用 arxiv.org/abs/2608.26530 以从本页建立链接。

引用本文的数据集

0 无数据集关联本文

在数据集README.md中引用 arxiv.org/abs/2608.26530 以从本页建立链接。

引用本文的Spaces

0 无Space关联本文

在Space README.md中引用 arxiv.org/abs/2608.26530 以从本页建立链接。

包含本文的收藏

0 无收藏包含本文

将本文添加至收藏 (https://huggingface.co/new-collection) 以从本页建立链接。

相似文章

QPILOTS: 面向流策略的高效测试时Q引导

arXiv cs.LG

QPILOTS是一种方法,通过使用从噪声中间状态投影的评论家梯度,在推理时引导流策略,在离线到在线强化学习基准上实现了最先进的性能,并在不修改基础策略的情况下改进了预训练的VLA模型。

PIRL:从开环探索到闭环强化学习 [R]

Reddit r/MachineLearning

介绍了 PIRL(策略改进强化学习)及其实际实现 PIPO,这是一种闭环框架,通过将策略更新后的性能与历史锚点进行比较来验证更新效果,从而能够纠正或强化之前的更新。实验表明,在 PPO 和 GRPO 等现有强化学习算法之上应用时,在数学推理、代码生成、工具使用和自我蒸馏方面均有一致的提升。

SkillOpt-Lite: 通过一行指令实现更好更快的智能体自我进化

Hugging Face Daily Papers

SkillOpt-Lite 提出了一种用于自主智能体技能优化的最小可行流水线,通过将所有组件视为可编辑代码并集成到生产编码智能体中,实现更好更快的自我进化。它通过零阶优化形式化技能优化,并在基准测试上优于先前方法。

SIMLIFE:长期人类-智能体合作中的模式理解

arXiv cs.AI

介绍了 SimLife,一个可扩展的平台,用于模拟长期家庭生活,以及 SimLife-BP,一个评估 AI 智能体从扩展观察中推断行为模式能力的基准,发现当前模型通常缺乏基于规则的深入理解。