PILOT 闭环:长期智能体的实时自我改进
摘要
PILOT 是一个用于长期智能体实时自我改进的监督-执行框架,支持实时重定向和经验提炼,以提升准确性和效率。
查看缓存全文
缓存时间: 2026/08/28 07:24
论文页面 - PILOT:长周期智能体的实时自进化
来源:https://huggingface.co/papers/2608.26530
摘要
PILOT 通过允许监督者引导活跃工作者并将执行经验提炼为可复用技能,实现了实时自进化,从而提升了准确性与效率。 长周期智能体运行过程中产生的经验既能改进当前运行,也能优化未来任务。现有的自进化方法大多仅在执行结束后处理这些经验,因此无法在运行过程中重定向当前任务,也无法立即应用和验证从经验中学到的教训。我们认为,自进化应具备实时性,既能利用生成中的经验来调整当前运行,也能更新持久化的任务框架。现有的智能体架构并未完全支持这一目标。单智能体自纠正(https://huggingface.co/papers?q=self-correction)将任务执行和轨迹评估结合在单一上下文中,而子智能体委派(https://huggingface.co/papers?q=subagent%20delegation)虽然将执行过程分离,但通常无法重定向正在运行的子智能体。我们提出了PILOT,一个用于实时自进化的监督者-工作者框架(https://huggingface.co/papers?q=supervisor-worker%20harness),其核心是两项耦合机制:(1) 实时引导(https://huggingface.co/papers?q=live%20steering)允许独立的监督者在工作者执行期间对其进行重定向或中止;(2) 实时自进化(https://huggingface.co/papers?q=live%20self-evolution)将执行过程中暴露的流程与失败模式提炼为可复用技能(https://huggingface.co/papers?q=reusable%20skills)和记忆(https://huggingface.co/papers?q=memory)。在跨两个冻结骨干模型和三个基准测试的评估中,PILOT在六项配置中有五项排名第一。在Terminal-Bench 2.0上,PILOT相比同类框架最高领先达9.8个百分点。在自进化设置下,PILOT结合GLM-5.1提升了14.6分,结合Kimi-K2.6提升了12.4分。平均输出token数分别下降42.9%和47.4%,而每百万输出token的成功评估次数则分别提升110.3%和134.0%。
查看arXiv页面 (https://arxiv.org/abs/2608.26530) 查看PDF (https://arxiv.org/pdf/2608.26530) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.26530)
在您的智能体中获取本文:
hf papers read 2608\.26530
尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型
0 无模型关联本文
在模型README.md中引用 arxiv.org/abs/2608.26530 以从本页建立链接。
引用本文的数据集
0 无数据集关联本文
在数据集README.md中引用 arxiv.org/abs/2608.26530 以从本页建立链接。
引用本文的Spaces
0 无Space关联本文
在Space README.md中引用 arxiv.org/abs/2608.26530 以从本页建立链接。
包含本文的收藏
0 无收藏包含本文
将本文添加至收藏 (https://huggingface.co/new-collection) 以从本页建立链接。
相似文章
交易前规划:面向RL交易代理的推理时优化
FPILOT是一个用于RL交易代理的插件式推理时优化框架,它利用价格预测而无需重新训练,在TradeMaster DJ30基准上实现了收益和风险调整指标的一致改进。
QPILOTS: 面向流策略的高效测试时Q引导
QPILOTS是一种方法,通过使用从噪声中间状态投影的评论家梯度,在推理时引导流策略,在离线到在线强化学习基准上实现了最先进的性能,并在不修改基础策略的情况下改进了预训练的VLA模型。
PIRL:从开环探索到闭环强化学习 [R]
介绍了 PIRL(策略改进强化学习)及其实际实现 PIPO,这是一种闭环框架,通过将策略更新后的性能与历史锚点进行比较来验证更新效果,从而能够纠正或强化之前的更新。实验表明,在 PPO 和 GRPO 等现有强化学习算法之上应用时,在数学推理、代码生成、工具使用和自我蒸馏方面均有一致的提升。
SkillOpt-Lite: 通过一行指令实现更好更快的智能体自我进化
SkillOpt-Lite 提出了一种用于自主智能体技能优化的最小可行流水线,通过将所有组件视为可编辑代码并集成到生产编码智能体中,实现更好更快的自我进化。它通过零阶优化形式化技能优化,并在基准测试上优于先前方法。
SIMLIFE:长期人类-智能体合作中的模式理解
介绍了 SimLife,一个可扩展的平台,用于模拟长期家庭生活,以及 SimLife-BP,一个评估 AI 智能体从扩展观察中推断行为模式能力的基准,发现当前模型通常缺乏基于规则的深入理解。