Shepherd:通过形式化执行轨迹赋能元智能体的运行时底层架构
摘要
本文介绍了 Shepherd,这是一种面向元智能体的函数式编程模型和运行时底层架构,它使用 Lean 对操作进行形式化,并以类似 Git 的执行轨迹记录交互。该系统通过支持智能体状态的高效分叉与重放,在运行时干预、反事实优化和强化学习训练方面展示了显著的性能提升。
查看缓存全文
缓存时间: 2026/05/12 07:30
论文页面 - Shepherd:赋予元智能体形式化执行轨迹的运行时基础
来源:https://huggingface.co/papers/2605.10913
摘要
我们提出了 Shepherd,一种函数式编程模型,它将针对目标智能体的元智能体操作形式化为函数,其核心操作在 Lean 中进行机械化验证。Shepherd 将每次智能体与环境的交互记录为类似 Git 执行轨迹中的类型化事件,允许任何过去的状态进行分支和重放。该系统对智能体进程及其文件系统的分支速度比 Docker 快 5 倍,并在重放时实现超过 95% 的提示缓存复用。我们通过三个应用场景展示了该模型的有效性。首先,在运行时干预方面,一个实时监督器在 CooperBench 上将结对编程的通过率从 28.8% 提升至 54.7%。其次,在反事实元优化方面,分支探索在四个基准测试中均优于基线方法,最高提升达 11 个百分点,同时将实际耗时最多减少 58%。第三,在 Tree-RL 训练中,在选定的回合进行分支 rollout 使 TerminalBench-2 的性能从 34.2% 提升至 39.4%。这些结果确立了 Shepherd 作为编程元智能体的高效基础设施。我们开源该系统以支持未来的研究。
查看 arXiv 页面 (https://arxiv.org/abs/2605.10913) 查看 PDF (https://arxiv.org/pdf/2605.10913) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.10913)
在您的智能体中获取这篇论文:
hf papers read 2605\.10913
没有最新版的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
暂无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2605.10913 即可从本页面建立链接。
引用此论文的数据集 0
暂无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.10913 即可从本页面建立链接。
引用此论文的空间(Spaces) 0
暂无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2605.10913 即可从本页面建立链接。
包含此论文的合集 0
暂无合集包含此论文
添加此论文到合集 (https://huggingface.co/new-collection) 即可从本页面建立链接。
相似文章
@akshay_pachaar:斯坦福大学的研究人员又做到了。他们刚刚构建了智能体原生的 Git 版本。当智能体在较长的任务上工作…
斯坦福大学的研究人员发布了 Shepherd——一个运行时层,对 AI 智能体的运行而言就像 Git 一样:它记录类型化事件,并支持写时复制(copy-on-write)分支,让智能体可以回滚到之前的状态并复用 KV 缓存。早期测试显示,多智能体协作任务的通过率有所提升。
ISE:一种基于执行的面向多轮操作系统代理轨迹的合成方案
本文介绍了一种名为ISE的三阶段合成范式,用于生成带有基于执行的多轮操作系统代理轨迹,并证明在生成的ISE-Trace数据集上进行微调能显著提升代理在ClawEval上的性能。
重构性权威的运行化:自主代理系统中的运行时构建、依赖解析与执行门控
本文介绍了一种自主代理的运行时执行模型,该模型强制执行'重构性权威'——仅当从当前状态能构建出权威时,才允许执行动作。该模型包括动态依赖解析、针对不确定性的暂停状态以及集成漂移检测的恢复循环。
Lean4Agent: 代理工作流与轨迹的形式化建模与验证
介绍Lean4Agent,一个使用Lean4对代理工作流和轨迹进行形式化建模与验证的框架,展示了在SWE-Bench和ELAIP-Bench上的性能提升。
分享一种面向AI代理的不同研究架构,用以检查并解决运行自主代理时的已知瓶颈。欢迎反馈?
介绍了一种面向AI代理的新研究架构,其核心是一个透明运行时,每次交互都会成为可重放的执行轨迹,具有完全可检查性,包括规划、执行、观察、验证和记忆阶段。