Shepherd:通过形式化执行轨迹赋能元智能体的运行时底层架构

Hugging Face Daily Papers 论文

摘要

本文介绍了 Shepherd,这是一种面向元智能体的函数式编程模型和运行时底层架构,它使用 Lean 对操作进行形式化,并以类似 Git 的执行轨迹记录交互。该系统通过支持智能体状态的高效分叉与重放,在运行时干预、反事实优化和强化学习训练方面展示了显著的性能提升。

我们介绍了 Shepherd,这是一种函数式编程模型,它将针对目标智能体的元智能体操作形式化为函数,其核心操作通过 Lean 机制化实现。Shepherd 将每一次智能体与环境的交互记录为类似 Git 的执行轨迹中的类型化事件,从而允许对任何过去的状态进行分叉和重放。该系统的智能体进程和文件系统分叉速度比 Docker 快 5 倍,并在重放时实现了超过 95% 的提示缓存复用。我们通过三个应用场景展示了该模型的有效性。首先,在运行时干预方面,实时监督器将 CooperBench 上的结对编程通过率从 28.8% 提升至 54.7%。其次,在反事实元优化方面,分支探索在四个基准测试中比基线方法高出多达 11 个百分点,同时将实际运行时间缩短了多达 58%。第三,在 Tree-RL 训练中,在选定回合分叉 rollout 将 TerminalBench-2 的性能从 34.2% 提升至 39.4%。这些结果确立了 Shepherd 作为编程元智能体的高效基础设施地位。我们开源了该系统以支持未来的研究。
查看原文
查看缓存全文

缓存时间: 2026/05/12 07:30

论文页面 - Shepherd:赋予元智能体形式化执行轨迹的运行时基础

来源:https://huggingface.co/papers/2605.10913

摘要

我们提出了 Shepherd,一种函数式编程模型,它将针对目标智能体的元智能体操作形式化为函数,其核心操作在 Lean 中进行机械化验证。Shepherd 将每次智能体与环境的交互记录为类似 Git 执行轨迹中的类型化事件,允许任何过去的状态进行分支和重放。该系统对智能体进程及其文件系统的分支速度比 Docker 快 5 倍,并在重放时实现超过 95% 的提示缓存复用。我们通过三个应用场景展示了该模型的有效性。首先,在运行时干预方面,一个实时监督器在 CooperBench 上将结对编程的通过率从 28.8% 提升至 54.7%。其次,在反事实元优化方面,分支探索在四个基准测试中均优于基线方法,最高提升达 11 个百分点,同时将实际耗时最多减少 58%。第三,在 Tree-RL 训练中,在选定的回合进行分支 rollout 使 TerminalBench-2 的性能从 34.2% 提升至 39.4%。这些结果确立了 Shepherd 作为编程元智能体的高效基础设施。我们开源该系统以支持未来的研究。

查看 arXiv 页面 (https://arxiv.org/abs/2605.10913) 查看 PDF (https://arxiv.org/pdf/2605.10913) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.10913)

在您的智能体中获取这篇论文:

hf papers read 2605\.10913

没有最新版的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

暂无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2605.10913 即可从本页面建立链接。

引用此论文的数据集 0

暂无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.10913 即可从本页面建立链接。

引用此论文的空间(Spaces) 0

暂无 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2605.10913 即可从本页面建立链接。

包含此论文的合集 0

暂无合集包含此论文

添加此论文到合集 (https://huggingface.co/new-collection) 即可从本页面建立链接。

相似文章

@akshay_pachaar:斯坦福大学的研究人员又做到了。他们刚刚构建了智能体原生的 Git 版本。当智能体在较长的任务上工作…

X AI KOLs Timeline

斯坦福大学的研究人员发布了 Shepherd——一个运行时层,对 AI 智能体的运行而言就像 Git 一样:它记录类型化事件,并支持写时复制(copy-on-write)分支,让智能体可以回滚到之前的状态并复用 KV 缓存。早期测试显示,多智能体协作任务的通过率有所提升。