你的智能体能力取决于其框架。我开源了一个框架,单个函数调用背后集成了40项能力

Reddit r/AI_Agents 工具

摘要

一个开源智能体框架,单个函数调用背后集成了40项能力,包括持久内存、Docker沙箱、自动摘要、死循环检测、预算上限和实时运行分支(用于分支智能体执行)。基于Pydantic AI构建,旨在替换每个生产级智能体所需的2000行胶水代码。

先说明:这是我的项目,我负责维护。发帖是因为这里每周都会出现“框架 vs 模型”的问题,我认为这个思路值得讨论。我为客户构建的每个生产级智能体最终都包裹着同样的2000行胶水代码。重启后依然存在的内存。一个沙箱,防止错误的工具调用影响真实仓库。自动摘要,避免运行在上下文限制处中断。捕捉智能体在相同工具调用上循环并悄悄消耗40美元token的机制。模型每个季度都变得更便宜、更智能。但那些胶水代码从未变得简单,每个人都在从头重写。所以我把它整合到一个框架中。 你调用 create\_deep\_agent(...) 就能获得计划模式、持久内存、带有命名工作空间的Docker沙箱、通过自动摘要实现无限上下文、死循环检测(对每次工具调用进行哈希,监测重复、A-B-A-B和无操作模式)、硬性美元预算上限、MCP客户端支持、技能系统、带有安全预设的生命周期钩子(可阻止破坏性命令),以及带有共享TODO和消息总线的多智能体群组。大约40项能力集于这一函数。 我真正引以为豪的部分是实时运行分支。正在运行的智能体可以分裂成N个分支,每个分支在隔离的写时复制文件系统中尝试不同的方法,各自有自己的预算。对所有分支运行测试套件,让退出码选出胜者,或者让AI评判进行评分。胜出分支的历史继续运行。类似于 git branch,但用于智能体的推理。我还没有找到其他在运行时实现这一功能的框架,所以如果你知道有,我真心想了解它们是如何构建的。 它基于 Pydantic AI,因此模型层、流式传输和验证不是我重新发明的。框架是我添加的部分。在 pyright 和 mypy strict 下100%类型安全,MIT许可证,支持包括本地Ollama在内的任何提供商。如果你不想碰Python,还有终端TUI。 欢迎对设计提出批评。我一直摇摆不定的决定是:分支默认应该使用AI评判还是测试命令?目前是 auto\_with\_fallback,它信任AI评判,但当置信度低时回退到测试结果。你会怎么选?
查看原文

相似文章

@Potatoloogs: https://x.com/Potatoloogs/status/2057391224592667051

X AI KOLs Timeline

本文深度拆解了Agent Harness的概念,即包裹在LLM外部的工程基础设施,包括编排循环、工具调用、记忆系统、上下文管理等12个组件。文章引用Anthropic、OpenAI、LangChain等公司的实践,论证了harness对生产级AI Agent的关键作用。

最好的智能代理工具会这样做……

Reddit r/AI_Agents

作者分享了构建高效智能代理工具的见解:最好的工具最大限度地减少对大语言模型(LLM)在琐碎任务上的依赖,将其保留用于复杂推理,从而将真正的代理工具与简单的包装器区分开来。

用于长时间运行代理的有效工具

Anthropic Engineering

Anthropic 推出了一种由两部分组成的解决方案,使用初始化代理和编码代理,使 Claude Agent SDK 能够有效处理跨多个上下文窗口的长时间运行任务,并通过保持干净、增量的状态来实现。

HarnessX:可组合、自适应且可演进的智能体夹具工坊

Hugging Face Daily Papers

HarnessX 是一个为可组合、自适应且可演进的人工智能智能体夹具打造的工坊,它利用组合原语和轨迹驱动演化来提升智能体性能。在五项基准测试中,它平均提升了 +14.5%(最高达 +44.0%),表明运行时接口演化是模型规模扩展之外的一个互补杠杆。