从模型扩展到系统扩展:在自主AI中扩展架构框架

Hugging Face Daily Papers 论文

摘要

本文认为,推进自主AI需要扩展围绕基础模型的系统架构,重点关注可审计、模块化和可验证的组件。作者介绍了参考架构框架CheetahClaws,并概述了上下文管理、可信内存和动态技能路由方面的瓶颈。

本文研究了自主智能体(agentic AI)中的下一个主要瓶颈——系统扩展,而不仅仅是模型扩展:即在基础模型周围设计可审计、持久、模块化和可验证的架构。我们将这一转变称为扩展架构框架(scaling the harness):将基础模型周围的结构化执行层视为设计、评估和优化的一等对象。尽管近期的大语言模型使智能体能够使用工具、检索信息、维护记忆并执行长周期工作流,但评估仍然以模型为中心,通常只关注最终任务成功率,而将记忆、检索、工具使用、编排、验证和治理视为次要的实现细节。这种框架越来越不充分,因为智能体的性能源于基础模型、内存基板、上下文构建器、技能路由层、编排循环以及验证与治理层之间的交互。这些组件共同构成了智能体架构框架(agent harness),将模型能力转化为长周期智能体行为。我们通过三个核心瓶颈来研究架构框架的扩展:上下文治理、可信内存和动态技能路由,以及协调和约束它们的编排与治理机制。我们还进一步概述了架构框架级别基准的研究议程,这些基准超越了一次性任务成功率,衡量轨迹质量、内存卫生、上下文效率、通信保真度、验证成本以及随时间的安演化。为了使讨论具体化,我们开发了CheetahClaws:https://github.com/SafeRL-Lab/cheetahclaws,一个Python原生参考架构框架,并将其与Claude Code和OpenClaw进行比较。我们的主要主张是,自主AI的未来进展在很大程度上将同样依赖于系统设计和更强的模型基础。
查看原文
查看缓存全文

缓存时间: 2026/06/01 19:21

论文页面 - 从模型扩展到系统扩展:扩展自主人工智能的“驾驭系统“

来源:https://huggingface.co/papers/2605.26112

摘要

自主人工智能的进步需要围绕基础模型扩展系统架构,重点放在可审计和可验证的组件上,而不仅仅是模型容量。

本文研究了自主人工智能(https://huggingface.co/papers?q=agentic%20AI)下一个主要瓶颈——系统扩展(https://huggingface.co/papers?q=system%20scaling),而不仅是模型扩展:即在基础模型(https://huggingface.co/papers?q=foundation%20models)周围设计可审计、持久、模块化和可验证的架构(https://huggingface.co/papers?q=verifiable%20architectures)。我们将这种转变称为“扩展驾驭系统“(https://huggingface.co/papers?q=scaling%20the%20harness):将基础模型周围的结构化执行层(https://huggingface.co/papers?q=structured%20execution%20layer)视为设计、评估和优化的一等对象。尽管近期的大型语言模型使智能体能够使用工具、检索信息、维护记忆并执行长周期工作流,但评估仍然以模型为中心,通常将智能体简化为最终任务的成功率,而将记忆、检索、工具使用、编排、验证和治理视为次要的实现细节。这种框架日益不足,因为智能体的性能源自基础模型、记忆基质(https://huggingface.co/papers?q=memory%20substrate)、上下文构建器(https://huggingface.co/papers?q=context%20constructor)、技能路由层(https://huggingface.co/papers?q=skill-routing%20layer)、编排循环(https://huggingface.co/papers?q=orchestration%20loop)以及验证与治理层(https://huggingface.co/papers?q=verification-and-governance%20layer)之间的交互。这些组件共同构成了智能体驾驭系统(https://huggingface.co/papers?q=agent%20harness),它将模型能力转化为长周期智能体行为。我们通过三个核心瓶颈来研究“扩展驾驭系统“(https://huggingface.co/papers?q=scaling%20the%20harness):上下文治理(https://huggingface.co/papers?q=context%20governance)、可信记忆(https://huggingface.co/papers?q=trustworthy%20memory)和动态技能路由(https://huggingface.co/papers?q=dynamic%20skill%20routing),以及协调并约束它们的编排与治理机制。我们进一步概述了一个面向驾驭系统级别基准测试(https://huggingface.co/papers?q=harness-level%20benchmarks)的研究议程,该议程超越一次性任务成功率,转而衡量轨迹质量(https://huggingface.co/papers?q=trajectory%20quality)、记忆卫生(https://huggingface.co/papers?q=memory%20hygiene)、上下文效率(https://huggingface.co/papers?q=context%20efficiency)、通信保真度(https://huggingface.co/papers?q=communication%20fidelity)、验证成本(https://huggingface.co/papers?q=verification%20cost)以及随时间推移的安全演进(https://huggingface.co/papers?q=safe%20evolution)。为使讨论具体化,我们开发了 CheetahClaws(https://github.com/SafeRL-Lab/cheetahclaws)——一个基于 Python 的参考驾驭系统,并将其与 Claude Code 和 OpenClaw 进行比较。我们的主要观点是:自主人工智能(https://huggingface.co/papers?q=agentic%20AI)的未来进展将同样依赖于系统设计,而非仅仅是更强的基础模型(https://huggingface.co/papers?q=foundation%20models)。

查看 arXiv 页面(https://arxiv.org/abs/2605.26112)查看 PDF(https://arxiv.org/pdf/2605.26112)项目页面(https://cheetahclaws.github.io/)GitHub711(https://github.com/SafeRL-Lab/cheetahclaws)添加至收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.26112)

在您的智能体中获取此论文:

hf papers read 2605\.26112

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接到此论文

在模型的 README.md 中引用 arxiv.org/abs/2605.26112 以从本页面链接该模型。

引用此论文的数据集0

没有数据集链接到此论文

在数据集的 README.md 中引用 arxiv.org/abs/2605.26112 以从本页面链接该数据集。

引用此论文的 Spaces0

没有 Space 链接到此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2605.26112 以从本页面链接该 Space。

包含此论文的收藏集0

没有包含此论文的收藏集

将此论文添加到收藏集(https://huggingface.co/new-collection)以从本页面链接它。

相似文章

@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2057153343081111582

X AI KOLs Timeline

UIUC、Meta和斯坦福大学联合发布的一份100页调查报告引入了人工智能代理的三个 harness 层(接口、机制、Scaling),认为大多数代理失败源于 harness 问题而非推理缺陷,并提供了一个用于审计代理堆栈的分类体系。

@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2074130508833845396

X AI KOLs Timeline

自我改进的机制使AI代理能够通过分析执行轨迹自主重写其运行规则,从而实现60%的性能提升。来自上海AI实验室的研究引入了Self-Harness框架,使得轻量级模型能够在无需人工工程的情况下超越更大规模的模型。