从模型扩展到系统扩展:在自主AI中扩展架构框架
摘要
本文认为,推进自主AI需要扩展围绕基础模型的系统架构,重点关注可审计、模块化和可验证的组件。作者介绍了参考架构框架CheetahClaws,并概述了上下文管理、可信内存和动态技能路由方面的瓶颈。
查看缓存全文
缓存时间: 2026/06/01 19:21
论文页面 - 从模型扩展到系统扩展:扩展自主人工智能的“驾驭系统“
来源:https://huggingface.co/papers/2605.26112
摘要
自主人工智能的进步需要围绕基础模型扩展系统架构,重点放在可审计和可验证的组件上,而不仅仅是模型容量。
本文研究了自主人工智能(https://huggingface.co/papers?q=agentic%20AI)下一个主要瓶颈——系统扩展(https://huggingface.co/papers?q=system%20scaling),而不仅是模型扩展:即在基础模型(https://huggingface.co/papers?q=foundation%20models)周围设计可审计、持久、模块化和可验证的架构(https://huggingface.co/papers?q=verifiable%20architectures)。我们将这种转变称为“扩展驾驭系统“(https://huggingface.co/papers?q=scaling%20the%20harness):将基础模型周围的结构化执行层(https://huggingface.co/papers?q=structured%20execution%20layer)视为设计、评估和优化的一等对象。尽管近期的大型语言模型使智能体能够使用工具、检索信息、维护记忆并执行长周期工作流,但评估仍然以模型为中心,通常将智能体简化为最终任务的成功率,而将记忆、检索、工具使用、编排、验证和治理视为次要的实现细节。这种框架日益不足,因为智能体的性能源自基础模型、记忆基质(https://huggingface.co/papers?q=memory%20substrate)、上下文构建器(https://huggingface.co/papers?q=context%20constructor)、技能路由层(https://huggingface.co/papers?q=skill-routing%20layer)、编排循环(https://huggingface.co/papers?q=orchestration%20loop)以及验证与治理层(https://huggingface.co/papers?q=verification-and-governance%20layer)之间的交互。这些组件共同构成了智能体驾驭系统(https://huggingface.co/papers?q=agent%20harness),它将模型能力转化为长周期智能体行为。我们通过三个核心瓶颈来研究“扩展驾驭系统“(https://huggingface.co/papers?q=scaling%20the%20harness):上下文治理(https://huggingface.co/papers?q=context%20governance)、可信记忆(https://huggingface.co/papers?q=trustworthy%20memory)和动态技能路由(https://huggingface.co/papers?q=dynamic%20skill%20routing),以及协调并约束它们的编排与治理机制。我们进一步概述了一个面向驾驭系统级别基准测试(https://huggingface.co/papers?q=harness-level%20benchmarks)的研究议程,该议程超越一次性任务成功率,转而衡量轨迹质量(https://huggingface.co/papers?q=trajectory%20quality)、记忆卫生(https://huggingface.co/papers?q=memory%20hygiene)、上下文效率(https://huggingface.co/papers?q=context%20efficiency)、通信保真度(https://huggingface.co/papers?q=communication%20fidelity)、验证成本(https://huggingface.co/papers?q=verification%20cost)以及随时间推移的安全演进(https://huggingface.co/papers?q=safe%20evolution)。为使讨论具体化,我们开发了 CheetahClaws(https://github.com/SafeRL-Lab/cheetahclaws)——一个基于 Python 的参考驾驭系统,并将其与 Claude Code 和 OpenClaw 进行比较。我们的主要观点是:自主人工智能(https://huggingface.co/papers?q=agentic%20AI)的未来进展将同样依赖于系统设计,而非仅仅是更强的基础模型(https://huggingface.co/papers?q=foundation%20models)。
查看 arXiv 页面(https://arxiv.org/abs/2605.26112)查看 PDF(https://arxiv.org/pdf/2605.26112)项目页面(https://cheetahclaws.github.io/)GitHub711(https://github.com/SafeRL-Lab/cheetahclaws)添加至收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.26112)
在您的智能体中获取此论文:
hf papers read 2605\.26112
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接到此论文
在模型的 README.md 中引用 arxiv.org/abs/2605.26112 以从本页面链接该模型。
引用此论文的数据集0
没有数据集链接到此论文
在数据集的 README.md 中引用 arxiv.org/abs/2605.26112 以从本页面链接该数据集。
引用此论文的 Spaces0
没有 Space 链接到此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2605.26112 以从本页面链接该 Space。
包含此论文的收藏集0
没有包含此论文的收藏集
将此论文添加到收藏集(https://huggingface.co/new-collection)以从本页面链接它。
相似文章
@dair_ai: 系统规模扩展是智能体AI的下一个真正瓶颈。如果你构建智能体编排层,这是一张清晰的地图…
本文认为,智能体AI的下一个瓶颈是系统规模扩展(围绕基础模型设计“框架”),而不仅仅是模型规模扩展,并介绍了CheetahClaws(一个Python原生参考框架),以及对三个核心瓶颈的分析:上下文治理、可信内存和动态技能路由。
@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2057153343081111582
UIUC、Meta和斯坦福大学联合发布的一份100页调查报告引入了人工智能代理的三个 harness 层(接口、机制、Scaling),认为大多数代理失败源于 harness 问题而非推理缺陷,并提供了一个用于审计代理堆栈的分类体系。
@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2074130508833845396
自我改进的机制使AI代理能够通过分析执行轨迹自主重写其运行规则,从而实现60%的性能提升。来自上海AI实验室的研究引入了Self-Harness框架,使得轻量级模型能够在无需人工工程的情况下超越更大规模的模型。
@sairahul1: https://x.com/sairahul1/status/2063544956158185927
本文介绍了“Harness Engineering”这一概念,这是一门专注于设计约束和引导AI代理的系统,使其在生产中可靠的学科,并认为Harness(约束系统)比模型本身更重要。
@omarsar0: // Scaling Laws for Agent Harnesses // 如果你构建代理框架,这篇文章值得一看。(收藏)大多数 harness…
关于代理框架缩放定律的新研究显示,大多数字令和工具调用次数并不重要;该研究引入了一种有效的方法。