@rohanpaul_ai: 本文表明,智能体的表现更少依赖于提示词本身,更多依赖于其周围的控制层。“Agent intel…
摘要
本文认为,AI智能体的性能更多地取决于控制层(harness)而不是仅靠提示词,并提出了自然语言智能体控制层,使得设计选择可检查且可移植。
查看缓存全文
缓存时间: 2026/05/23 14:07
这篇论文表明,智能体的性能更多取决于其外围框架,而非单纯依赖提示词。
“智能体智能“正逐渐成为一个系统性问题。问题在于,许多AI智能体看似只是一个模型,但其真实行为却源于周围用于控制规划、工具、记忆、重试、检查与终止的代码。
模型或许能在单一步骤中良好推理,但长期任务往往会失败在更混乱的地方:状态丢失、验证偏移、工具返回部分证据,以及智能体忘记哪个中间产物真正重要。
自然语言代理框架(Natural-Language Agent Harnesses)试图让这一控制层变得可见。
这类框架并非将逻辑隐藏在控制器代码中,而是用结构化的自然语言表达各个阶段、角色、契约、状态规则、失败模式以及终止条件,使得共享运行时可以执行这些内容。
这一观点并非主张用自然语言取代代码,而是认为围绕智能体的重要设计选择应当变得可检查、可移植且可测试,而非隐藏在某一个框架的习惯做法背后。
在SWE-bench基准测试中,更重的框架化显著改变了行为——调用次数、工具使用、委派和运行时消耗均有所增加——但并未产生简单的正向收益曲线:有时增加结构能带来帮助,有时却将智能体引离最短的基准对齐修复路径。
框架并非模型周围的魔法脚手架,而是一系列关于可靠性来源的赌注。
论文链接 – arxiv.org/abs/2603.25723
论文标题:自然语言代理框架(Natural-Language Agent Harnesses)
相似文章
@rohanpaul_ai: 这篇来自Meta、斯坦福和伊利诺伊的调研论文认为,当代码成为AI智能体的主要工作层时,它们的效果更好…
这篇来自Meta、斯坦福和伊利诺伊的调研论文认为,当代码被用作AI智能体的主要工作层时,它们表现更好,将代码视为推理、行动和建模的环境。作者引入了‘智能体框架’的概念,包含工具、内存、沙箱和反馈循环。
@mardehaym: 要真正理解AI代理,你必须理解框架。而且这不是模型。我深入探讨了一个运作的…
这篇文章强调,在AI代理中,框架——包括工具、上下文、控制和工作流——对于实现可靠、安全和可追溯的结果比模型更为关键。
智能体框架的演进(10分钟阅读)
这篇文章探讨了AI模型与框架的同步演进如何显著提升智能体能力,使框架角色转向聚焦人类注意力接口。
@omarsar0: // 自我束具:能自我改进的束具 // (收藏这个)我们今天依赖的大多数智能体框架…
本文介绍了自我束具(Self-Harness),一种新的范式,其中基于LLM的智能体能够迭代地改进自身的操作束具——包括提示、工具和控制流程——无需人类工程师或更强大的外部智能体,在多个模型上取得了显著的性能提升。
@sairahul1: https://x.com/sairahul1/status/2063544956158185927
本文介绍了“Harness Engineering”这一概念,这是一门专注于设计约束和引导AI代理的系统,使其在生产中可靠的学科,并认为Harness(约束系统)比模型本身更重要。