@rohanpaul_ai: 本文表明,智能体的表现更少依赖于提示词本身,更多依赖于其周围的控制层。“Agent intel…

X AI KOLs Following 论文

摘要

本文认为,AI智能体的性能更多地取决于控制层(harness)而不是仅靠提示词,并提出了自然语言智能体控制层,使得设计选择可检查且可移植。

本文表明,智能体的表现更少依赖于提示词本身,更多依赖于其周围的控制层。 “智能体智能”正逐渐成为一个系统性问题。问题在于,许多AI智能体看起来像是一个模型,但其实际行为来自于周围的控制代码,这些代码管理着规划、工具、记忆、重试、检查和终止。 模型可能在单个步骤中推理得很好,但长期任务会在更杂乱的地方失败:状态消失、验证偏移、工具返回部分证据,智能体会忘记哪个中间产物才是真正重要的。 自然语言智能体控制层试图让这个控制层变得可见。 它们不是将逻辑埋藏在控制器代码中,而是用结构化的自然语言来表达阶段、角色、合约、状态规则、故障模式和终止条件,这些语言可以由共享运行时执行。 其主张并非自然语言应取代代码,而是围绕智能体的重要设计选择应变得可检查、可移植和可测试,而不是隐藏在某个框架的习惯中。 在SWE-bench上,更重的控制层使用显著改变了行为,增加了调用、工具、委派和运行时间,但并未产生简单的胜率曲线;有时添加结构有帮助,有时却将智能体推离最短的基准对齐修复路径。 控制层不是模型周围的魔法脚手架,而是一组关于可靠性来自何处的赌注。 ---- 论文链接 – arxiv. org/abs/2603.25723 论文标题:“Natural-Language Agent Harnesses”
查看原文
查看缓存全文

缓存时间: 2026/05/23 14:07

这篇论文表明,智能体的性能更多取决于其外围框架,而非单纯依赖提示词。

“智能体智能“正逐渐成为一个系统性问题。问题在于,许多AI智能体看似只是一个模型,但其真实行为却源于周围用于控制规划、工具、记忆、重试、检查与终止的代码。

模型或许能在单一步骤中良好推理,但长期任务往往会失败在更混乱的地方:状态丢失、验证偏移、工具返回部分证据,以及智能体忘记哪个中间产物真正重要。

自然语言代理框架(Natural-Language Agent Harnesses)试图让这一控制层变得可见。

这类框架并非将逻辑隐藏在控制器代码中,而是用结构化的自然语言表达各个阶段、角色、契约、状态规则、失败模式以及终止条件,使得共享运行时可以执行这些内容。

这一观点并非主张用自然语言取代代码,而是认为围绕智能体的重要设计选择应当变得可检查、可移植且可测试,而非隐藏在某一个框架的习惯做法背后。

在SWE-bench基准测试中,更重的框架化显著改变了行为——调用次数、工具使用、委派和运行时消耗均有所增加——但并未产生简单的正向收益曲线:有时增加结构能带来帮助,有时却将智能体引离最短的基准对齐修复路径。

框架并非模型周围的魔法脚手架,而是一系列关于可靠性来源的赌注。


论文链接 – arxiv.org/abs/2603.25723

论文标题:自然语言代理框架(Natural-Language Agent Harnesses)

相似文章