@omarsar0:强烈推荐。我经常声称构建agent harnesses有巨大的alpha收益。结果发现harnesses是组合…
摘要
讨论了agent harnesses作为组合通用器的概念,用于模型中扩展泛化能力,并引用了RLM harness。
强烈推荐。
我经常声称构建agent harnesses有巨大的alpha收益。
原来harnesses是组合通用器。RLM harness就是其中一个实例。这可能带来有趣且高效的新方法来扩展模型的泛化能力。
查看缓存全文
缓存时间: 2026/07/21 14:46
强烈推荐。
我常常说,构建 agent harness 能带来巨大的 alpha。
事实证明,harness 是组合泛化器(compositional generalizers)。RLM harness 就是其中一个例子。这可能会带来有趣且高效的新方法来扩展模型的泛化能力。
这项工作中有一个很妙的地方可能不容易被注意到:在后训练阶段,你可能不需要通过长视野的 rollout 来训练长视野的智能体。你可以在短任务上进行训练,这些任务的奖励成本低且易于验证,然后让 harness 将其扩展 8-32 倍。
相似文章
最好的智能代理工具会这样做……
作者分享了构建高效智能代理工具的见解:最好的工具最大限度地减少对大语言模型(LLM)在琐碎任务上的依赖,将其保留用于复杂推理,从而将真正的代理工具与简单的包装器区分开来。
@omarsar0: // 自我束具:能自我改进的束具 // (收藏这个)我们今天依赖的大多数智能体框架…
本文介绍了自我束具(Self-Harness),一种新的范式,其中基于LLM的智能体能够迭代地改进自身的操作束具——包括提示、工具和控制流程——无需人类工程师或更强大的外部智能体,在多个模型上取得了显著的性能提升。
@omarsar0: // Scaling Laws for Agent Harnesses // 如果你构建代理框架,这篇文章值得一看。(收藏)大多数 harness…
关于代理框架缩放定律的新研究显示,大多数字令和工具调用次数并不重要;该研究引入了一种有效的方法。
为垂直领域打造一个有主见的框架
本文讨论了一个有主见的框架,用于将领域特定结构编码到智能体系统中,并通过代码演示展示性能提升。
@lateinteraction: “训练框架”开始与神经架构模糊,在谁承载实现泛化的归纳偏差方面…
研究人员提出,训练框架(训练装置)应承载用于泛化的归纳偏差,并证明训练RLMs在扩展性和泛化到更困难任务方面远优于普通Transformer。