持续统一数千个智能体的工作

Reddit r/AI_Agents 工具

摘要

描述了一种方法,用于在并行预测任务中统一数千个智能体的输出,通过后处理和同质任务设计实现一致性和成本效率。

在我目前的职位上,我花了很多时间优化智能体工作负载,这些工作负载每个用户请求可扩展到数千个智能体,目标之一就是提高所有工作者的结果凝聚力。想象一下并行运行智能体,为数据集的每一行在线查找信息,你希望它们都使用相同的方法论、相同的单位,并尽可能使用相同的高质量网站。这在一般情况下非常具有挑战性,尤其是每次评估变更的成本在数百到数千美元。我最近针对预测这一特定用例构建了一个解决方案。比如预测区域内每个港口的船舶吞吐量。在一个预测中,智能体会隐式建模例如贸易政策变化、工人罢工、航线堵塞的可能性。这些机制支撑着区域内所有港口的预测,意味着对它们发生概率的一致意见应当被“定价”到所有个体预测中。 我发现这个窄范围案例比通用高度并行工作负载更容易处理的一些原因:任务更加同质化。所有预测遵循相似的结构,因此我们内部基准的改进更能代表真实用户用例。所有预测都是试图理解同一世界的动态,这意味着所有过去的预测可以被新预测利用(在考虑时效性折扣后)。一致性要求主要局限于数据的子集。它作为后处理步骤运行,意味着原始智能体工作花费的数千美元不需要为每次实验重复(与执行中的智能体间通信不同)。 具体来说,在我们的回测预测智能体环境中,我可以迭代设计,将时间回拨几个月,观察新系统的表现。Briar指标的改进约为0.002,改进非常可解释。我们还在预测比赛中实时评估所有这些变更,目前在一些Metaculus预测比赛中排名第一,并且在真实货币市场有已验证的业绩记录。你可以自行查看,账户名为FutureSearch。 目前,我们在多个领域有数千个预测。每个新预测都绘制出对世界的新理解,这些理解会随时间累积。如果你对运行超大规模智能体工作负载有任何疑问,欢迎分享!
查看原文

相似文章

OneDayAgent:迈向自主智能体的长时程执行框架

Hugging Face Daily Papers

OneDayAgent 是一个面向自主智能体的长时程执行框架,它将开放式任务分解为有界子任务,在上下文压力下管理执行记忆,并验证/修复最终输出。它在 AgentIF-OneDay 上使用 GLM-5.2 达到了当前最优水平,并能泛化到五个后端 LLM。

Matryoshka Agent:为长期机器学习工程展开子代理

arXiv cs.AI

Matryoshka Agent 是一个层次化代理框架,它将长期机器学习工程任务分解为高级编排器和低级子代理,实现高效探索和迭代优化。它在复杂的 MLE 任务上显著提升性能,使 4B 模型匹配 o4-mini 的编排能力,并在 30B 编码器模型上带来高达 36.7% 的相对收益。

统一智能体:跨设备交互管理

arXiv cs.AI

本文介绍了统一智能体(Unified Agent),一种有状态的AI智能体,能够在设备和时间上维护紧凑的交互状态,以处理跨设备、跨时间的用户请求,在新基准测试中优于现有智能体设计。