标签
作者讨论了从将自助入职重建为代理流程中获得的见解,强调了将确定性任务管理与非确定性LLM操作相结合的长期代理如何提高企业AI部署的可靠性并减少幻觉。
ECHO 是一个认知启发的、可审计的记忆架构,适用于长时程代理,在 LoCoMo 和 LongMemEval-S 等基准测试中表现出高检索性能。
论文介绍了Recuris,一种递归记忆架构,通过跟踪进度和指导技能选择来提升长期任务代理的成功率,采用本地化的、验证门控的更新机制。
本文对用于记忆增强LLM智能体的记忆基质进行了全面评估,发现没有单一基质在所有条件下占主导地位,并提倡采用自适应基质路由来优化不同操作条件下的性能。
LongRCA Bench 引入了一个用于诊断长时程智能体轨迹失败的基准,RCTA方法改进了责任角色和根本原因步骤的归因。
介绍了受治理的持久记忆(GPM),一种用于可审计长时程智能体记忆的双时态状态转换模型,具有源绑定语义和故障封闭释放,并在基准测试和密封评估上得到验证。
This paper introduces MESA, a framework that dynamically selects and fuses a query-adaptive subset of multiple structural memory views for long-horizon agents, achieving 8.5% accuracy improvement over the strongest baseline while using 41% fewer evidence tokens.
这项arXiv综述(1,547篇论文,2024-2026年)系统性地描绘了长视界LLM智能体领域,厘清了长视界、长上下文和长期记忆三个概念,并将研究组织为六个生命周期类别,同时指出了核心的“视界差距”和开放的度量问题。
This empirical study investigates how recurrent context compression affects long-horizon agent behavior, showing that compression can weaken recent interaction influence and cause instability. The authors introduce TRACE, a verifier-guided framework that improves compression reliability and performance on AppWorld.
MemPrism proposes a task-conditioned relational memory framework that separates persistent experience storage from decision-time working memory, enabling long-horizon agents to dynamically construct relational views for improved performance and reduced token usage.
StepReflect将移动智能体的逐步GUI反思重构为监督式结构化预测,在AndroidWorld上实现了比GPT-5.2更高的转换准确率,同时降低了API成本。
Presents a verification instrument for long-horizon agents that structurally separates commitment drift from binding drift, using a deterministic executive and pre-registered predictions. Reports ablation results showing commitment mechanism removal flips goal abandonment from 0 to 1 while binding error stays flat, though task efficacy is null on ARC-AGI-3.
A new survey from Renmin University reviews nearly 1,000 studies on long-horizon AI agents, arguing that reliable long-horizon intelligence depends on the whole model-harness system, not just larger context windows or stronger models.
本文介绍了JarvisBench,一个用于评估长周期AI代理工作流中连续、实时语音中介层的基准,并展示了一个模块化的Jarvis原型,该原型在WildClaw任务上使用多种基于LLM的工作代理进行了测试。
TRACE 提出了一种轮次级奖励分配方法,利用冻结参考模型的对数概率和时间差分学习来解决长周期智能体任务中的信用分配问题,在没有评论家或过程标签的情况下,在搜索基准测试中取得了显著改进。
TRACE 是一种用于多轮代理强化学习的密集信用分配方法,它利用冻结的参考模型从工具边界的对数概率变化中计算每个动作的奖励,消除了对批评者或过程奖励模型的需求。它在 BrowseComp-Plus 等基准测试上显著提升了长期工具使用的性能。
本文介绍了一种主动记忆代理,它与标准行为代理协同工作,在长周期任务中选择性地注入基于记忆的提醒,从而缓解行为状态衰减。在Terminal-Bench和τ²-Bench上的实验显示,pass@1有显著提升,并且该方法在弱和强行为代理上均得到了验证。
介绍STRACE,一个通过结构化轨迹分析与因果提取来构建高信噪比优化上下文以改进长周期智能体的框架,在形式化验证任务上超越基线。
本文介绍了EnvProbe,一种预算限制下的环境探测操作器,它允许长时域语言代理在行动前有选择地查询环境的特定信念字段,通过有限的交互高效校准信念,从而减少世界模型误差。
介绍 AgentOdyssey,一个程序化文本游戏生成框架,旨在评估智能体在测试时持续学习的能力,包括探索、情景记忆、世界知识获取、技能学习和长时域规划。该框架突显了当前智能体与人类表现之间的显著差距。