标签
介绍了EvoHarness-RL,一个为长时程LLM智能体学习运行时框架策略的框架,使其能够在任务执行过程中构建和更新外部状态(信念、进度、经验)。在ALFWorld上使用Qwen3-8B,它达到了96.9%的成功率,并揭示了框架退火和进化动态。
本文介绍了SearchAuditBench,这是一个包含1,243条带有专家标注的失败长时程搜索智能体轨迹的基准测试,以及SearchAuditor,一个从多视角进行审计的框架,用于定位、归因并修复智能体故障。实验表明,SearchAuditor优于基线方法,在使用GPT-5.5等前沿模型时,端到端通过率达到32.3%。
本文提出答案回溯信用分配(ABC)框架,该框架将稀疏的轨迹级结果转换为密集的步级监督,用于训练长时程搜索智能体。所得到的ABSeeker模型基于Qwen3.5-4B构建,在BrowseComp基准上取得了强劲的结果,优于同规模智能体,并与更大规模的模型相当。
ContextWeave 是一个新的纵向基准,用于评估在现实办公工作流中,回忆的记忆是否能够提升下游智能体的性能。它利用 14 名参与者经过隐私保护的多月工作流,创建了 1,005 个可执行任务。
一条推文,宣布了一个名为 'Long Horizon in Action' 的开源项目,该项目包含用户界面,很可能用于演示长程 AI 智能体的能力。
Saboo Shubham 宣布开源了一个模板,用于构建能够在后台做梦和自我改进的长周期智能体框架。
Crayotter 引入了组相对偏好反向传播(GRPB),一种训练长视界视频编辑智能体的方法,利用任务内偏好排序而非全局标量奖励。由此产生的 9B 模型在 AgenticVBench 上超越了多个专有系统。
本文介绍了递归合成终端任务(RST),一种递归验证的合成框架,用于大规模生成长时程终端智能体训练数据,共生成37,484个任务,并在终端基准上提升了Qwen3.5模型的表现。
本文介绍了技能熵(Skill Entropy),一种衡量跨技能切换难度的指标,以及 Skill^2-Bench,一个覆盖 558 项技能的长程推理任务基准。作者还提出了 Skill-EntropyRL,一个训练框架,将 Qwen3 模型上的推理性能从 34.4% 提升到 68.4%,并从 14.6% 提升到 40.1%。
WorldCycle提出了一种面向长视界视频世界模型的自验证强化学习方法,利用可逆动作循环作为免费监督,将状态回归漂移降低最多44%,并将复合动作准确率提升近4倍。它还引入了CycleBench,以评估作为模拟器的世界模型。
OneDayAgent 是一个面向自主智能体的长时程执行框架,它将开放式任务分解为有界子任务,在上下文压力下管理执行记忆,并验证/修复最终输出。它在 AgentIF-OneDay 上使用 GLM-5.2 达到了当前最优水平,并能泛化到五个后端 LLM。
Epoch AI 和 METR 推出了 MirrorCode,这是一个基准测试,用于测试 AI 模型在长时间跨度内端到端重新实现整个程序的能力。早期结果显示,Claude Opus 4.7 在 14 小时内解决了一个生物信息学工具包,花费 251 美元,但记忆化方面的注意事项仍然存在。
本文提出HERO(历史增强展开训练),一种通过模型自身优化历史的相对监督来增强自回归神经算子的标准轨迹监督的方法,提高了PDE基准上的长时程精度和稳定性。
本文介绍了Anchor,一个用于评估AI伴侣中长期角色稳定性与轨迹记忆的合成审计框架,发现当前模型在长时间交互中无法可靠地保持身份与记忆。
本文提出ThinkReset方法,通过构建可复用的中间接口来替代被丢弃的推理历史,从而在受限上下文窗口下实现更好的长程推理。
介绍了LongHorizon-Harness,一种面向长时程LLM智能体的任务状态管理方法,采用Manage-Execute-Audit循环,在WeaveBench和OSWorld等多个模型和基准上展示了一致的改进。
DeepVoyager-VL 提出了一种长时程多模态深度搜索框架,将视觉证据融入中间推理过程,利用多模态事件图进行数据合成和微调,而无需强化学习,在十个基准测试上取得了强劲性能。
本文介绍了反思性检索记忆(RRM),一种记忆框架,从历史任务轨迹中提炼程序性检索经验,以改进长时程多模态推理中的证据检索。RRM在M3-Bench-Robot、M3-Bench-Web和Video-MME-Long基准上达到或超过了先前的最先进水平。
This position paper argues that long-horizon benchmark failures must be compared against baselines built from matched short stages, introducing the 'horizon residual' metric to distinguish task size from task difficulty in LLM agent evaluation.
CAST是一种方法,利用游戏求解器的状态值来提供回合级信用分配信号,通过强化学习训练LLM智能体,在多个游戏中的领域内和未见难度评估中均优于基线。