标签
Chamath 批评 AI 领域中的长期任务效率低下,预测其将经历炒作周期并陷入幻灭低谷,同时建议使用符号空间来引导嵌入空间,以提升 AI 性能。
LoopArena推出一项基准测试,评估模型在编码代理任务中充当循环工程运行时控制器的表现,结果显示严格成功率较低,但成本显著降低。
FactoryAI 开发了一个模型独立的程序逆向工程系统,该系统通过提供独立的完成定义,改善了所有测试的前沿模型在长时程软件任务上的性能。
Vetta 被介绍为一种成本效益高的长期代理任务工具,将每任务成本降低至 $0.298,而 claude-code 为 $0.872,hermes 为 $1.095。
Agent-G^2 引入了一个高斯指导框架,用于强化学习中的提示深度,提升了长期代理任务的性能,无需额外的探测回合,并在 ALFWorld 和 WebShop 基准测试中取得优异结果。
Nvidia的研究表明,围绕AI模型设计精良的系统,而非模型本身,能显著提升长期任务的表现,其中Claude Opus 5在ARC-AGI-3基准测试中获得了满分。
AutoNodo 在一个180万行的代码库上实现了对单一技术目标的近22天连续自主执行,质疑了当前编程代理的自主性指标。
文章介绍了dots3-note Preview模型,这是一个开放权重多模态AI模型,针对长期任务进行了优化,并采用了TEMPO强化学习技术,该技术支持自我批评和适应。
Cordis 是一个支持长时任务的框架,它通过可逆的、跟踪的上下文系统实现崩溃恢复和动态插件添加,确保高效且损失最小的状态管理。
本文系统评估了七个前沿AI智能体在长期任务上的表现,发现它们更像是工程优化器而非自主研究者,并提出了改进训练和经验管理的建议。
清华、浙大和美团团队提出AgentOPSD,一种递归自蒸馏的信用分配方法,将稀疏的最终奖励转化为逐步信用信号,提升长时Agent强化学习性能。在ALFWorld等任务上显著优于GRPO基线。
VerMem是一个用于LLM智能体的统一内存管理框架,利用局部和全局验证器结合强化学习,共同控制长期记忆和短期记忆。它在五个基准测试上优于强基线,并改善了效率-性能权衡。
OmegaUse-OfficeVal是一个基准测试,用于评估LLM代理在长期办公套件任务中的表现,并结合经济基准,比较人力成本与LLM推理成本。该基准包含100个任务,每个任务需要约2.3小时的人力劳动。研究发现,前沿LLM虽然更便宜、更快速,但质量仍低于人类水平。
提出进度条件组策略优化(ProGPO),通过在组内所有样本均失败时使用首次访问的观察覆盖率,克服长周期代理任务中的信用分配问题,在ALFWorld和WebShop上提升了性能。
RoboTTT将视觉运动上下文扩展到机器人策略的8K时间步长,实现了从人类视频演示中一次模仿、即时策略改进以及对扰动的鲁棒性。它比基线提高了87%,并完成了一个五分钟、十阶段的组装任务,而基线无法完成。
SelfMem提出了一种面向AI智能体的自优化记忆框架,使其能够通过记忆工具和反馈信号探索、评估和优化自身的记忆策略,在BEAM基准测试上,于大型对话规模下相较于基线方法取得了显著改进。
RoboTALES引入了一个两阶段框架,结合基于LLM的规划和基于VLM的批评,以改进任务对齐的视频生成和机器人策略训练,在长时域操作任务上显著优于现有方法。
这篇斯坦福研究论文介绍了AutoMem,这是一个将智能体记忆管理视为可训练技能的框架。通过分别优化记忆结构和熟练度,AutoMem在长周期任务上将基础智能体性能提升了2到4倍,使得一个32B开源权重模型能够与Claude Opus 4.5和Gemini 3.1 Pro Thinking等前沿系统竞争。
AutoMem 引入了一个框架,将记忆管理作为 LLM 的可训练技能进行自动化学习,通过优化记忆结构和熟练度,将长期任务的性能提升 2-4 倍。
OSWorld 2.0 是一个新的基准测试,用于评估计算机使用代理在 108 个长周期真实工作流程上的表现。当前像 Claude Opus 4.8 和 GPT-5.5 这样的代理完成率较低,凸显了它们在处理复杂多步骤任务时的显著局限性。