标签
本文介绍CoCA,一种用于长期多模态智能体动态能力分配的on-policy学习框架,通过条件比较和强化学习来解决计算开销和阶段依赖需求。
本文介绍了 EmbodiedSWE,这是一个使用编码代理来解决复杂、长期的灵巧机器人任务,并通过模拟基准生成演示以训练机器人策略的框架。
介绍了 SimLife,一个可扩展的平台,用于模拟长期家庭生活,以及 SimLife-BP,一个评估 AI 智能体从扩展观察中推断行为模式能力的基准,发现当前模型通常缺乏基于规则的深入理解。
本文提出了一种面向长时AI智能体的层级架构,结合了层级、滴答和级联智能,以实现持续运行而无遗忘,并在十天的活动中进行了验证。
本文提出PARTS,一个现实世界子任务强化学习框架,通过专注于瓶颈子任务并最小化人工干预来提升长期操作任务,在实验中实现了更高的成功率。
本文提出回滚引发反思(RIR)框架,用于长时程LLM代理,通过结合状态回滚与反思记忆来改善错误恢复和任务性能。
本文介绍了 Blindspot,一个用于长期工具使用大语言模型(LLM)智能体轨迹级安全校准的基准测试,通过自适应对抗交互评估模型在多个安全指标上的表现。
CADWorld是一个用于评估在FreeCAD中进行长期机械CAD工作流中计算机使用代理的基准,揭示了当前AI性能与专家水平之间的显著差距。
RoleBreak是一个开放基准,用于评估口语对话系统中长时角色扮演的鲁棒性,揭示了当前模型在长时间交互中维持角色一致性和语音情感方面的能力差距。
本文探索使用LLM构建自适应物理AI代理,以零样本方式管理长周期任务,并展示与强化学习代理相比,它们能有效适应环境变化。
本文介绍了任务在应用手册(TAM)基准,用于评估语言模型的长时序程序推理能力,揭示了当前大语言模型在ICD-10-CM编码和量刑指南等任务上的显著差距。
本文介绍了Mr.LHDR,一个用于评估多模态真实世界长周期深度研究代理的基准,表明当前模型在复杂推理链中难以实现依赖一致的证据整合。
AutoFyn 是一个非参数化代理框架,采用专家迭代机制,具备持久状态和外部验证,在数学、数据科学和网络安全任务中提升了表现。
AhaBench 是一个基准测试套件,通过测试探索、知识转移和延迟反馈处理,评估语言智能体在长期任务中是否从先前经验中改进。
T1 是一个拥有122B参数的混合专家模型,通过强化学习训练用于长期终端任务,在Terminal-Bench 2.1等基准测试中达到了最先进的结果,并超越了GPT-5.4和GLM-5.1等模型。
SPACE 通过从成功轨迹归纳两层参数化技能,将子技能边界作为动作块监督,训练长程 LLM Agent 自适应输出可变长原子动作序列;在 ALFWorld 和 ScienceWorld 上成功率提升 7.0%–31.3%,决策轮次最多降低 78.9%。
本文介绍了DCRL,一种用于离线目标条件强化学习的分治方法,通过递归二叉树分解减少长期任务中的错误累积,在OGBench基准测试中实现了性能提升。
CHIME是一种信用感知分层记忆框架,它分离规划和执行记忆库,通过准确归因任务结果来提高长时域代理规划,并优于基线方法。