标签
TurnOPD 引入了回合级别的预算机制用于长程智能体的在线策略蒸馏,通过自适应 rollout 深度和渐进式回合归一化损失预算解决了传统 OPD 的低效问题,在相同训练预算下实现了更高的准确性。
本文介绍了“循环中的记忆”,其中语言智能体在每个推理步骤中反复访问进程内关联存储。通过使用快速(约100微秒)的进程内存储,每一步的检索成本相比网络存储降低了三个数量级,消除了冗余操作,并提升了GPT-5类模型的召回率。
研究语言智能体在长期任务中世界模型塌缩的相变现象,发现状态负载和依赖密度等参数在临界点附近导致模型突然崩溃,而非逐渐退化。
本文研究了在多轮语言智能体场景中,自然语言反馈带来的改进是否超越了仅靠反复尝试所取得的提升。通过跨多个基准测试的受控学生-教师协议,作者发现自我生成的反馈几乎没有额外增益,而强大的外部教师则能带来显著更大的提升,并且学生根据反馈采取行动的能力是关键瓶颈。
本文介绍了ATOD,一种结合在线策略蒸馏和强化学习的混合在线蒸馏算法,用于在多轮任务中训练小型语言模型智能体,其特点是采用退火OPD-RL调度和轮次级分歧-不确定性重新加权,以改善密集监督。
本文介绍了基于迭代语言规划(GILP),一种将小型参数化世界模型与基于LLM的推理相结合的方法,以减少LLM代理中的幻觉传播。实验表明,在图结构规划基准上,GILP将幻觉状态率从0.176降低到0.035,并将任务成功率从0.668提高到0.838。
OPID 是一个框架,它从完成的在线策略轨迹中提取密集的词元级监督信号,用于语言智能体的强化学习,通过分层技能(情节级和步骤级)来提高样本效率和鲁棒性。
本文针对长时间运行的语言代理引入了记忆深度的概念,将其与基于检索的记忆访问区分开来,并提出了EVAF——一种利用惊喜和效价门控LoRA更新的选择性参数整合机制。跨多个模型的实验表明,EVAF在上下文卸载后以极少的参数写入提高了目标持久性。
OPID提出了一种同策略技能蒸馏框架,从完成的轨迹中提取密集后见监督,将基于结果的强化学习与词元级自蒸馏相结合,以提高语言智能体在多轮任务上的训练效率和性能。
本文将为长时域语言代理的记忆保留公式化为一个约束随机优化问题,提出了OSL-MR框架,该框架通过混合评分启发式强制实施可观测性安全学习。实验表明,在严格记忆预算下,该方法始终优于现有的启发式基线。
本文研究空间几何是否提升语言代理记忆回忆能力,证明几何必须主导回忆而非近因或重要性,并指出在3D体素世界中,射线追踪可见性谓词对于遮挡处理至关重要。
提出了CVT-RL,一种带有策略条件化反事实贡献估计和可验证奖励的约束策略梯度算法,提高了长程语言智能体的可靠性并减少了奖励篡改。
本文介绍ArcANE,一个自动构建的基准测试,用于评估角色扮演语言智能体在叙事阶段中与角色心理轨迹的一致性。研究表明,基于角色弧信息进行条件化能提升性能,尤其是在超出源文本的场景中。
提出了一个全面的评估框架,用于语言代理中的持续学习,强调受控任务流和记忆设计分析,以更好地评估可复用经验和学习稳定性。
本文介绍PaW,一种协同训练框架,在在线策略强化学习(on-policy RL)轨迹中向策略学习添加辅助世界模型监督,无需额外计算开销即可改进语言代理的训练。
LiteCoder-Terminal-Gen 引入了一种零依赖的合成管道,可生成可执行的终端训练环境,并产出 SFT 和 RL 数据集,使语言智能体在 Terminal Bench 基准测试上取得显著的性能提升。
RICE-PO 是一个无需评判器的策略优化框架,它将检索交互转化为局部化信用信号,用于训练推理代理。在相同检索器设置下,该框架在 BRIGHT 和 BEIR 基准测试中持续优于基于提示的代理和基于组的强化学习基线。
本文系统评估了语言智能体的模型生成技能,涵盖经验生成、提取和消耗的完整生命周期,发现技能平均有益但存在显著的负迁移,从而引出一种提高技能质量的元技能。
Auto-Dreamer 提出了一种针对语言代理的离线记忆整合学习方法,将快速记忆获取与慢速跨会话整合解耦,以更小的记忆库实现更高性能,并泛化到未见环境。
OpenAgents 是一个开放平台,用于在日常生活中使用和托管语言智能体,提供数据分析、插件和网页浏览等智能体功能,并开放代码和演示。