language-agents

标签

Cards List
#language-agents

记忆深度,而非记忆访问:面向长时间运行语言代理的选择性参数整合

arXiv cs.AI · 2026-06-26 缓存

本文针对长时间运行的语言代理引入了记忆深度的概念,将其与基于检索的记忆访问区分开来,并提出了EVAF——一种利用惊喜和效价门控LoRA更新的选择性参数整合机制。跨多个模型的实验表明,EVAF在上下文卸载后以极少的参数写入提高了目标持久性。

0 人收藏 0 人点赞
#language-agents

OPID: 同策略技能蒸馏用于智能体强化学习

Hugging Face Daily Papers · 2026-06-25 缓存

OPID提出了一种同策略技能蒸馏框架,从完成的轨迹中提取密集后见监督,将基于结果的强化学习与词元级自蒸馏相结合,以提高语言智能体在多轮任务上的训练效率和性能。

0 人收藏 0 人点赞
#language-agents

学会记住什么:面向长时域语言代理的基于约束优化的可观测性安全记忆保留

arXiv cs.AI · 2026-06-10 缓存

本文将为长时域语言代理的记忆保留公式化为一个约束随机优化问题,提出了OSL-MR框架,该框架通过混合评分启发式强制实施可观测性安全学习。实验表明,在严格记忆预算下,该方法始终优于现有的启发式基线。

0 人收藏 0 人点赞
#language-agents

空间记忆必须存储什么:遮挡作为语言代理记忆的测试

arXiv cs.AI · 2026-06-10 缓存

本文研究空间几何是否提升语言代理记忆回忆能力,证明几何必须主导回忆而非近因或重要性,并指出在3D体素世界中,射线追踪可见性谓词对于遮挡处理至关重要。

0 人收藏 0 人点赞
#language-agents

面向长程语言智能体可验证强化学习的策略条件化反事实信用

arXiv cs.LG · 2026-06-05 缓存

提出了CVT-RL,一种带有策略条件化反事实贡献估计和可验证奖励的约束策略梯度算法,提高了长程语言智能体的可靠性并减少了奖励篡改。

0 人收藏 0 人点赞
#language-agents

ArcANE:角色扮演语言智能体能否在恰当时间保持角色一致性?

Hugging Face Daily Papers · 2026-06-04 缓存

本文介绍ArcANE,一个自动构建的基准测试,用于评估角色扮演语言智能体在叙事阶段中与角色心理轨迹的一致性。研究表明,基于角色弧信息进行条件化能提升性能,尤其是在超出源文本的场景中。

0 人收藏 0 人点赞
#language-agents

AgentCL: 面向语言代理中持续学习的严谨评估

Hugging Face Daily Papers · 2026-06-02 缓存

提出了一个全面的评估框架,用于语言代理中的持续学习,强调受控任务流和记忆设计分析,以更好地评估可复用经验和学习稳定性。

0 人收藏 0 人点赞
#language-agents

语言代理的策略与世界模型协同训练

Hugging Face Daily Papers · 2026-06-01 缓存

本文介绍PaW,一种协同训练框架,在在线策略强化学习(on-policy RL)轨迹中向策略学习添加辅助世界模型监督,无需额外计算开销即可改进语言代理的训练。

0 人收藏 0 人点赞
#language-agents

LiteCoder-Terminal:扩展用于学习语言智能体的长程终端环境

Hugging Face Daily Papers · 2026-05-28 缓存

LiteCoder-Terminal-Gen 引入了一种零依赖的合成管道,可生成可执行的终端训练环境,并产出 SFT 和 RL 数据集,使语言智能体在 Terminal Bench 基准测试上取得显著的性能提升。

0 人收藏 0 人点赞
#language-agents

RICE-PO:将检索交互转化为推理代理的信用信号

arXiv cs.CL · 2026-05-27 缓存

RICE-PO 是一个无需评判器的策略优化框架,它将检索交互转化为局部化信用信号,用于训练推理代理。在相同检索器设置下,该框架在 BRIGHT 和 BEIR 基准测试中持续优于基于提示的代理和基于组的强化学习基线。

0 人收藏 0 人点赞
#language-agents

从原始经验到技能消费:模型生成智能体技能的系统研究

Hugging Face Daily Papers · 2026-05-22 缓存

本文系统评估了语言智能体的模型生成技能,涵盖经验生成、提取和消耗的完整生命周期,发现技能平均有益但存在显著的负迁移,从而引出一种提高技能质量的元技能。

0 人收藏 0 人点赞
#language-agents

Auto-Dreamer:语言代理的离线记忆整合学习

arXiv cs.CL · 2026-05-21 缓存

Auto-Dreamer 提出了一种针对语言代理的离线记忆整合学习方法,将快速记忆获取与慢速跨会话整合解耦,以更小的记忆库实现更高性能,并泛化到未见环境。

0 人收藏 0 人点赞
#language-agents

@tom_doerr: 用于数据分析、插件和网页浏览的AI智能体 https://github.com/xlang-ai/OpenAgents…

X AI KOLs Timeline · 2026-05-15 缓存

OpenAgents 是一个开放平台,用于在日常生活中使用和托管语言智能体,提供数据分析、插件和网页浏览等智能体功能,并开放代码和演示。

0 人收藏 0 人点赞
#language-agents

@tom_doerr: 使用强化学习构建自定义AI代理 https://github.com/agentica-project/rllm…

X AI KOLs Timeline · 2026-05-14 缓存

rLLM 是一个开源框架,通过强化学习对语言代理进行后训练,其发布的重要模型如 DeepSWE-Preview 和 DeepCoder-14B-Preview 取得了最先进的结果。

0 人收藏 0 人点赞
#language-agents

面向长视界语言智能体的里程碑引导策略学习

arXiv cs.CL · 2026-05-08 缓存

本文介绍了 BEACON,这是一种旨在改善长视界语言智能体的信用分配和采样效率的里程碑引导策略学习框架。在 ALFWorld、WebShop 和 ScienceWorld 等基准测试上,该框架表现出显著优于 GRPO 和 GiGPO 的性能提升。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈