language-agents

标签

Cards List
#language-agents

@tom_doerr: 使用强化学习构建自定义AI代理 https://github.com/agentica-project/rllm…

X AI KOLs Timeline ↗ · 2026-05-14 缓存

rLLM 是一个开源框架,通过强化学习对语言代理进行后训练,其发布的重要模型如 DeepSWE-Preview 和 DeepCoder-14B-Preview 取得了最先进的结果。

0 人收藏 0 人点赞
#language-agents

面向长视界语言智能体的里程碑引导策略学习

arXiv cs.CL ↗ · 2026-05-08 缓存

本文介绍了 BEACON,这是一种旨在改善长视界语言智能体的信用分配和采样效率的里程碑引导策略学习框架。在 ALFWorld、WebShop 和 ScienceWorld 等基准测试上,该框架表现出显著优于 GRPO 和 GiGPO 的性能提升。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈