@dair_ai:距离能自我生成世界知识的智能体还有多远?该研究提出一种基于结果的奖励,用于量化……

X AI KOLs Following 论文

摘要

一篇新论文提出了一种基于结果的奖励机制,可量化智能体自生成的世界知识对任务成功率的提升,使其在推理阶段无需外部指导即可持续改进。

距离能自我生成世界知识的智能体还有多远?该研究提出一种基于结果的奖励,用于衡量智能体自生成的世界知识实际提升了多少任务成功率。随后在推理阶段移除所有外部指导。结果:A
查看原文
查看缓存全文

缓存时间: 2026/04/23 05:41

我们距离能“自我生成世界知识”的智能体还有多远?本文提出了一种基于结果的奖励,衡量智能体自我生成的世界知识对其任务成功率的真实提升。推理阶段再移除外部引导。结果:A

相似文章

奖励作为具身世界模型的智能体

arXiv cs.AI

本文介绍了奖励作为智能体(Reward as an Agent)和DynDiff-GRPO,以解决具身世界模型中强化学习的奖励黑客攻击和有限探索问题,实现了显著的准确率提升。

通过世界知识探索训练LLM智能体实现自发、无奖励的自我进化

Hugging Face Daily Papers

# 论文页面 - 通过世界知识探索训练LLM智能体实现自发、无奖励的自我进化 来源:[https://huggingface.co/papers/2604.18131](https://huggingface.co/papers/2604.18131) ## 摘要 具备内在元进化能力的智能体通过在没有外部监督的情况下自主生成的世界知识,在网页导航任务中展现出更优的性能。如今大多数智能体通过遵循人类定义的奖励和规则来``自我进化''。然而,