标签
本文介绍了ExplorationBench,这是一个用于评估AI系统在可验证外星世界中探索能力的基准测试,通过提供可执行规则并防止从预训练数据中回忆,以应对科学发现中的挑战。
本文提出ESRL,一种通过探索专家路由路径来增强混合专家模型训练的强化学习框架,从而在数学、科学和编程任务上取得性能提升。
本文提出了一种方法,使氛围设计智能体能够通过结构化设计规范将探索与实现分离,从而探索多样化的UI替代方案。该方法在168个提示和一个超过30万任务的大型在线实验中进行了评估。
本文介绍了G2QDR框架,该框架利用有向状态图为目标条件分层强化学习生成密集奖励,提升在稀疏奖励环境中的性能。
用户 yadong_xie 分享了关于 AI 代理借助 Web 技术表达场景交互的探索,结论是没有界限,并启动了名为'光棱坦克'的项目。
EDGE 提出一种框架,通过经验蒸馏引导智能体强化学习中的探索,提升了在 ALFWorld 和 WebShop 等任务上的表现。
PhysCaP 是一个基于物理信息的代码生成代理,它通过主动探索物体来推断隐藏的物理属性,以实现高效的机器人操作。
这篇文章推荐关注AI Scientist,并讨论研究代理如何通过类比模糊测试来学习失败,从而绘制未知地图并指导后续实验。
EXIMO 提出了一种高效的算法,用于微调VLA机器人策略,采用三阶段流程:VLM引导探索、模仿学习和残差强化学习,展示了样本效率和性能的提升。
研究表明,地下地质氢可能是一种宝贵的零碳燃料来源,据估计储量巨大,且在基德克里克和布尔基泽等矿山取得了有前景的发现。然而,商业可行的开采仍是一项挑战,需要进一步探索以释放其潜力。
本文介绍了EDPFRL-IM,一个将好奇心驱动的内在动机融入个性化联邦强化学习的框架,以在稀疏奖励、非平稳环境中改进探索,同时保护客户隐私。
一位研究者强调,Meta-RL 是训练 LLM 智能体的一个有前景的方向,将智能体训练重新构建为跨回合的元强化学习问题,从而实现主动探索和试错适应。
一篇新的研究论文将 LLM 代理训练重新定义为跨回合的 Meta-RL 问题,使用无评论家策略梯度实现在上下文中的适应,而无需梯度更新。LAMER 框架在长时程任务上相比标准 RL 基线将测试时性能提升了 11-19%,并且能更好地泛化到未见过的环境。
本文研究了经过RLVR训练的LLM是否会分支以发现异质推理,通过迷宫求解实验和BODHI-Trees表明,策略熵坍缩伴随着语义分支熵的减少,从而限制了展开(rollout)的多样性。
The Verge 评测了 House House 的最新合作冒险游戏 Big Walk,将其与 Breath of the Wild 进行比较,并称赞其以沟通驱动的探索与谜题设计。
介绍了 PIRL(策略改进强化学习)及其实际实现 PIPO,这是一种闭环框架,通过将策略更新后的性能与历史锚点进行比较来验证更新效果,从而能够纠正或强化之前的更新。实验表明,在 PPO 和 GRPO 等现有强化学习算法之上应用时,在数学推理、代码生成、工具使用和自我蒸馏方面均有一致的提升。
研究表明,最小化预期自由能(EFE)等价于求解一个以预期信息增益为效用且探索权重固定为1的ρ-POMDP。证明了在“先观测后决策”POMDP中的等价性,并将其扩展到因子化观测POMDP,实验表明未调优的权重与仅依赖奖励的规划相比效果相当或更优。
PPO-HSC引入了一种高阶采样覆盖奖励,以鼓励在LLM的强化学习微调中探索多样化的推理模式,从而在数学和代码任务上提升解决方案的多样性和状态空间覆盖。
本文介绍了德国莱茵褐煤矿区两个勘探钻孔的地质和地球物理表征,这是评估中深层和深层地热储层作为替代魏斯韦勒燃煤电厂的可再生热源的初步工作的一部分。