exploration

标签

Cards List
#exploration

@sheriyuo: Meta-RL 确实感觉是一个非常具有前景的方向

X AI KOLs Timeline · 3天前 缓存

一位研究者强调,Meta-RL 是训练 LLM 智能体的一个有前景的方向,将智能体训练重新构建为跨回合的元强化学习问题,从而实现主动探索和试错适应。

0 人收藏 0 人点赞
#exploration

@ethantsliu:meta-rl 引发代理式 LLM 探索 传统强化学习训练 LLM 代理使用固定策略,难以进行主动探索……

X AI KOLs Timeline · 4天前 缓存

一篇新的研究论文将 LLM 代理训练重新定义为跨回合的 Meta-RL 问题,使用无评论家策略梯度实现在上下文中的适应,而无需梯度更新。LAMER 框架在长时程任务上相比标准 RL 基线将测试时性能提升了 11-19%,并且能更好地泛化到未见过的环境。

0 人收藏 0 人点赞
#exploration

BODHI:LLM是否会分支并发现异质推理?

arXiv cs.CL · 4天前 缓存

本文研究了经过RLVR训练的LLM是否会分支以发现异质推理,通过迷宫求解实验和BODHI-Trees表明,策略熵坍缩伴随着语义分支熵的减少,从而限制了展开(rollout)的多样性。

0 人收藏 0 人点赞
#exploration

Big Walk 就像合作版的 Breath of the Wild

The Verge · 6天前 缓存

The Verge 评测了 House House 的最新合作冒险游戏 Big Walk,将其与 Breath of the Wild 进行比较,并称赞其以沟通驱动的探索与谜题设计。

0 人收藏 0 人点赞
#exploration

PIRL:从开环探索到闭环强化学习 [R]

Reddit r/MachineLearning · 2026-07-28

介绍了 PIRL(策略改进强化学习)及其实际实现 PIPO,这是一种闭环框架,通过将策略更新后的性能与历史锚点进行比较来验证更新效果,从而能够纠正或强化之前的更新。实验表明,在 PPO 和 GRPO 等现有强化学习算法之上应用时,在数学推理、代码生成、工具使用和自我蒸馏方面均有一致的提升。

0 人收藏 0 人点赞
#exploration

预期自由能作为rho-POMDPs的信念依赖效用

arXiv cs.AI · 2026-07-21 缓存

研究表明,最小化预期自由能(EFE)等价于求解一个以预期信息增益为效用且探索权重固定为1的ρ-POMDP。证明了在“先观测后决策”POMDP中的等价性,并将其扩展到因子化观测POMDP,实验表明未调优的权重与仅依赖奖励的规划相比效果相当或更优。

0 人收藏 0 人点赞
#exploration

PPO-HSC:一种基于广域策略覆盖优化的探索性强化学习框架

arXiv cs.AI · 2026-07-21 缓存

PPO-HSC引入了一种高阶采样覆盖奖励,以鼓励在LLM的强化学习微调中探索多样化的推理模式,从而在数学和代码任务上提升解决方案的多样性和状态空间覆盖。

0 人收藏 0 人点赞
#exploration

德国或已发现新的可再生能源来源

Hacker News Top · 2026-07-15 缓存

本文介绍了德国莱茵褐煤矿区两个勘探钻孔的地质和地球物理表征,这是评估中深层和深层地热储层作为替代魏斯韦勒燃煤电厂的可再生热源的初步工作的一部分。

0 人收藏 0 人点赞
#exploration

TopoExplore:面向存档探索的拓扑判别

arXiv cs.AI · 2026-07-14 缓存

TopoExplore 使用拓扑检测封闭区域来增强 Go-Explore,避免在密封区域浪费预算,在 MiniGrid 和 HM3D 环境中实现了加速。

0 人收藏 0 人点赞
#exploration

多智能体LLMs未能相互探索

Hugging Face Daily Papers · 2026-07-13 缓存

本文指出当前LLM智能体未能系统地探索同伴,导致协调不佳,并引入MACE,一个轻量级框架,使用上下文赌博机进行有效的同伴选择。

0 人收藏 0 人点赞
#exploration

提示驱动探索

arXiv cs.LG · 2026-07-13 缓存

本文介绍了提示驱动探索(PDE),一种利用视觉语言模型迭代优化强化学习策略的自然语言提示的方法,即使在零奖励起点也能实现全局探索和成功的策略学习。

0 人收藏 0 人点赞
#exploration

超越欧几里得裁剪:通过黎曼等距策略优化克服LLM强化学习中的探索崩溃

Hugging Face Daily Papers · 2026-07-11 缓存

本文揭示了PPO-Clipping使用欧几里得度量导致LLM强化学习中的探索崩溃,并提出了黎曼等距策略优化(RIPO)以确保几何一致的策略更新,在AIME24上比GRPO提升了高达60%。

0 人收藏 0 人点赞
#exploration

LingBot World Infinity,无限世界的实时探索

Reddit r/singularity · 2026-07-08

LingBot World Infinity 可实现无限虚拟世界的实时探索,可能由AI机器人助手驱动。

0 人收藏 0 人点赞
#exploration

TREK:蒸馏以探索,强化以精炼

Hugging Face Daily Papers · 2026-07-06 缓存

TREK是一种分阶段方法,利用蒸馏扩展探索支持以优化策略,在数学推理和智能体任务上超越标准GRPO的性能。

0 人收藏 0 人点赞
#exploration

@NASASpox: 在美国250岁生日之际,@NASA正在助力谱写探索的新篇章——新月球基地任务宣布…

X AI KOLs Following · 2026-07-03 缓存

NASA宣布了新的月球基地任务,完成了国际空间站太空行走,并正在进行Swift助推任务,突出了美国250岁生日的太空探索努力。

0 人收藏 0 人点赞
#exploration

基于互信息的多目标探索与偏好优化

arXiv cs.CL · 2026-07-03 缓存

提出MI-EPO,一种基于信息理论的多目标对齐框架,用于大型语言模型,通过互信息增强探索,确保生成的响应可区分且与不同偏好向量对齐,在冲突目标间实现稳定权衡。

0 人收藏 0 人点赞
#exploration

用于探索、净化和模型合并的谱重连方法

Hugging Face Daily Papers · 2026-07-03 缓存

本文提出SAR,一种无需训练的方法,将强化学习更新投影到谱空间中的紧凑推理核心上,从而实现净化、改进探索和更强的模型合并。

0 人收藏 0 人点赞
#exploration

ExTra:面向语言模型强化学习的探索性轨迹优化

arXiv cs.LG · 2026-06-25 缓存

ExTra 引入了面向语言模型强化学习的探索性轨迹优化,结合新颖性奖励和熵引导的前缀重生成,在数学推理基准上同时提升单样本准确率和推理时覆盖率。

0 人收藏 0 人点赞
#exploration

奖励作为具身世界模型的智能体

arXiv cs.AI · 2026-06-20 缓存

本文介绍了奖励作为智能体(Reward as an Agent)和DynDiff-GRPO,以解决具身世界模型中强化学习的奖励黑客攻击和有限探索问题,实现了显著的准确率提升。

0 人收藏 0 人点赞
#exploration

GraphPO:面向推理模型的基于图策略优化

arXiv cs.CL · 2026-06-18 缓存

GraphPO 是一种新颖的基于图的强化学习框架,它将轨迹表示为一个有向无环图,合并语义等价的推理路径,以减少冗余探索并改进大型推理模型的信用分配。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈