exploration

标签

Cards List
#exploration

TopoExplore:面向存档探索的拓扑判别

arXiv cs.AI ↗ · 2026-07-14 缓存

TopoExplore 使用拓扑检测封闭区域来增强 Go-Explore,避免在密封区域浪费预算,在 MiniGrid 和 HM3D 环境中实现了加速。

0 人收藏 0 人点赞
#exploration

多智能体LLMs未能相互探索

Hugging Face Daily Papers ↗ · 2026-07-13 缓存

本文指出当前LLM智能体未能系统地探索同伴,导致协调不佳,并引入MACE,一个轻量级框架,使用上下文赌博机进行有效的同伴选择。

0 人收藏 0 人点赞
#exploration

提示驱动探索

arXiv cs.LG ↗ · 2026-07-13 缓存

本文介绍了提示驱动探索(PDE),一种利用视觉语言模型迭代优化强化学习策略的自然语言提示的方法,即使在零奖励起点也能实现全局探索和成功的策略学习。

0 人收藏 0 人点赞
#exploration

超越欧几里得裁剪:通过黎曼等距策略优化克服LLM强化学习中的探索崩溃

Hugging Face Daily Papers ↗ · 2026-07-11 缓存

本文揭示了PPO-Clipping使用欧几里得度量导致LLM强化学习中的探索崩溃,并提出了黎曼等距策略优化(RIPO)以确保几何一致的策略更新,在AIME24上比GRPO提升了高达60%。

0 人收藏 0 人点赞
#exploration

LingBot World Infinity,无限世界的实时探索

Reddit r/singularity ↗ · 2026-07-08

LingBot World Infinity 可实现无限虚拟世界的实时探索,可能由AI机器人助手驱动。

0 人收藏 0 人点赞
#exploration

TREK:蒸馏以探索,强化以精炼

Hugging Face Daily Papers ↗ · 2026-07-06 缓存

TREK是一种分阶段方法,利用蒸馏扩展探索支持以优化策略,在数学推理和智能体任务上超越标准GRPO的性能。

0 人收藏 0 人点赞
#exploration

@NASASpox: 在美国250岁生日之际,@NASA正在助力谱写探索的新篇章——新月球基地任务宣布…

X AI KOLs Following ↗ · 2026-07-03 缓存

NASA宣布了新的月球基地任务,完成了国际空间站太空行走,并正在进行Swift助推任务,突出了美国250岁生日的太空探索努力。

0 人收藏 0 人点赞
#exploration

基于互信息的多目标探索与偏好优化

arXiv cs.CL ↗ · 2026-07-03 缓存

提出MI-EPO,一种基于信息理论的多目标对齐框架,用于大型语言模型,通过互信息增强探索,确保生成的响应可区分且与不同偏好向量对齐,在冲突目标间实现稳定权衡。

0 人收藏 0 人点赞
#exploration

用于探索、净化和模型合并的谱重连方法

Hugging Face Daily Papers ↗ · 2026-07-03 缓存

本文提出SAR,一种无需训练的方法,将强化学习更新投影到谱空间中的紧凑推理核心上,从而实现净化、改进探索和更强的模型合并。

0 人收藏 0 人点赞
#exploration

ExTra:面向语言模型强化学习的探索性轨迹优化

arXiv cs.LG ↗ · 2026-06-25 缓存

ExTra 引入了面向语言模型强化学习的探索性轨迹优化,结合新颖性奖励和熵引导的前缀重生成,在数学推理基准上同时提升单样本准确率和推理时覆盖率。

0 人收藏 0 人点赞
#exploration

奖励作为具身世界模型的智能体

arXiv cs.AI ↗ · 2026-06-20 缓存

本文介绍了奖励作为智能体(Reward as an Agent)和DynDiff-GRPO,以解决具身世界模型中强化学习的奖励黑客攻击和有限探索问题,实现了显著的准确率提升。

0 人收藏 0 人点赞
#exploration

GraphPO:面向推理模型的基于图策略优化

arXiv cs.CL ↗ · 2026-06-18 缓存

GraphPO 是一种新颖的基于图的强化学习框架,它将轨迹表示为一个有向无环图,合并语义等价的推理路径,以减少冗余探索并改进大型推理模型的信用分配。

0 人收藏 0 人点赞
#exploration

@svlevine: 流反转引导允许使用高层动作(例如来自VLM推理)来“引导”基于扩散的VLA。……

X AI KOLs Following ↗ · 2026-06-12 缓存

流反转引导能够使用高层动作(例如来自VLM推理)来引导基于扩散的视觉-语言-动作模型,并允许在扩散噪声空间中进行强化学习以实现任务探索。

0 人收藏 0 人点赞
#exploration

推理还是记忆?LLM强化学习中的方向感知多样性探索

arXiv cs.AI ↗ · 2026-06-10 缓存

本文介绍了DiRL,一种方向感知的强化学习框架,能够在LLM探索中区分推理驱动的多样性和记忆驱动的多样性。它从模型表示中提取内在的推理-记忆方向,并塑造奖励以优先考虑与推理一致的探索,在数学和通用推理基准上表现出改进。

0 人收藏 0 人点赞
#exploration

@rohanpaul_ai: AGI需要的是主动探索未知的智能体,而不仅仅是更好回答问题的模型。这篇新的大型(111页……

X AI KOLs Following ↗ · 2026-06-09 缓存

来自美国和中国顶尖实验室的一篇新综述论文提出,AGI需要智能体通过认知探索主动探索不确定性,并将其组织为AI进步的五个层次。

0 人收藏 0 人点赞
#exploration

@NielsRogge:所有4,361篇@iclr_conf 2026论文,包括Oral演讲和杰出论文,现可在PwC上探索!按任务分…

X AI KOLs Following ↗ · 2026-06-05 缓存

所有4,361篇ICLR 2026论文,包括Oral演讲和杰出论文,现可在Papers with Code上按任务浏览,任务范围从3D生成到GUI代理。

0 人收藏 0 人点赞
#exploration

你好!我制作了一个探索kokoro的工具。

Reddit r/LocalLLaMA ↗ · 2026-06-05

用户发布了一个开源工具来探索kokoro模型,代码在GitHub上,模型数据在HuggingFace上。

0 人收藏 0 人点赞
#exploration

基于重试的策略梯度强化学习中探索的涌现

arXiv cs.LG ↗ · 2026-06-02 缓存

本文提出ReMax,一种新的强化学习目标函数,通过基于多个样本的期望最大回报来评估策略,从而将探索作为涌现属性引入,无需显式的探索奖励。作者推导了策略梯度公式,并提出了RePPO,一种PPO变体,在MinAtar和Craftax基准测试上实现了高效探索。

0 人收藏 0 人点赞
#exploration

学习适应:基于认知感知探索的自我改进网络智能体

arXiv cs.AI ↗ · 2026-06-01 缓存

提出了SCALE框架,用于自我改进的网络智能体,采用认知感知探索,包含三个对抗角色和图探索策略。同时介绍了从真实网站收集的大规模数据集SCALE-20k,显著提升了基于MLLM的网络智能体的性能。

0 人收藏 0 人点赞
#exploration

破坏是学习生成的通用策略;扩散模型的优势在于认真对待;探索是未来

arXiv cs.LG ↗ · 2026-06-01 缓存

本文介绍了扩散模型作为一类技术的组成部分,这类技术会隐藏信息并训练模型猜测这些信息,认为扩散的破坏性方法灵活且具有优势,尤其在数据稀缺的场景下;文章还讨论了探索问题,并介绍了一种新型的概率图模型。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈