exploration

标签

Cards List
#exploration

ExplorationBench:衡量AI系统在可验证外星世界中的探索能力

Hugging Face Daily Papers ↗ · 2天前 缓存

本文介绍了ExplorationBench,这是一个用于评估AI系统在可验证外星世界中探索能力的基准测试,通过提供可执行规则并防止从预训练数据中回忆,以应对科学发现中的挑战。

0 人收藏 0 人点赞
#exploration

MoE强化学习中的专家空间探索

arXiv cs.CL ↗ · 2026-09-14 缓存

本文提出ESRL,一种通过探索专家路由路径来增强混合专家模型训练的强化学习框架,从而在数学、科学和编程任务上取得性能提升。

0 人收藏 0 人点赞
#exploration

Show HN: 探索预测市场与社交媒体的交叉点

Hacker News Top ↗ · 2026-09-14

探索预测市场与社交媒体之间可能的交叉点,重点关注流行度可能发挥的作用。

0 人收藏 0 人点赞
#exploration

赋能氛围设计智能体的创意探索

Hugging Face Daily Papers ↗ · 2026-09-14 缓存

本文提出了一种方法,使氛围设计智能体能够通过结构化设计规范将探索与实现分离,从而探索多样化的UI替代方案。该方法在168个提示和一个超过30万任务的大型在线实验中进行了评估。

0 人收藏 0 人点赞
#exploration

从连接性到奖励:基于有向状态图的密集奖励学习

arXiv cs.LG ↗ · 2026-09-11 缓存

本文介绍了G2QDR框架,该框架利用有向状态图为目标条件分层强化学习生成密集奖励,提升在稀疏奖励环境中的性能。

0 人收藏 0 人点赞
#exploration

@yadong_xie: 最近一直在探索 agent 借助 web 技术来表达场景交互的界限在哪里 最后得到的答案是没有界限 光棱坦克,启动!

X AI KOLs Following ↗ · 2026-08-26 缓存

用户 yadong_xie 分享了关于 AI 代理借助 Web 技术表达场景交互的探索,结论是没有界限,并启动了名为'光棱坦克'的项目。

0 人收藏 0 人点赞
#exploration

EDGE:用于智能体强化学习中引导探索的经验蒸馏

arXiv cs.CL ↗ · 2026-08-25 缓存

EDGE 提出一种框架,通过经验蒸馏引导智能体强化学习中的探索,提升了在 ALFWorld 和 WebShop 等任务上的表现。

0 人收藏 0 人点赞
#exploration

PhysCaP:基于物理信息的探索,使代码即策略代理接地

Hugging Face Daily Papers ↗ · 2026-08-21 缓存

PhysCaP 是一个基于物理信息的代码生成代理,它通过主动探索物体来推断隐藏的物理属性,以实现高效的机器人操作。

0 人收藏 0 人点赞
#exploration

@Xudong07452910: 如果你最近在关注 AI Scientist,我很推荐这篇文章。 现在很多 Research Agent 还是先生成大量实验和假设,再让 Judge 选最好的。 做研究往往是一次失败以后,能不能知道自己哪里理解错了,还有哪些地方没探索过。 …

X AI KOLs Timeline ↗ · 2026-08-20 缓存

这篇文章推荐关注AI Scientist,并讨论研究代理如何通过类比模糊测试来学习失败,从而绘制未知地图并指导后续实验。

0 人收藏 0 人点赞
#exploration

EXIMO:VLM引导的VLA策略探索

Hugging Face Daily Papers ↗ · 2026-08-20 缓存

EXIMO 提出了一种高效的算法,用于微调VLA机器人策略,采用三阶段流程:VLM引导探索、模仿学习和残差强化学习,展示了样本效率和性能的提升。

0 人收藏 0 人点赞
#exploration

地下蕴藏着多少氢气?

MIT Technology Review ↗ · 2026-08-17 缓存

研究表明,地下地质氢可能是一种宝贵的零碳燃料来源,据估计储量巨大,且在基德克里克和布尔基泽等矿山取得了有前景的发现。然而,商业可行的开采仍是一项挑战,需要进一步探索以释放其潜力。

0 人收藏 0 人点赞
#exploration

基于内在动机的探索驱动个性化联邦强化学习

arXiv cs.LG ↗ · 2026-08-12 缓存

本文介绍了EDPFRL-IM,一个将好奇心驱动的内在动机融入个性化联邦强化学习的框架,以在稀疏奖励、非平稳环境中改进探索,同时保护客户隐私。

0 人收藏 0 人点赞
#exploration

@sheriyuo: Meta-RL 确实感觉是一个非常具有前景的方向

X AI KOLs Timeline ↗ · 2026-08-06 缓存

一位研究者强调,Meta-RL 是训练 LLM 智能体的一个有前景的方向,将智能体训练重新构建为跨回合的元强化学习问题,从而实现主动探索和试错适应。

0 人收藏 0 人点赞
#exploration

@ethantsliu:meta-rl 引发代理式 LLM 探索 传统强化学习训练 LLM 代理使用固定策略,难以进行主动探索……

X AI KOLs Timeline ↗ · 2026-08-06 缓存

一篇新的研究论文将 LLM 代理训练重新定义为跨回合的 Meta-RL 问题,使用无评论家策略梯度实现在上下文中的适应,而无需梯度更新。LAMER 框架在长时程任务上相比标准 RL 基线将测试时性能提升了 11-19%,并且能更好地泛化到未见过的环境。

0 人收藏 0 人点赞
#exploration

BODHI:LLM是否会分支并发现异质推理?

arXiv cs.CL ↗ · 2026-08-05 缓存

本文研究了经过RLVR训练的LLM是否会分支以发现异质推理,通过迷宫求解实验和BODHI-Trees表明,策略熵坍缩伴随着语义分支熵的减少,从而限制了展开(rollout)的多样性。

0 人收藏 0 人点赞
#exploration

Big Walk 就像合作版的 Breath of the Wild

The Verge ↗ · 2026-08-03 缓存

The Verge 评测了 House House 的最新合作冒险游戏 Big Walk,将其与 Breath of the Wild 进行比较,并称赞其以沟通驱动的探索与谜题设计。

0 人收藏 0 人点赞
#exploration

PIRL:从开环探索到闭环强化学习 [R]

Reddit r/MachineLearning ↗ · 2026-07-28

介绍了 PIRL(策略改进强化学习)及其实际实现 PIPO,这是一种闭环框架,通过将策略更新后的性能与历史锚点进行比较来验证更新效果,从而能够纠正或强化之前的更新。实验表明,在 PPO 和 GRPO 等现有强化学习算法之上应用时,在数学推理、代码生成、工具使用和自我蒸馏方面均有一致的提升。

0 人收藏 0 人点赞
#exploration

预期自由能作为rho-POMDPs的信念依赖效用

arXiv cs.AI ↗ · 2026-07-21 缓存

研究表明,最小化预期自由能(EFE)等价于求解一个以预期信息增益为效用且探索权重固定为1的ρ-POMDP。证明了在“先观测后决策”POMDP中的等价性,并将其扩展到因子化观测POMDP,实验表明未调优的权重与仅依赖奖励的规划相比效果相当或更优。

0 人收藏 0 人点赞
#exploration

PPO-HSC:一种基于广域策略覆盖优化的探索性强化学习框架

arXiv cs.AI ↗ · 2026-07-21 缓存

PPO-HSC引入了一种高阶采样覆盖奖励,以鼓励在LLM的强化学习微调中探索多样化的推理模式,从而在数学和代码任务上提升解决方案的多样性和状态空间覆盖。

0 人收藏 0 人点赞
#exploration

德国或已发现新的可再生能源来源

Hacker News Top ↗ · 2026-07-15 缓存

本文介绍了德国莱茵褐煤矿区两个勘探钻孔的地质和地球物理表征,这是评估中深层和深层地热储层作为替代魏斯韦勒燃煤电厂的可再生热源的初步工作的一部分。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈