monte-carlo-tree-search

标签

Cards List
#monte-carlo-tree-search

随机极小极大树的双保真度最优动作识别

Hugging Face Daily Papers ↗ · 2026-06-01 缓存

本文提出了2FFS,一种双保真度树搜索算法,该算法在随机极小极大树中自适应地平衡廉价但有偏差的评估与昂贵但准确的评估,用于固定置信度的最优动作识别,具有理论保证和实验效率提升。

0 人收藏 0 人点赞
#monte-carlo-tree-search

AlphaTransit:学习设计城市规模的公交线路

Hugging Face Daily Papers ↗ · 2026-05-27 缓存

AlphaTransit 结合蒙特卡洛树搜索与神经策略-价值网络,通过预测下游质量而无需模拟器 rollout,从而优化公交线路设计。在 Bloomington 公交基准上,它实现了显著的服务率提升。

0 人收藏 0 人点赞
#monte-carlo-tree-search

@Michaelzsguo: 这是我最近看到的关于强化学习基础,以及它和现代 AI 关系的最好深度讨论之一。 Eric Jang 和 Dwarkesh 把一个看起来有点复古的练习,也就是用今天的工具重新构建 AlphaGo,变成了一堂非常清晰的大师课:为什么“搜索 +…

X AI KOLs Timeline ↗ · 2026-05-15 缓存

A detailed discussion on reinforcement learning and its connection to modern AI, using the reconstruction of AlphaGo with modern tools as a clear example of search and self-play. Key takeaways include neural network amortization of search, credit assignment challenges in LLMs vs AlphaGo, and implications for automated research.

0 人收藏 0 人点赞
#monte-carlo-tree-search

Building AlphaGo from scratch – Eric Jang

Reddit r/singularity ↗ · 2026-05-15 缓存

Eric Jang 从头重建了 AlphaGo 并详细解释了蒙特卡洛树搜索和深度学习在围棋中的应用,展示了当前低成本复现强力围棋AI的可行性。

0 人收藏 0 人点赞
#monte-carlo-tree-search

@dwarkesh_sp: 与 @ericjang11 的新黑板讲座:他演示了如何用现代AI工具从头构建AlphaGo。一些…

X AI KOLs Timeline ↗ · 2026-05-15

Eric Jang的黑板讲座逐步讲解了如何使用现代AI工具从零构建AlphaGo,涵盖了强化学习、蒙特卡洛树搜索、自我对弈,并与LLM训练相联系,同时讨论了自动化AI研究。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈