alpha-zero

标签

Cards List
#alpha-zero

@FrancoisChauba1: 如果你在(未排序列表、冒泡排序过程、已排序列表)的轨迹上进行训练,你永远无法通过测试时计算(TTC)达到…

X AI KOLs Following · 2026-05-26 缓存

一篇批评文章指出,在人类生成的数据上训练LLM限制了它们通过测试时计算发现新颖解决方案的能力,而真正的AGI需要模型能够像AlphaZero那样更广泛地探索假设空间。

0 人收藏 0 人点赞
#alpha-zero

MAPLE: 不完全信息游戏中AlphaZero的多状态聚合策略评估

arXiv cs.AI · 2026-05-26 缓存

本文介绍了MAPLE,一种树搜索方法,它聚合来自多个采样子世界状态的策略和价值评估,将AlphaZero扩展至不完全信息游戏。在Phantom Go和Dark Hex上的实验显示,与基于PIMC的AlphaZero基线相比,Elo分别提升了291和136。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈