标签
ChessLFM,一个AI模型,已被置于热门国际象棋平台 Lichess 的主页上,该模型的种子数据正是在此收集的。
一项系统映射研究,分析了人类、引擎和语言模型在国际象棋研究中的应用,以识别战略推理中的差距和未来方向。
已开发名为ChessInsights AI的浏览器扩展,使用100%客户端计算机视觉进行实时棋盘检测与分析,通过在本地处理所有数据确保隐私,无需服务器上传。
本文介绍了 LLAMIA-Bench 和一种称为潜在状态内化的方法,以增强语言模型与非语言代理之间的协作,表明内化连续表示优于口头化,并与前沿模型如 GPT-5.1 相匹配。
本文介绍了LLAMIA-Bench,一个用于语言模型和非语言代理之间协作棋类任务的基准,并提出了潜在状态内化方法以超越基于文本的表述,其中14B模型匹配或超越了如GPT-5.1等前沿模型。
Chess.com推出了Gambit,一个免费的在线扑克网站,强调学习和社交游戏,没有真钱赌博,并计划扩展到更多经典游戏。
本文利用离线强化学习自动生成高质量的国际象棋谜题,基于来自Chess.com和Lichess等平台的广泛用户数据,提升对初学者的教学价值。
chessformer_lens 的一个演示表明,消融国际象棋 transformer 中的一个注意力头,会导致模型停止识别 Morphy 的后牺牲,这展示了特定能力集中在单个注意力头中。
Otter是一个1530万参数的人类国际象棋AI,通过在马亚2的基础上增加对棋局历史和时间压力的条件化移动预测,以更少的参数实现了比Maia 2更高的准确性。它在来自Lichess对局的61亿个局面位置上训练,表明将国际象棋视为一种具有时间感知的序列活动可以改善对人类对弈的预测。
本文介绍了ACT-Eval,一个用于LLM国际象棋评论的工具增强评估框架,并发布了包含325个局面-走法对的基准数据集。研究发现,事实性幻觉在LLM国际象棋评论中仍然普遍存在,而工具增强能够提高事实正确性,但并未提升专家级战略覆盖度。
反思深蓝1997年战胜卡斯帕罗夫并未损害国际象棋,反而提高了人们对国际象棋的兴趣,并产生了更多职业棋手。
本视频构建了一个国际象棋模拟器,用谜题和锦标赛测试多个 LLM 的推理能力,结果显示 Gemini 3.1 夺冠,而开源模型与顶级闭源模型之间存在明显差距。
研究人员研究了强化学习(RL)与预训练质量之间的相互作用,表明预训练更强的模型从RL中获益更多,且RL无法完全弥补弱预训练的不足。还确定了预训练和后训练计算分配的联合缩放定律。
本文以国际象棋作为受控测试平台,研究了预训练与强化学习(RL)后训练之间的关系。它建立了连接预训练损失与后RL性能的缩放定律,并表明RL在简单谜题上放大了正确的走法,同时在困难谜题上浮现出新的正确走法。
本文研究了预训练选择(模型大小、数据)如何影响在推理任务上通过强化学习后训练的回报,使用国际象棋作为受控测试平台。研究发现,后训练性能可由预训练损失很好地预测,并且强化学习在简单谜题上放大正确走法,在困难谜题上揭示出正确走法,这些发现也迁移到数学领域。
构建了“Kibitz”,一个用于国际象棋直播的人类走法预测器,在RTX 5080上训练,并利用Hermes、Stripe和NVIDIA AI Nemotron将其运营自动化,作为一个业务参加黑客马拉松。
提出了DD-Elo,一种通过漂移扩散模型整合步级数据以加速技能评估和评级适应的国际象棋评级系统,同时保持与传统Elo的一致性。
一项非正式实验使用棋盘揭示了视觉语言模型尽管能正确识别棋子,但在空间推理和精确结构化输出方面常常失败,突显了VLM评估中的一个关键差距。