标签
This paper evaluates AlphaZero-inspired reinforcement learning for topological control in power networks, achieving 98.43% survivability and emphasizing the effectiveness of minimalist integration with domain heuristics.
FlowScout 是一个框架,能够从历史任务解决记录中自动生成集成工具智能体工作流,利用由执行反馈引导的蒙特卡洛树搜索。实验表明,与基线方法相比,它提高了工具调用正确性和执行分数。
介绍了CEDAR,一种自主方法,利用LLM智能体结合蒙特卡洛树搜索来发现满足用户指定行为目标的复杂系统,减少了人工投入,并实现了目标导向的设计。
介绍了MCTS-Report,一种基于蒙特卡洛树搜索的框架,用于从表格数据生成多模态报告,同时提出了MMRBench基准。它在结构完整性、数值准确性、图表-文本对齐和洞察新颖性方面优于强基线。
本文提出MARS,一种基于蒙特卡洛树搜索的多智能体系统自主修复框架,以及StateMAS,一个包含1,310条故障轨迹的基准。实验表明,MARS在修复准确率上 consistently 优于现有方法,且 token 成本相当。
本文提出了一种用于计算机围棋的信念引导架构,用信念头(Belief head)和门控机制取代沉重的MCTS,以减少幻觉,并在消费级硬件上实现职业级水平。
Kernel Forge是一个开源智能体框架,利用大语言模型和蒙特卡洛树搜索,为任何未经修改的PyTorch模型自动生成并优化CUDA内核,在Gemma 4 E2B的softmax上实现了高达2.83倍的加速。
Sakana AI 推出 AB-MCTS,一种新的推理时扩展算法,允许多个前沿 AI 模型协同工作,显著提升在 ARC-AGI-2 基准上的性能。
本文提出了EXPLORE,一个将模拟器引导的蒙特卡洛树搜索与基于Transformer的解码相结合的框架,用于模拟拓扑生成,在6组件基准测试中实现了65%的成功率,显著优于一次性生成和采样-过滤基线。
TOFFEE是一个系统,它采用带有自适应模型选择和跨任务前缀重用的蒙特卡洛树搜索(Monte Carlo Tree Search),大规模合成高质量的数据代理轨迹。这些轨迹可用于微调或上下文学习,以提升数据代理在异构企业环境中的性能。
本文引入了可变延迟实时强化学习,其中智能体决定在环境持续运行的情况下需要多长时间的思考,并提出了一种轻量级的门控策略来选择基于状态的规划预算,在多个实时游戏中优于固定预算和启发式基线。
KernelPro是一个闭环多智能体系统,利用LLM和微剖析工具自动优化GPU内核代码,在KernelBench上实现了2.42×/4.69×/5.30×的几何平均加速,并在相同速度下实测能耗降低11.6%。
本文提出了一种几何感知的蒙特卡洛树搜索框架,用于在n×n网格上求解极值组合几何问题,在六个测试问题中的五个上取得了新的最佳已知结果,包括对No-Three-in-Line问题的改进。
介绍了MODE-RAG,一个多智能体系统,利用变分自由能和蒙特卡洛树搜索动态门控干预,以减轻多模态检索增强生成系统中的幻觉,同时提供了ModeVent评估数据集。
本文提出Delta-Star,一种采用AlphaZero风格自我对弈的深度强化学习方法,通过与LLL算法的原始操作交互,发现更优的格基约简策略。学习到的策略无需重新训练即可泛化到更高维度和未见过的模数。
StarOR 提出了一种框架,将蒙特卡洛树搜索与测试时强化学习协同用于自动优化建模,在多个基准测试中取得了最先进的性能。
COMET 是一种基于模型的强化学习算法,结合了冻结的对象中心编码器、基于 Transformer 的世界模型和 Monte Carlo Tree Search,通过因果注意力聚焦于任务相关对象,在视觉强化学习基准上取得了更高分数。
本文提出了2FFS,一种双保真度树搜索算法,该算法在随机极小极大树中自适应地平衡廉价但有偏差的评估与昂贵但准确的评估,用于固定置信度的最优动作识别,具有理论保证和实验效率提升。
AlphaTransit 结合蒙特卡洛树搜索与神经策略-价值网络,通过预测下游质量而无需模拟器 rollout,从而优化公交线路设计。在 Bloomington 公交基准上,它实现了显著的服务率提升。
A detailed discussion on reinforcement learning and its connection to modern AI, using the reconstruction of AlphaGo with modern tools as a clear example of search and self-play. Key takeaways include neural network amortization of search, credit assignment challenges in LLMs vs AlphaGo, and implications for automated research.