monte-carlo-tree-search

标签

Cards List
#monte-carlo-tree-search

Learning to Run Power Networks: Effective AlphaZero-inspired Topological Control

arXiv cs.LG · 7小时前 缓存

This paper evaluates AlphaZero-inspired reinforcement learning for topological control in power networks, achieving 98.43% survivability and emphasizing the effectiveness of minimalist integration with domain heuristics.

0 人收藏 0 人点赞
#monte-carlo-tree-search

FlowScout:从执行反馈到可靠的工具使用智能体工作流

arXiv cs.LG · 5天前 缓存

FlowScout 是一个框架,能够从历史任务解决记录中自动生成集成工具智能体工作流,利用由执行反馈引导的蒙特卡洛树搜索。实验表明,与基线方法相比,它提高了工具调用正确性和执行分数。

0 人收藏 0 人点赞
#monte-carlo-tree-search

CEDAR:智能体编排的树搜索用于复杂系统的目标导向优化

arXiv cs.AI · 2026-08-10 缓存

介绍了CEDAR,一种自主方法,利用LLM智能体结合蒙特卡洛树搜索来发现满足用户指定行为目标的复杂系统,减少了人工投入,并实现了目标导向的设计。

0 人收藏 0 人点赞
#monte-carlo-tree-search

基于蒙特卡洛树搜索的表格到多模态报告生成

arXiv cs.AI · 2026-08-06 缓存

介绍了MCTS-Report,一种基于蒙特卡洛树搜索的框架,用于从表格数据生成多模态报告,同时提出了MMRBench基准。它在结构完整性、数值准确性、图表-文本对齐和洞察新颖性方面优于强基线。

0 人收藏 0 人点赞
#monte-carlo-tree-search

基于蒙特卡洛树搜索的多智能体系统自主修复

arXiv cs.LG · 2026-08-03 缓存

本文提出MARS,一种基于蒙特卡洛树搜索的多智能体系统自主修复框架,以及StateMAS,一个包含1,310条故障轨迹的基准。实验表明,MARS在修复准确率上 consistently 优于现有方法,且 token 成本相当。

0 人收藏 0 人点赞
#monte-carlo-tree-search

围棋中基于信念引导与不确定性门控的决策

arXiv cs.AI · 2026-07-31 缓存

本文提出了一种用于计算机围棋的信念引导架构,用信念头(Belief head)和门控机制取代沉重的MCTS,以减少幻觉,并在消费级硬件上实现职业级水平。

0 人收藏 0 人点赞
#monte-carlo-tree-search

Kernel Forge:一个基于LLM的CUDA内核生成与优化智能体框架

arXiv cs.AI · 2026-07-29 缓存

Kernel Forge是一个开源智能体框架,利用大语言模型和蒙特卡洛树搜索,为任何未经修改的PyTorch模型自动生成并优化CUDA内核,在Gemma 4 E2B的softmax上实现了高达2.83倍的加速。

0 人收藏 0 人点赞
#monte-carlo-tree-search

宣布 Fugu-Ultra v1.1 发布 🐡(1分钟阅读)

TLDR AI · 2026-07-24 缓存

Sakana AI 推出 AB-MCTS,一种新的推理时扩展算法,允许多个前沿 AI 模型协同工作,显著提升在 ARC-AGI-2 基准上的性能。

0 人收藏 0 人点赞
#monte-carlo-tree-search

EXPLORE: 使用语言模型进行模拟拓扑生成的引导式搜索探索

arXiv cs.LG · 2026-07-16 缓存

本文提出了EXPLORE,一个将模拟器引导的蒙特卡洛树搜索与基于Transformer的解码相结合的框架,用于模拟拓扑生成,在6组件基准测试中实现了65%的成功率,显著优于一次性生成和采样-过滤基线。

0 人收藏 0 人点赞
#monte-carlo-tree-search

演示TOFFEE:一个大规模合成数据代理轨迹的学习系统

arXiv cs.AI · 2026-07-08 缓存

TOFFEE是一个系统,它采用带有自适应模型选择和跨任务前缀重用的蒙特卡洛树搜索(Monte Carlo Tree Search),大规模合成高质量的数据代理轨迹。这些轨迹可用于微调或上下文学习,以提升数据代理在异构企业环境中的性能。

0 人收藏 0 人点赞
#monte-carlo-tree-search

寻找思考的时间:实时强化学习中的规划预算学习

arXiv cs.LG · 2026-06-26 缓存

本文引入了可变延迟实时强化学习,其中智能体决定在环境持续运行的情况下需要多长时间的思考,并提出了一种轻量级的门控策略来选择基于状态的规划预算,在多个实时游戏中优于固定预算和启发式基线。

0 人收藏 0 人点赞
#monte-carlo-tree-search

像人类一样优化CUDA:微剖析工具作为基于LLM的GPU内核优化的专家替代

arXiv cs.LG · 2026-06-26 缓存

KernelPro是一个闭环多智能体系统,利用LLM和微剖析工具自动优化GPU内核代码,在KernelBench上实现了2.42×/4.69×/5.30×的几何平均加速,并在相同速度下实测能耗降低11.6%。

0 人收藏 0 人点赞
#monte-carlo-tree-search

面向组合几何极值问题的几何感知MCTS

arXiv cs.AI · 2026-06-26 缓存

本文提出了一种几何感知的蒙特卡洛树搜索框架,用于在n×n网格上求解极值组合几何问题,在六个测试问题中的五个上取得了新的最佳已知结果,包括对No-Three-in-Line问题的改进。

0 人收藏 0 人点赞
#monte-carlo-tree-search

MODE-RAG:流形异常诊断与基于能量的检索增强生成评估

arXiv cs.CL · 2026-06-17 缓存

介绍了MODE-RAG,一个多智能体系统,利用变分自由能和蒙特卡洛树搜索动态门控干预,以减轻多模态检索增强生成系统中的幻觉,同时提供了ModeVent评估数据集。

0 人收藏 0 人点赞
#monte-carlo-tree-search

通过自我对弈发现格基约简策略

arXiv cs.LG · 2026-06-16 缓存

本文提出Delta-Star,一种采用AlphaZero风格自我对弈的深度强化学习方法,通过与LLL算法的原始操作交互,发现更优的格基约简策略。学习到的策略无需重新训练即可泛化到更高维度和未见过的模数。

0 人收藏 0 人点赞
#monte-carlo-tree-search

StarOR: 协同树搜索与测试时强化学习的优化建模

arXiv cs.LG · 2026-06-16 缓存

StarOR 提出了一种框架,将蒙特卡洛树搜索与测试时强化学习协同用于自动优化建模,在多个基准测试中取得了最先进的性能。

0 人收藏 0 人点赞
#monte-carlo-tree-search

用于 Monte Carlo Tree Search 规划的因果对象中心模型

arXiv cs.AI · 2026-06-15 缓存

COMET 是一种基于模型的强化学习算法,结合了冻结的对象中心编码器、基于 Transformer 的世界模型和 Monte Carlo Tree Search,通过因果注意力聚焦于任务相关对象,在视觉强化学习基准上取得了更高分数。

0 人收藏 0 人点赞
#monte-carlo-tree-search

随机极小极大树的双保真度最优动作识别

Hugging Face Daily Papers · 2026-06-01 缓存

本文提出了2FFS,一种双保真度树搜索算法,该算法在随机极小极大树中自适应地平衡廉价但有偏差的评估与昂贵但准确的评估,用于固定置信度的最优动作识别,具有理论保证和实验效率提升。

0 人收藏 0 人点赞
#monte-carlo-tree-search

AlphaTransit:学习设计城市规模的公交线路

Hugging Face Daily Papers · 2026-05-27 缓存

AlphaTransit 结合蒙特卡洛树搜索与神经策略-价值网络,通过预测下游质量而无需模拟器 rollout,从而优化公交线路设计。在 Bloomington 公交基准上,它实现了显著的服务率提升。

0 人收藏 0 人点赞
#monte-carlo-tree-search

@Michaelzsguo: 这是我最近看到的关于强化学习基础,以及它和现代 AI 关系的最好深度讨论之一。 Eric Jang 和 Dwarkesh 把一个看起来有点复古的练习,也就是用今天的工具重新构建 AlphaGo,变成了一堂非常清晰的大师课:为什么“搜索 +…

X AI KOLs Timeline · 2026-05-15 缓存

A detailed discussion on reinforcement learning and its connection to modern AI, using the reconstruction of AlphaGo with modern tools as a clear example of search and self-play. Key takeaways include neural network amortization of search, credit assignment challenges in LLMs vs AlphaGo, and implications for automated research.

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈