reward-tilted-distribution

标签

Cards List
#reward-tilted-distribution

SMCEvolve:基于序贯蒙特卡洛演化的原则性科学发现

arXiv cs.AI · 2026-05-18 缓存

SMCEvolve 提出了一种原则性框架,用于 LLM 驱动的程序演化,通过将其重新表述为使用序贯蒙特卡洛从奖励倾斜分布中采样。它提供了收敛保证,并在多个科学发现基准测试中优于现有方法。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈