reward-tilted-distribution

#reward-tilted-distribution

SMCEvolve：基于序贯蒙特卡洛演化的原则性科学发现

arXiv cs.AI ↗ · 2026-05-18 缓存

SMCEvolve 提出了一种原则性框架，用于 LLM 驱动的程序演化，通过将其重新表述为使用序贯蒙特卡洛从奖励倾斜分布中采样。它提供了收敛保证，并在多个科学发现基准测试中优于现有方法。

0 人收藏 0 人点赞