面向科学发现的评测驱动扩展
摘要
SimpleTES 框架将评测驱动的发现循环扩展到 21 个科学问题,在 LASSO 上实现 2× 加速,量子门数量减少 24.5%,并发现新的 Erdos 构造,同时支持轨迹级模型后训练。
查看缓存全文
缓存时间: 2026/04/22 06:17
论文页面 - 面向科学发现的评测驱动扩展
来源:https://huggingface.co/papers/2604.19341
作者:,,,,,,,,,,,,,,,,,,,,
摘要
SimpleTES 框架通过并行探索与反馈驱动的迭代,在科学问题上规模化评测驱动的发现闭环,在多个领域取得 SOTA 结果。
语言模型越来越多地用于科学发现:生成假设、提出候选方案、实现系统并持续迭代。试错闭环的核心是评测——借助验证器、模拟器或任务专用评分函数获取候选方案的反馈。尽管已有工作强调评测的重要性,但尚未系统研究如何原则且高效地规模化评测驱动的发现闭环(https://huggingface.co/papers?q=evaluation-driven%20discovery%20loops),以拓展科学发现的边界。本文提出Simple Test-time Evaluation-driven Scaling(SimpleTES),一个通用框架,策略性融合并行探索、反馈驱动精化与局部选择,揭示沿正确维度扩展评测驱动发现闭环带来的显著提升。在涵盖六大领域的 21 个科学问题上,SimpleTES 使用 gpt-oss 系列模型发现 SOTA 解,持续超越前沿模型基线与复杂优化管线。具体成果:将广泛使用的 LASSO 算法速度提升 2 倍以上;设计量子电路布线策略,门开销降低 24.5%;发现新的Erdös 最小重叠构造,超越已知最优结果。除新发现外,SimpleTES 生成轨迹级历史,天然监督反馈驱动学习。在成功轨迹上后训练后,模型不仅提升已知问题效率,还能泛化到未知问题,发现基模型无法找到的解。综上,我们确立高效评测驱动闭环扩展为推进LLM 驱动科学发现的核心轴,并提供简单实用的框架实现这些增益。
引用该论文的模型 0
暂无模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2604.19341 即可在此显示。
引用该论文的数据集 0
暂无数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2604.19341 即可在此显示。
引用该论文的 Spaces 0
暂无 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2604.19341 即可在此显示。
包含该论文的收藏 0
暂无收藏包含此论文
新建收藏 并添加此论文即可在此显示。
相似文章
面向回合级智能体强化学习的科学发现环境扩展
本文介绍了SciDisco,一个可扩展的框架,用于通过过程可验证环境、基于DAG的轨迹合成和回合级强化学习来训练科学发现智能体。所提出的SciDisco-14B模型在假设驱动的科学数据分析基准上达到了最先进水平。
科学发现作为元优化:一个组合优化案例研究
本文提出将科学发现形式化为一个元优化问题,其中LLM通过相关性加权投票生成并聚合目标函数,应用于使用数字MemComputing的3-SAT算法发现,在大规模实例上实现了67倍的加速。
用 LLM 优化 LLM:面向测试时扩展的智能体发现方法
本文提出了 AutoTTS,这是一种环境驱动的框架,通过将测试时扩展(TTS)策略的发现过程形式化为控制器合成,自动发现用于大型语言模型(LLM)的测试时扩展策略。该框架在数学推理基准测试上展示了更优的准确率-成本权衡,且计算开销极小。
TEMPO:为大推理模型扩展测试时训练
TEMPO 提出一种测试时训练框架,在策略微调与评判器再校准之间交替,防止多样性崩塌并持续放大推理模型的性能,将 Qwen3-14B 在 AIME 2024 上的得分从 42.3% 提升至 65.8%。
Science Edge Evaluation:SEE——迈向真正科学发现所缺失的一步
本文介绍了SEE,一个由专家策划的、面向化学、生物学和材料科学科学发现的多模态基准。对19个多模态大语言模型(MLLMs)的评估显示,最佳模型的准确率仅达到48.7%,即使使用工具也只有52.7%,这表明当前模型缺乏可靠的、受证据约束的科学推理能力。