LEAP:迭代科学设计中LLM的轨迹级评估

arXiv cs.LG 论文

摘要

本文介绍了LEAPBench,一个包含55个任务的框架,用于对迭代科学设计中的LLM进行轨迹级评估。评估显示,基于结果的评分会遗漏效率提升,并且在匹配已发表的最佳设计时,领域无关提示可以优于领域感知提示。

arXiv:2605.15341v1 Announce Type: new 摘要:大型语言模型(LLM)正越来越多地部署在自主实验室中,其假设是,领域先验知识和基于迭代反馈的推理使其能够以比仅反馈基线更少的迭代次数收敛到良好设计。然而,当前的迭代科学设计基准仅对固定时间点的结果快照进行评分。这导致学习轨迹未被测量,尽管轨迹正是捕捉学习效率的关键——每次节省的迭代都意味着成本和时间的实际节省。受此启发,我们考察了三种评估选择,这些选择会改变在迭代科学设计中对LLM学习效率得出的结论:测量什么、比较什么基线、以及以什么为基准。我们引入了LEAPBench(自适应过程中的学习效率),这是一个包含55个任务的框架,它将到目前为止的最佳曲线下面积(AUC)轨迹指标与经典贝叶斯优化参考以及基于已发表文献的审计相结合。应用于八个当代LLM后,从最终结果评分切换到轨迹评分会改变匹配时间点下53%任务的最佳模型选择,并揭示了基于结果评分所忽视的效率提升。LLM并未超越经典贝叶斯基线。在16个生物学任务中,当oracle的奖励信号与已发布最佳设计的配置一致时,领域感知提示导致LLM在迭代30时匹配已发布最佳设计的概率比领域无关提示低约10个百分点。这种模式在6个文献典型配置与已发布最佳配置存在差异的任务中最为明显,且领域无关提示在所有6个任务中更频繁地匹配已发布最佳。轨迹指标还可用作可处理的训练目标。使用该指标作为奖励的离线强化学习在21个保留任务中的14个上提升了性能。
查看原文
查看缓存全文

缓存时间: 2026/05/18 06:40

# LEAP:迭代科学设计中大语言模型的轨迹级评估  
来源:https://arxiv.org/abs/2605.15341  
查看PDF(https://arxiv.org/pdf/2605.15341)  

> **摘要**:大语言模型(LLM)正越来越多地被部署在自动化实验室中,其前提是它们拥有的领域先验知识以及对迭代反馈的推理能力,能比纯反馈基线在更少的迭代次数内收敛到良好的设计方案。然而,当前的迭代科学设计基准仅在固定步长下对最终结果快照进行评分。这导致学习轨迹未被测量,而轨迹恰恰是衡量学习效率的关键——每节省一次迭代,就相当于实际节省了成本和时间。基于此,我们考察了三种评估选择,它们会改变人们对LLM在迭代科学设计中学习效率的结论:测量什么、与什么基线比较、以及以什么为基准。我们提出了LEAPBench(自适应过程中的学习效率),这是一个包含55个任务的框架,它将“迄今为止最佳”的曲线下面积(AUC)轨迹度量与经典的贝叶斯优化参考以及基于已发表文献的审计相结合。应用于八种当代LLM时,从最终结果评分切换到轨迹评分,在匹配的步长下,有53%的任务改变了最佳模型的选择,并揭示了基于结果评分所忽略的效率提升。LLM并未超越经典的贝叶斯基线。在16个生物学任务中,当预言机的奖励信号与已发表最佳设计中的配置一致时,领域感知提示导致LLM的选择在迭代30次时与已发表最佳选择的匹配度比领域无关提示约低10个百分点。在6个文献典型配置与已发表最佳配置存在差异的任务中,这种模式最为明显,且领域无关提示在所有6个任务中匹配已发表最佳配置的频率更高。轨迹度量也可作为易于处理的训练目标。以该度量作为奖励的离线强化学习在21个保留任务中的14个上提升了性能。

## 投稿历史

来自:Marilyn Zhang [查看邮箱](https://arxiv.org/show-email/f0f94c69/2605.15341) **\[v1\]**2014年5月14日星期四 19:10:45 UTC (303 KB)

相似文章

LEAP:利用代理框架增强LLMs在形式数学中的能力

arXiv cs.AI

LEAP是一种代理框架,使通用LLMs能够在Lean中实现形式定理证明的最新性能,解决了2025年普特南竞赛的全部12个问题,并在新基准(Lean-IMO-Bench)上将形式化证明率从低于10%提升至70%,超越了专门系统。

PreAct-Bench: 对LLM进行预测性监控的基准测试

arXiv cs.LG

PreAct-Bench是一个包含五个领域、1000对道德与不道德行动轨迹的基准测试,旨在评估LLM从部分轨迹中预测有害结果的能力(预测性监控)。结果表明,虽然人类表现良好,但当前的LLM仍存在困难,凸显了未来导向的风险推理的必要性。