在改进之前学习评估:自动研究代理的自动评分标准归纳

Hugging Face Daily Papers 论文

摘要

AutoSciRub 是一个评估优先框架,通过生成任务特定的可执行评分标准来指导实验和验证,从而改进自主科学代理,在基准测试中实现一致的性能提升。

自主科学研究代理越来越多地应用于端到端的科学工作流程,包括文献回顾、数据分析、实验和报告生成。然而,开放式研究任务通常没有明确指定完成任务所需的分析、方法和成功标准。因此,代理可能遗漏重要分析、使用不适当的方法,或得出证据支持不足的结论。为了解决这个问题,我们提出了 AutoSciRub,一个评估优先框架,它在研究执行前诱导任务特定的可执行评分标准,并使用它来指导执行、标准级别验证以及迭代修订。AutoSciRub 将未明确指定的指令分解为原子级科学目标,将其与相关文献和任务可见数据关联起来,并合成具体、可操作和可验证的标准。生成的评分标准使隐含的实验和证据要求变得明确,为实验和分析提供指导。在修订过程中,评分标准指导的验证识别未满足的标准,并实现对研究报告及其支持工件的有针对性的改进。在 ResearchClawBench 上,AutoSciRub 一致改进了所有测试配置,在固定 Codex 机制下跨三个骨干 LLM 平均提升 2.08 点,在固定 DeepSeek-V4-Flash 骨干的跨三个代理机制下平均提升 2.95 点。在 AstaBench E2E Discovery 的随机抽样 20 任务子集上,AutoSciRub 在跨三个代理机制下进一步实现平均 16.8 点的改进,同时保持或增加了成功完成的任务数量。这些结果表明,评估优先指导为自主科学研究提供了有效且可泛化的控制机制(代码:https://github.com/zjunlp/AutoSciRub)。
查看原文
查看缓存全文

缓存时间: 2026/09/01 11:53

论文页面 - 先评估后改进:面向自动研究智能体的自动评分标准归纳

来源:https://huggingface.co/papers/2608.31076

摘要

AutoSciRub通过生成特定任务的可执行评分标准来改进自主科学智能体,这些标准能够指导实验、验证标准并迭代优化输出。

自主科学研究智能体正越来越多地应用于端到端科学工作流程,包括文献综述、数据分析、实验和报告生成。然而,开放式研究任务通常不会明确说明完成任务所需的分析、方法和成功标准。因此,智能体可能遗漏重要分析、使用不当方法,或得出证据支持不足的结论。为解决此问题,我们提出AutoSciRub(https://huggingface.co/papers?q=AutoSciRub),这是一个以评估为先的框架,在研究执行前归纳出特定任务的可执行评分标准(https://huggingface.co/papers?q=executable%20rubric),并利用其指导执行、标准级验证和迭代修订。AutoSciRub(https://huggingface.co/papers?q=AutoSciRub)将未充分说明的指令分解为原子科学目标(https://huggingface.co/papers?q=atomic%20scientific%20goals),将其与相关文献和任务可见数据关联,并合成具体、可操作且可验证的标准。由此产生的评分标准使隐式的实验和证据要求显性化,为实验和分析提供指导。在修订过程中,评分标准引导的验证(https://huggingface.co/papers?q=rubric-guided%20verification)识别未满足的标准,并支持对研究报告及其支撑材料进行定向修订。在ResearchClawBench(https://huggingface.co/papers?q=ResearchClawBench)上,AutoSciRub(https://huggingface.co/papers?q=AutoSciRub)持续改进所有测试配置,在固定Codex运行器下使用三种骨干大语言模型平均提升2.08分,在固定DeepSeek-V4-Flash骨干下使用三种智能体运行器平均提升2.95分。在随机抽样的AstaBench(https://huggingface.co/papers?q=AstaBench)端到端发现任务子集(20个任务)中,AutoSciRub(https://huggingface.co/papers?q=AutoSciRub)进一步在三种智能体运行器上实现平均16.8分的改进,同时保持或增加成功完成的任务数量。这些结果表明,以评估为先的指导为自主科学研究提供了有效且可泛化的控制机制(代码:https://github.com/zjunlp/AutoSciRub (https://huggingface.co/papers?q=AutoSciRub))。

查看arXiv页面 (https://arxiv.org/abs/2608.31076) 查看PDF (https://arxiv.org/pdf/2608.31076) GitHub14 (https://github.com/zjunlp/AutoSciRub) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.31076)

引用本文的模型0

无模型链接本文

在模型README.md中引用arxiv.org/abs/2608.31076以从本页链接到该模型。

引用本文的数据集0

无数据集链接本文

在数据集README.md中引用arxiv.org/abs/2608.31076以从本页链接到该数据集。

引用本文的 Spaces0

无 Space 链接本文

在 Space README.md 中引用 arxiv.org/abs/2608.31076 以从本页链接到该 Space。

包含本文的合集0

无合集包含本文

将本文添加到合集 (https://huggingface.co/new-collection) 以从本页链接到该合集。

相似文章

自动化智能体评估的实证研究

arXiv cs.CL

本文介绍了 EvalAgent,这是一个通过编码领域专业知识来自动化 AI 智能体评估的系统,旨在解决标准编程助手在此任务中的局限性。此外,本文还提出了用于测试评估流程的基准 AgentEvalBench,并展示了在评估可靠性方面的显著提升。

RUBAS:基于评分标准的强化学习智能体安全框架

arXiv cs.LG

RUBAS 是一个面向智能体安全的评分标准强化学习框架,将 LLM 智能体行为分解为四个维度——工具使用安全性、参数安全性、响应安全性和有用性——在完整轨迹上提供细粒度奖励。实验表明,RUBAS 在标准对齐基线基础上提升了安全性,同时减少了工具相关的幻觉现象,并保持了具有竞争力的实用性。