在改进之前学习评估:自动研究代理的自动评分标准归纳
摘要
AutoSciRub 是一个评估优先框架,通过生成任务特定的可执行评分标准来指导实验和验证,从而改进自主科学代理,在基准测试中实现一致的性能提升。
查看缓存全文
缓存时间: 2026/09/01 11:53
论文页面 - 先评估后改进:面向自动研究智能体的自动评分标准归纳
来源:https://huggingface.co/papers/2608.31076
摘要
AutoSciRub通过生成特定任务的可执行评分标准来改进自主科学智能体,这些标准能够指导实验、验证标准并迭代优化输出。
自主科学研究智能体正越来越多地应用于端到端科学工作流程,包括文献综述、数据分析、实验和报告生成。然而,开放式研究任务通常不会明确说明完成任务所需的分析、方法和成功标准。因此,智能体可能遗漏重要分析、使用不当方法,或得出证据支持不足的结论。为解决此问题,我们提出AutoSciRub(https://huggingface.co/papers?q=AutoSciRub),这是一个以评估为先的框架,在研究执行前归纳出特定任务的可执行评分标准(https://huggingface.co/papers?q=executable%20rubric),并利用其指导执行、标准级验证和迭代修订。AutoSciRub(https://huggingface.co/papers?q=AutoSciRub)将未充分说明的指令分解为原子科学目标(https://huggingface.co/papers?q=atomic%20scientific%20goals),将其与相关文献和任务可见数据关联,并合成具体、可操作且可验证的标准。由此产生的评分标准使隐式的实验和证据要求显性化,为实验和分析提供指导。在修订过程中,评分标准引导的验证(https://huggingface.co/papers?q=rubric-guided%20verification)识别未满足的标准,并支持对研究报告及其支撑材料进行定向修订。在ResearchClawBench(https://huggingface.co/papers?q=ResearchClawBench)上,AutoSciRub(https://huggingface.co/papers?q=AutoSciRub)持续改进所有测试配置,在固定Codex运行器下使用三种骨干大语言模型平均提升2.08分,在固定DeepSeek-V4-Flash骨干下使用三种智能体运行器平均提升2.95分。在随机抽样的AstaBench(https://huggingface.co/papers?q=AstaBench)端到端发现任务子集(20个任务)中,AutoSciRub(https://huggingface.co/papers?q=AutoSciRub)进一步在三种智能体运行器上实现平均16.8分的改进,同时保持或增加成功完成的任务数量。这些结果表明,以评估为先的指导为自主科学研究提供了有效且可泛化的控制机制(代码:https://github.com/zjunlp/AutoSciRub (https://huggingface.co/papers?q=AutoSciRub))。
查看arXiv页面 (https://arxiv.org/abs/2608.31076) 查看PDF (https://arxiv.org/pdf/2608.31076) GitHub14 (https://github.com/zjunlp/AutoSciRub) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.31076)
引用本文的模型0
无模型链接本文
在模型README.md中引用arxiv.org/abs/2608.31076以从本页链接到该模型。
引用本文的数据集0
无数据集链接本文
在数据集README.md中引用arxiv.org/abs/2608.31076以从本页链接到该数据集。
引用本文的 Spaces0
无 Space 链接本文
在 Space README.md 中引用 arxiv.org/abs/2608.31076 以从本页链接到该 Space。
包含本文的合集0
无合集包含本文
将本文添加到合集 (https://huggingface.co/new-collection) 以从本页链接到该合集。
相似文章
智能体在AutoResearch上的失败分析:基于100个真实前沿研究任务的端到端诊断评估
本文介绍了AutoResearchEval,一个用于自动化科学研究中AI智能体的评估框架,揭示了元认知能力的关键缺失作为跨模型的反复失败模式。
自动化智能体评估的实证研究
本文介绍了 EvalAgent,这是一个通过编码领域专业知识来自动化 AI 智能体评估的系统,旨在解决标准编程助手在此任务中的局限性。此外,本文还提出了用于测试评估流程的基准 AgentEvalBench,并展示了在评估可靠性方面的显著提升。
生成减少智能体评估中过度信任的无奖励评判标准
RubricForge从带标签的轨迹中诱导评估标准,以减少语言模型智能体评估中的过度信任,增强保真度,而无需环境访问。
自动评分标准作为奖励:从隐性偏好到显式多模态生成准则
本文介绍了自动评分标准作为奖励(ARR)框架,该框架将隐性偏好知识外显化为多模态对齐的显式评分标准。文章提出了评分标准策略优化(RPO)以稳定策略梯度,在文生图和图像编辑任务中取得了更佳的性能。
RUBAS:基于评分标准的强化学习智能体安全框架
RUBAS 是一个面向智能体安全的评分标准强化学习框架,将 LLM 智能体行为分解为四个维度——工具使用安全性、参数安全性、响应安全性和有用性——在完整轨迹上提供细粒度奖励。实验表明,RUBAS 在标准对齐基线基础上提升了安全性,同时减少了工具相关的幻觉现象,并保持了具有竞争力的实用性。