AgentHPOBench:评估LLM智能体作为顺序超参数优化器的基准

arXiv cs.AI 论文

摘要

介绍了AgentHPOBench,这是一个顺序基准,用于在30个机器学习任务中评估LLM智能体作为超参数优化器的表现,结果显示当前智能体具有可测量的但有限的迭代优化能力。

arXiv:2607.29626v1 公告类型:新 摘要:随着LLM从代码补全系统演变为自主科学智能体,评估其实验能力变得越来越重要。现有基准通常侧重于静态代码生成、论文复现或最终答案的正确性,但并未直接评估智能体是否能够解读实验证据并利用其指导后续的超参数决策。为解决这一空白,我们引入了AgentHPOBench,这是一个包含七个研究类别中30个可执行机器学习任务的顺序基准。每个任务从一次经过验证的基线运行开始,之后智能体执行多次顺序干预。在每一步中,智能体观察累积的配置、指标和日志,然后提出下一个有效配置。我们在统一协议下评估了12个广泛使用的智能体和常规HPO基线。结果表明,当前智能体在各领域表现出可测量的实验优化能力,但在持续迭代改进、复杂日志诊断以及向所报告的参考性能稳定推进方面仍存在明显局限。
查看原文
查看缓存全文

缓存时间: 2026/08/03 07:33

# AgentHPOBench:评估LLM智能体作为序贯超参数优化器的基准
来源:https://arxiv.org/abs/2607.29626
查看 PDF (https://arxiv.org/pdf/2607.29626)

> 摘要:随着LLM从代码补全系统演变为自主科学智能体,评估其进行实验的能力变得日益重要。现有基准通常聚焦于静态代码生成、论文复现或最终答案的正确性,但并未直接评估智能体能否解读实验证据,并利用这些证据来指导后续的超参数决策。为弥补这一空白,我们提出了AgentHPOBench,这是一个包含30个可执行机器学习任务、涵盖七个研究类别的序贯基准。每个任务均以一次经过验证的基线运行开始,之后智能体会执行若干次序贯干预。在每个步骤中,智能体先观察累积的配置、指标和日志,再提出下一个有效配置。我们在统一协议下评估了12种广泛使用的智能体以及传统的HPO基线方法。结果表明,当前智能体在各领域展现出可衡量的实验优化能力,但在持续迭代改进、复杂日志诊断以及稳定朝报告的参考性能推进等方面仍面临明显局限。

## 提交历史

来自:Tianyu Huai \[查看邮箱 (https://arxiv.org/show-email/df9ae1c4/2607.29626)\] **\[v1\]** 2026年7月31日,星期五 16:58:00 UTC \(2,167 KB\)

相似文章

InferenceBench:面向AI代理的开放式LLM推理优化基准测试

arXiv cs.AI

InferenceBench是一个基准测试,用于评估AI代理在多个瓶颈场景下使用H100 GPU优化LLM推理速度的表现。结果显示,代理虽然优于简单基线,但常常收敛于单一框架,且性能不及简单的超参数搜索,表明需要更好的探索策略。

HarnessOpt-Bench:评估LLM在Harness优化中的表现

Hugging Face Daily Papers

HarnessOpt-Bench是一个基准测试,用于评估LLM在固定评估预算下优化目标智能体周围harness(提示、工具、控制流、记忆和编排代码)的能力。对五个前沿LLM的实验表明,优化器模型之间的差异大于它们所借助的编码harness之间的差异,且仍有很大的改进空间。

移动智能体评估中的 LLM 评判器基准测试

arXiv cs.AI

本文介绍了 MobileJudgeBench,一个包含 931 条人工标注轨迹的基准,用于系统评估移动智能体任务中基于 LLM 的评判器。研究发现,带有采样屏幕截图的简单基线评判器可与专用方法相媲美甚至更优,而 LLM 主干是质量的主要驱动因素。