用于实时数据科学任务的基于技能的智能体评估
摘要
本文提出了一个ground-truth-as-code框架,用于评估在持续更新数据上的数据科学智能体,实现了与人类评估者更高的一致性并减少了令牌消耗。
arXiv:2609.16487v1 公告类型:新
摘要:我们提出一个框架,用于评估在实时、持续更新数据上的数据科学智能体,使用可执行的基准真值和与格式无关的事实型评分。考虑这个示例查询:“上周的观众规模是多少”——参考答案随着底层数据的变化而改变,因此静态参考变得过时,标准LLM-as-a-judge流水线无法针对固定基准真值验证响应。我们的核心贡献,ground-truth-as-code,将每个预期答案编码为一个可执行的参考函数,在评估时直接从实时数据重新计算答案,确保参考与描述的系统保持一致。我们将其与一个事实型、与格式无关的评判器结合,该评判器将智能体的响应和计算出的基准真值分解为原子性主张,并在这些主张上评分精确率、召回率和准确率,无论响应格式如何(散文、列表、表格、HTML等)。该方法适用于预期输出可表示为可执行数据计算的智能体。我们通过在内部开发的、已部署的机器学习技能上进行人类-LLM一致性研究来验证该框架,使用了一个构建以重现生产模式和实体关系的合成数据库。相对于自然语言基准真值基线,我们的方法在马修斯相关系数(MCC)上实现了29%的改进——这是专家注释者与LLM-as-a-judge预测之间的类别平衡一致性度量——并在每个测试案例中令牌消耗减少了16%,而缺乏明确基准真值的自主基线与人类判断呈负相关。执行多源数据集成和在非平稳数据上计算的智能体在行业中常规部署;我们提出ground-truth-as-code作为评估它们的实用方法论。
查看缓存全文
缓存时间: 2026/09/16 09:00
# 基于技能的智能体评估用于实时数据科学任务 来源: https://arxiv.org/abs/2609.16487 查看 PDF (https://arxiv.org/pdf/2609.16487) > 摘要:我们提出一个评估框架,用于在动态更新的数据上评估数据科学智能体,该框架使用可执行的基准答案和与格式无关的事实型评分。以示例查询"上周的观众人数是多少"为参考——当底层数据变化时,参考答案也随之改变,因此静态参考答案会过时,标准的大语言模型作为评判者管道无法基于固定基准来验证响应。我们的核心贡献“代码即基准”将每个预期答案编码为一个可执行的参考函数,在评估时直接从动态数据中重新计算答案,确保参考答案与其描述的系统保持一致。我们将其与一种事实型、与格式无关的评判器相结合,该评判器将智能体的响应和计算出的基准答案分解为原子级声明,并计算这些声明的精确率、召回率和准确率,无论响应格式如何(散文、列表、表格、HTML 等)。该方法适用于预期输出可表示为可执行数据计算的智能体。我们通过一项人机对齐研究验证了该框架,研究使用内部开发并已部署的机器学习技能,基于构建用于复现生产模式与实体关系的合成数据库进行。相对于自然语言基准基线,我们的方法将马修斯相关系数(MCC,一种用于衡量专家标注者与大语言模型评判预测之间一致性的类别平衡指标)提高了 29%,并将每个测试用例的令牌消耗减少了 16%,而缺乏明确基准的自驱动基线与人类判断呈负相关。执行多源数据集成与非平稳数据计算的智能体在工业界中常被部署;我们提出“代码即基准”作为评估此类智能体的实用方法论。 ## 提交历史 来自: Aniruddha Tamhane \[查看邮箱 (https://arxiv.org/show-email/d2498032/2609.16487)\] **\[v1\]** 2026年9月15日,周二,01:20:37 UTC \(23 KB\)
相似文章
自动化智能体评估的实证研究
本文介绍了 EvalAgent,这是一个通过编码领域专业知识来自动化 AI 智能体评估的系统,旨在解决标准编程助手在此任务中的局限性。此外,本文还提出了用于测试评估流程的基准 AgentEvalBench,并展示了在评估可靠性方面的显著提升。
评估技能,而非仅关注智能体:智能体技能的连续评估
本文介绍了ACES,这是一个通过实际试验对AI智能体技能进行连续评估的框架,它测量技能提升(Skill Lift)以量化附加值,并展示了与仅扫描门控相比在企业存储库上的有效性。
神经数据不再无聊:代理型AI在数据复用中的基准测试
本文对代理型AI系统在加载、理解和重新格式化碎片化的神经科学数据任务上进行基准测试,发现尽管代理在子任务上表现良好,但很少能实现完全无错误的端到端解决方案,人工监督仍然必要。
实现对话代理的多维度评估:一个可扩展、受管控的管道,具备选择性重新评估与模型基准测试
本文介绍了GenAI Evaluation,一个受管控且配置驱动的管道,用于零售对话代理的可扩展多维度评估。它通过使用LLM作为评判员的评分与选择性重新评估实现了高精度,并经过人工标注数据验证。
生成更好训练数据的智能体(25分钟阅读)
Autodata 引入了一种智能体数据科学家,它能够迭代生成并优化合成训练数据,并通过元优化进一步提升数据质量,在计算机科学和法律推理任务上取得了更好的效果。