通过专家指导生成有效上下文特定基准的框架
摘要
本文提出了一种利用专家指导和合成数据生成上下文特定大语言模型基准数据集的框架,提高了有效性和可扩展性,优于现有方法。
arXiv:2609.16592v1 公告类型:新
摘要:本文提出了一种端到端的方法,通过结合专家输入和合成数据生成,生成上下文特定的大语言模型(LLM)基准数据集。现有的基准构建方法往往在有效性和可扩展性之间权衡:与领域专家共同设计的数据集可以产生高质量的评估,但创建过程缓慢且成本高;而合成数据生成可能高效扩展,但常常导致不现实、冗余或超出范围的示例。为了解决这一差距,我们引入了一种模式,用于提取评估任务的目标、范围和上下文的关键信息,并利用这些信息指导合成数据生成。我们进一步定义了四个基于测量有效性的标准来评估数据集质量:覆盖度、多样性、内容真实性和风格真实性。利用这些标准,我们展示了专家信息引导的脚手架如何指导合成数据生成以产生更有效的基准。通过定量评估和与领域专家的真实案例研究,我们证明了我们的方法在保持有效性的同时,提高了基准数据集质量优于现有方法。我们还分析了不同类型的模式信息如何影响不同的数据集质量标准,并提供了在资源约束下优先收集哪些信息的实用指导。
查看缓存全文
缓存时间: 2026/09/16 09:01
# 通过专家指导生成有效上下文特定基准测试的框架 来源:https://arxiv.org/html/2609.16592 作者:Nari Johnson, Anna Kawakami, Hoda Heidari 所属机构:卡内基梅隆大学 通讯邮箱:[kltruong@cmu\.edu](mailto:[email protected]) ###### 摘要 本文提出了一种端到端方法,通过结合专家输入与合成数据生成,为特定上下文生成大型语言模型(LLM)基准测试数据集。现有的基准测试构建方法常需在**有效性**与**可扩展性**之间权衡:由领域专家设计的数据集可产出高质量评估结果,但创建过程缓慢且成本高昂;而合成数据生成虽能高效扩展,却常产生不真实、冗余或超出范围的样本。为弥合这一差距,我们引入了一种用于收集评估任务目标、范围与上下文关键信息的模式(schema),并利用这些信息指导合成数据生成。我们进一步基于测量有效性定义了四个用于评估数据集质量的准则:覆盖度、多样性、内容真实性与风格真实性。基于这些准则,我们展示了专家引导的框架如何指导合成数据生成,以构建更有效的基准测试。111 我们框架所有部分的实现代码可在以下地址获取:https://github.com/KimberlyTruong/expert-informed-eval-gen 通过定量评估与与领域专家合作的实际案例研究,我们证明了该方法在保持有效性的同时,相比现有方法提升了基准测试数据集的质量。此外,我们分析了不同类型的模式信息对不同数据集质量准则的影响,并在资源受限的条件下提供了优先收集哪些信息的实用指导。 ## 1 引言 采用大型语言模型(LLM)的组织通常希望评估模型在其特定应用或具体上下文中表现是否良好(Matias and Price, 2025 (https://arxiv.org/html/2609.16592#bib.bib10); Szymanski et al., 2026 (https://arxiv.org/html/2609.16592#bib.bib3))。然而,大多数公开的LLM基准测试聚焦于“通用”能力与风险,缺乏对特定部署场景的深入考量(Raji et al., 2021 (https://arxiv.org/html/2609.16592#bib.bib29); Ott et al., 2022 (https://arxiv.org/html/2609.16592#bib.bib30))。这引发了**有效性**方面的担忧(Adcock and Collier, 2001 (https://arxiv.org/html/2609.16592#bib.bib7); Coston et al., 2023 (https://arxiv.org/html/2609.16592#bib.bib2); Chouldechova et al., 2024 (https://arxiv.org/html/2609.16592#bib.bib25)),即基准测试结果可能无法有意义地捕捉在特定上下文中对利益相关者最重要的行为或结果(Liao et al., 2021 (https://arxiv.org/html/2609.16592#bib.bib5))。为此,一些组织开始开发为特定部署场景量身定制的评估流程(Nahar et al., 2025 (https://arxiv.org/html/2609.16592#bib.bib17); Kawakami et al., 2026 (https://arxiv.org/html/2609.16592#bib.bib1))。最佳实践应是使用反映真实用户如何提示系统的、真实的输入来评估模型(Raji et al., 2021 (https://arxiv.org/html/2609.16592#bib.bib29))。 图 1:研究贡献:一种可大规模生成有效评估数据的端到端方法 本文提出了三个关键方法论贡献:首先,我们引入了一种模式(schema):一个轻量级、结构化的模板,可用于收集关于AI评估任务预期范围和目标的关键信息。其次,我们基于先前工作,提出并定义了四个评估数据集质量的准则:覆盖度、多样性、内容真实性与风格真实性。最后,我们基于这些步骤,展示了如何利用该模式和质量指标来改进AI评估中合成数据生成的质量。 相比之下,近年来合成数据生成方法的进步使得可扩展的数据集构建成为可能,但常产生不真实、冗余或超出范围的样本(Kapania et al., 2025 (https://arxiv.org/html/2609.16592#bib.bib15))。在本研究中,我们探索如何利用结构化的领域专家输入来指导评估数据的合成生成,在减少相比完全手动方法所需专家工作量的同时,保持生成数据集的质量。 我们的贡献。我们提出了一个端到端框架,以支持利益相关者大规模创建有效且特定于上下文的AI评估数据集(图 1 (https://arxiv.org/html/2609.16592#S1.F1))。我们的工作有三个方法论贡献。第一,我们引入了一种模式(结构化模板),以收集领域专家为定义评估标准和生成真实评估数据集所需的最小上下文规范(§4\.1 (https://arxiv.org/html/2609.16592#S4.SS1))。第二,我们基于测量有效性理论(Chouldechova et al., 2024 (https://arxiv.org/html/2609.16592#bib.bib25); Salaudeen et al., 2025 (https://arxiv.org/html/2609.16592#bib.bib19)),提出评估数据集质量的可操作、可量化的定义(§4\.2 (https://arxiv.org/html/2609.16592#S4.SS2))。我们展示了这些定义如何既可用于评估数据集质量,也可通过结构化提示改进合成数据生成(§4\.3 (https://arxiv.org/html/2609.16592#S4.SS3))。 为证明我们方法的可行性和实用性,我们呈现了一个与一个小型社会工作者组织合作的案例研究,这些社会工作者在美国公立学校日常工作中使用聊天机器人(§3 (https://arxiv.org/html/2609.16592#S3))。我们展示了如何收集规范以实例化我们的质量指标,并生成反映这些社会工作者如何使用AI的交互基准测试数据集。我们表明,与基线方法相比,我们的方法生成的示例被工作者们一致认为更真实(§6 (https://arxiv.org/html/2609.16592#S6))。最后,通过一系列消融研究,我们提供了关于需要多少上下文信息以及何种详细程度才能生成高质量合成数据集的实用指导(§7 (https://arxiv.org/html/2609.16592#S7))。 ## 2 相关工作 考察AI评估的有效性。有效性是来自定量社会科学的基础概念,它研究经验测试是否真正测量了其旨在测量的内容(Drost, 2011 (https://arxiv.org/html/2609.16592#bib.bib8))。近期研究指出了AI评估有效性的若干威胁(Raji et al., 2021 (https://arxiv.org/html/2609.16592#bib.bib29); Coston et al., 2023 (https://arxiv.org/html/2609.16592#bib.bib2); Salaudeen et al., 2025 (https://arxiv.org/html/2609.16592#bib.bib19)),其中一些强调了评估**数据集**所扮演的重要角色:当评估数据集与现实世界使用场景不匹配时,就会出现外部效度问题(Bean et al., 2025 (https://arxiv.org/html/2609.16592#bib.bib14); Liao et al., 2021 (https://arxiv.org/html/2609.16592#bib.bib5))。然而,基于测量有效性评估评估数据集质量的具体标准仍然有限。我们通过将抽象的质量标准(例如,“为任务构建有代表性的数据集”(Bean et al., 2025 (https://arxiv.org/html/2609.16592#bib.bib14)))具体化为可衡量的标准来解决这一差距,这些标准基于领域专家的实际理解。为收集这些信息,我们的工作建立在近期关于在设计有效AI评估时**系统化**重要性的论证基础上(Wallach et al., 2025 (https://arxiv.org/html/2609.16592#bib.bib22))。系统化是明确界定被测量概念的所有相关组成部分的过程,从抽象描述转向经验测试所捕捉内容的精确定义(Adcock and Collier, 2001 (https://arxiv.org/html/2609.16592#bib.bib7))。Chouldechova 等人(2024)(https://arxiv.org/html/2609.16592#bib.bib25)为从业者提供了一个结构化框架,用于精确定义不仅被评估的概念(例如,性能指标),还包括系统化评估所基于的**数据集**的重要属性。我们的方法论扩展了这一框架,采用一种轻量级方法直接从领域专家那里收集所需信息以系统化评估数据集属性。 为AI评估生成合成数据。我们的工作还基于合成数据生成的研究,其中大部分仅关注为模型训练创建数据(Long et al., 2024 (https://arxiv.org/html/2609.16592#bib.bib26); Kang et al., 2025 (https://arxiv.org/html/2609.16592#bib.bib16))。在这些场景中,合成数据通常通过下游任务性能、多样性指标或与参考分布的保真度来评估(Zhang et al., 2026 (https://arxiv.org/html/2609.16592#bib.bib13))。近期用于**评估**目的的合成数据研究借鉴了大型通用基准测试或公共文档(Shashidhar et al., 2025 (https://arxiv.org/html/2609.16592#bib.bib20); Diddee et al., 2026 (https://arxiv.org/html/2609.16592#bib.bib4)),然而此类方法不适用于特定上下文场景。评估数据集通常缺乏真实的参考分布,且误表征的风险不同:一个未能真实反映现实世界使用的合成评估数据集可能掩盖失败模式,或导致从业者得出误导性结论。合成生成的常见局限性包括:难以泛化到上下文学习中提供的种子示例之外(Kapania et al., 2025 (https://arxiv.org/html/2609.16592#bib.bib15))、与真实数据相比多样性较低(El-Hajjami and Salinesi, 2026 (https://arxiv.org/html/2609.16592#bib.bib12)),以及对提示策略高度敏感(El-Hajjami and Salinesi, 2026 (https://arxiv.org/html/2609.16592#bib.bib12))。Pombal 等人(2025)(https://arxiv.org/html/2609.16592#bib.bib18)表明,结构化提示在零样本评估数据集生成方面是有效的,但几乎没有指导应收集哪些信息或如何构建提示。我们通过提出一个用于收集必要信息以指导生成的模式,并开发评估特定上下文相关质量的指标(无需参考分布)来解决这些局限性。 ## 3 案例背景:AI在社会工作中的应用 我们的工作受到一个与美国学校社会工作组织合作的案例研究的启发。该工作建立在该组织的一项先前研究之上,该研究由我们的一位合著者主导(Kawakami et al., 2026 (https://arxiv.org/html/2609.16592#bib.bib1)),其中社会工作者通过研讨会活动设计了16个评估示例提示,以及其他贡献(详情参见附录C (https://arxiv.org/html/2609.16592#A3)和 Kawakami et al. (2026) (https://arxiv.org/html/2609.16592#bib.bib1))。该组织雇佣了在儿童行为与心理学、心理健康与创伤以及教育等领域具有专长的持证社会工作者(“领域专家”)。工作者们观察教师的课堂,目标是反思教师如何利用其优势更好地支持学生。2025年,该组织为工作者提供了在工作中使用LLM聊天机器人的选项。许多工作者开始使用聊天机器人作为反思辅助工具,以更好地理解他们的课堂观察。具体来说,工作者使用LLM的一种方式是根据他们的课堂观察笔记,建议可用于指导未来与教师讨论后续路径的**反思性问题**。工作者通常用课堂观察描述提示LLM,并寻求如何讨论该情况的指导: 用户(社会工作者):今天我看到一个情况,孩子D一直在咬他的同学。\[...\] 提出3个能帮助老师思考可能发生了什么的问题? AI助手:这里有三个我会问老师的问题,以帮助收集背景信息... 在本文中,我们通过生成一个数据集来评估LLM**为该组织的工作者生成反思性问题的能力**,从而演示我们的框架。换句话说,我们的目标是生成一个评估数据集,其中的提示反映了社会工作者在课堂观察中可能遇到的复杂情况。 ## 4 我们提出的端到端方法 在本节中,我们介绍我们的端到端方法,包含三个核心步骤:首先,我们介绍一种用于收集AI评估任务关键上下文信息的模式(§4\.1 (https://arxiv.org/html/2609.16592#S4.SS1))。然后,我们基于测量有效性定义四个评估数据集质量的准则:覆盖度、多样性、内容真实性与风格真实性(§4\.2 (https://arxiv.org/html/2609.16592#S4.SS2))。利用这些准则,我们展示专家引导的模式如何指导合成数据生成,以构建更有效的基准测试(§4\.3 (https://arxiv.org/html/2609.16592#S4.SS3))。在适当情况下,我们使用社会工作案例研究来说明我们的阐述。 ### 4\.1 模式:收集上下文信息 评估有效性需要一组最小的上下文信息;否则,未说明的假设会使用例规定不足。我们引入一种模式(schema)——一个结构化模板,用于从专家那里收集关于数据生成上下文的信息。Chouldechova 等人(2024)(https://arxiv.org/html/2609.16592#bib.bib25)确定了有效评估上下文的四个组成部分;我们采纳了与数据集生成相关的三个——总体(population)、概念(concept)和实例(instance)——并将它们分解为以下八个字段,以确保利益相关者能够提供足够细致和清晰的、关于评估上下文的有意义信息。空模式模板详见附录J\.1 (https://arxiv.org/html/2609.16592#A10.SS1)。 ##### 总体(Population) 包括**预期部署群体**——通常会与GenAI系统交互的人群,以及该群体的**上下文约束**(例如,时间段、领域)。 示例:社会工作者使用LLM提示以生成反思性问题,用于他们未来与教师及合作团队的会议,以加强实践工作。 ##### 概念(Concept) 包括正在测量的**能力或风险**、该构念的**高层次定义**及其**组成部分**——涉及的元素及其可能的值。 示例:一个能生成优质反思性问题的模型,能够识别提示中的相关**行为主体**以及撰写者所做的**观察**和**解释**。它会在获得足够细节前持续寻求澄清。 行为主体(选择一个或多个):\[儿童,教师,监护人,...\] ##### 实例(Instance) 包括**总是存在**的内容和数据集示例中**变化的因素**。每个字段可以指定数据集中单个示例的格式或内容。 示例:每个实例都是一个单轮提示,以教育促进者或心理健康顾问的第一人称视角书写,反思一个课堂场景。每个实例必须包含: - 一段第一人称描述,讲述具体的课堂观察或互动。 - 描述应感觉自然、会话化,就像促进者/顾问正在处理他们观察到的内容。 除了这些字段,我们的模式还要求提供**种子示例**:由预期部署群体的真实成员撰写或收集的代表性提示。 **为社会工作上下文填充模式。**我们使用我们合著者先前的系统化工作来实例化该模式...
相似文章
面向基础模型综合评估的细粒度基准生成
一种新的自动化基准生成框架能够实现基础模型的细粒度、全面评估,具有更低的错误率和更丰富的元数据,在机器学习、公司金融和个人金融基准上得到了验证。
EvalDetectBench:用于测量前沿语言模型评估意识的基准
本文介绍了EvalDetectBench,这是一个用于测量前沿语言模型评估意识的开放基准和流水线,旨在解决现有方法中的偏差,以提升AI安全评估。
PlanningBench: 生成可扩展且可验证的规划数据,用于评估和训练大型语言模型
PlanningBench 是一个用于生成可扩展、多样且可验证的规划数据的框架,以评估和训练大型语言模型。该框架采用约束驱动的合成流程,具备自适应难度控制和质量过滤功能。实验表明,前沿大语言模型在处理耦合约束时仍存在困难,而基于 PlanningBench 数据的强化学习能够提升模型在未见过的规划任务上的表现。
ConceptGuard:大型语言模型中上下文敏感遗忘的基准测试
本文介绍了ConceptGuard,这是一个基准测试,用于评估大型语言模型中使用双重用途概念的上下文敏感遗忘能力,揭示了当前遗忘技术在此实际评估框架下表现不佳。
基准并非铁板一块:面向LLM评估的样本级审计与编排
本文提出了一种以数据集为中心的元评估框架,在五个潜在维度上对LLM基准进行样本级审计,揭示其内部异质性,并支持基于标准的基准子集组合,以实现针对性的模型评估。