GrowLoop: 由人类初始化的自我进化对话评估

arXiv cs.CL 论文

摘要

本文介绍了GrowLoop,一个用于评估开放式对话中人类相似度的自我进化评估系统。它利用最少的人类种子标注,迭代优化评估标准,解决了隐性知识、人类意见分歧和模型能力进化等挑战。

arXiv:2605.28882v1 公告类型: 新 摘要: 随着大型语言模型的快速发展,评估开放式对话中的人类相似度变得日益重要。然而,人类相似度是一种隐性知识,人类能凭直觉感知,但其背后的标准却难以明确表述。人类判断差异很大:在某些案例上意见高度一致,而在其他案例上则存在合理分歧。与此同时,人类判断所依据的标准仍然隐含,缺乏构建案例的明确基础。此外,何为人类相似并非一成不变,而是随着模型能力和人类期望的演进而变化。尽管评估方法取得了进展,如专家编写的基准、奖励模型和自我进化基准,但没有一种方法能同时应对上述三个挑战。因此,我们提出了GrowLoop,一个自我进化的对话评估系统,能够随着模型进步和场景变化而持续适应。以最少的人类种子标注作为初始驱动力,LLM智能体通过启发式学习迭代提取和优化评估标准。在标注者意见一致的案例上要求人机一致,而在意见分歧的案例上只要求合理性。此外,标准-案例共同进化机制实现了持续进化,当评估目标发生变化时,可通过新种子进行扩展。应用于开放式对话中的人类相似度评估时,生成的评估标准不仅在人类判断一致性上大幅优于现有方法,还能发现标注者忽略的问题。由此产生的基准能够有效区分不同能力层次的模型,揭示其不足,同时泛化到新场景并随模型进步而适应。我们的工作将基准构建范式从手动更新或难度扩展转变为全面、持续的自我进化。
查看原文
查看缓存全文

缓存时间: 2026/05/29 09:13

# 1 引言 来源:https://arxiv.org/html/2605.28882 Amap Voice⋅技术报告⋅2026 GrowLoop:由人类标注驱动的自进化对话评估

Yihang Lin¹,²,∗ Yunze Gao¹,∗ Zeyang Lin¹,† Dongbo Li¹ Kun Peng¹ Chenglong Song¹ Yue Liu¹,†  
¹高德地图,阿里巴巴集团  
²香港中文大学(深圳)  
††footnotetext: 通讯作者

**摘要**

随着大语言模型的快速发展,评估开放式对话中的人类拟真度变得越来越重要。然而,人类拟真度是一种人类凭直觉感知的隐性知识,其背后的标准难以明确表述。人类判断差异很大,在某些案例上高度一致,而在其他案例上则存在合理的分歧。与此同时,人类判断背后的标准仍然是隐性的,没有明确的基础来构建测试案例。此外,什么算作“拟人”并非一成不变,而是随着模型能力与人类期望而不断演变。尽管在评估方法上取得了进展,例如专家编写的基准、奖励模型和自进化基准,但没有一种方法能同时应对这三项挑战。因此,我们提出了 GrowLoop,一个自进化的对话评估系统,能够随着模型的进步和场景的变化持续适应。以最少的人工种子标注作为初始驱动,LLM 智能体通过启发式学习迭代提取并细化评估准则。在标注者意见一致的区域,要求人机一致;而在标注者意见分歧的区域,仅要求判断合理。此外,准则-案例共同进化机制实现了持续进化,当评估目标发生变化时,通过新的种子进行扩展。将其应用于开放式对话的人类拟真度评估,生成的准则不仅在与人判断对齐方面显著优于现有方法,还能发现标注者忽略的问题。生成的基准能够有效区分不同能力层级的模型,并揭示其不足之处,同时能泛化到新场景,并随着模型进步而适应。我们的工作将基准测试范式从手动更新或难度扩展,转变为全面、持续的自我进化。

随着大语言模型在开放式对话中接近人类水平的性能,评估的重点正在从可验证的正确性转向人类拟真度。自然度、个性、同理心等品质变得越来越关键。基于可验证奖励的强化学习 (RLVR) 推动了数学、代码和形式证明方面的最新进展。将同样的训练方式扩展到开放式对话等不可验证任务是一个自然的下一步,但路径始于更早的一步,即评估标准本身:只要标准不可解释、不可调试或在评判者之间不稳定,任何建立在其上的奖励都难以信任。本文就是一次这样的尝试,专注于建立这一基础;训练方面则留给未来工作。

然而,评估人类拟真度依赖于隐性知识,一种人类拥有但难以形式化表达的整体直觉。正如波兰尼[polanyi2009tacit]所说,“我们知道的比我们能说出来的多”。因此,现有的基准范式被证明是不充分的,给可扩展和自动化评估带来了新的挑战。隐性知识具有三个现有范式无法适应关键特性。首先,未经校准的人类在人类拟真度上的一致性远低于可验证任务,需要差异化的评估标准而非单一的“基本事实”。其次,隐性知识抗拒形式化为明确的准则,导致测试用例的构建缺乏原则性基础。第三,隐性知识的评估目标不断变化。随着AI能力的提升和人类期望的演变,静态基准不可避免地过时。这些观察促使我们研究一个能同时解决这三点的评估系统设计。

参见图注

**图1:** 我们的自进化对话评估系统概览。人类种子驱动范围扩展,模型进展触发难度扩展,使基准能够持续进化。每个基准包含一条准则和若干案例。准则定义了明确的评估标准,案例是用于评估的测试对话。

在人类拟真度评估中观察到的低标注者一致性并非孤立现象,类似发现在主观任务中广泛报道[leonardelli-etal-2023-semeval, guerdan2026validating]。leonardelli-etal-2023-semeval 提出保留这种分歧,并采用软标签分布进行评估。guerdan2026validating 进一步表明,即使是单个标注者也可能认为多个选项同样合理,并提出多标签标注方案来捕捉这一点。然而,这两种方法都致力于匹配观察到的人类分布,而未区分共识案例与分歧案例。它们对所有案例应用相同的标准,使得无法确定分歧是反映了真正的评估错误还是合理的差异。此外,通过将评估锚定在观察到的分布上,它们排除了没有标注者选择但合理的判断的可能性。

另一个挑战是隐性知识的外化,现有范式在这方面都存在不足。由专家编写的静态基准[arora2025healthbench, liu2025heartbench, multibench2025]预设评估标准可以被完全阐述,但专家对隐性知识的判断是基于直觉的。另一种范式,即基于人类偏好端到端训练的奖励模型[liu2026skyworkv2, chen2026rmr1],在主观维度上与人类判断的一致性显著较低。更根本的是,它们的黑盒性质使得无法对系统性偏差进行针对性修复,而重新训练则可能用未知偏差替换已知偏差。这两种情况都没有提供明确的标准,因此案例构建只能依赖于临时的专家努力,这成本高昂、不可扩展,也无法随模型进化而适应。

尽管存在这些失败,但共识案例的存在表明规则并非缺失,而是潜在的。即使这些潜在规则可以被外化,它们也不能保持静态,因为隐性知识的评估目标不断变化。评估标准随着AI能力而持续提高,从基本的连贯性到越来越像人类的行为。与此同时,现有基准难以覆盖新的失败模式,并且随着模型进步而丧失区分能力。人类的感知标准也随着文化和技术背景而变化。因此,静态基准对于隐性知识是不可持续的,因为它无法评估一个持续演变的目标。虽然有些基准定期手动更新[white2025livebench, DBLP:conf/iclr/JainHGLYZWSSS25],但这样的维护成本高昂且难以持续。其他方法自动生成现有测试用例的更难变体[benchmarkselfevolving2025, trace2026selfevolving],但无法覆盖新场景或适应不断变化的评估标准。

基于这些观察,我们提出了 GrowLoop,一个由人类种子和模型进展驱动的自进化对话评估系统,如图1 (https://arxiv.org/html/2605.28882#S1.F1) 所示。具体来说,我们根据标注者一致性定义了两个不同的区域:共识区(判断趋于一致)和分歧区(标注者合理分歧)。在共识区,系统通过人机一致性进行评估;而在分歧区,仅要求判断合理。此外,该系统建立在准则-案例双循环共同进化之上,其中准则和案例迭代地相互驱动。首先通过启发式学习将人类种子外化为准则。这些准则与人种子一起指导案例生成。评估结果反过来揭示准则的盲点,人类注入新种子来解决这些差距,推动准则修订。在现有种子定义的目标空间内,系统通过启发式学习自主检测并修复缺陷,无需人工干预。当评估目标超出现有边界时,人类注入新种子以推动进一步的外化并扩展系统的范围。

我们的主要贡献如下:

*   我们提出了第一个自进化对话评估系统,统一了评估隐性知识的三种能力:共识-分歧感知评估、隐性知识外化和持续自我进化。
*   引入了启发式学习,利用强大的 LLM 智能体将隐性知识从人类种子外化为准则和案例。此外,准则-案例双循环共同进化机制使系统能够通过自主细化和人类种子扩展实现持续进化。
*   我们在开放式对话的人类拟真度评估上验证了该框架。实验表明,它在评分质量上优于现有方法,生成了能够区分模型层级并剖析其弱点的基准,并且在场景和模型演变时依然有效。

## 2 相关工作

### 2.1 从任务导向到人类拟真度对话评估

对话评估已经超越了任务完成和偏好排名基准,如 MT-Bench[zheng2023judging]、Chatbot Arena[chiang2024chatbot] 和 WildBench[lin2024wildbench]。在高风险场景中,另一条工作线依赖于为每次对话量身定制的专家编写准则,对准确性、安全性和沟通质量进行评分 (HealthBench[arora2025healthbench]、Multi-Bench[multibench2025])。最近的一步,也是最接近我们设定的是 HeartBench[liu2025heartbench],它提出将人类拟真度智能作为目标能力,并组织成一个基于心理咨询的五维分类体系。

### 2.2 基于准则的评估与 LLM 作为评判者的可靠性

自动化准则获取出现在两种范式中。离线方法从偏好数据中归纳准则[findeis2025inverse],而在线方法则在策略训练期间引出新标准。与我们的准则-案例双循环最接近的是在线方法。OnlineRubrics[onlinerubrics2025] 从成对响应中提取针对控制模型的标准,而 Rubric-ARM[xu2026alternatingreinforcementlearningrubricbased] 则将准则视为潜在动作,在交替强化学习中与评判者共同优化。然而,两者都假设评估目标已经明确定义,并且服务于策略训练而非标准发现。

一个并行的问题是,评判者的一致性并不意味着可靠性。高评判者间一致性通常反映共享的表面启发式而非实质质量[song2026illusion],并且即使模型内评分稳定,跨模型的一致性仍然有限[ke2026learning]。更根本的是,在主观任务中,多个判断可以同时有效[guerdan2026validating],因此任何单一的一致性目标都会排除那些没有标注者恰好给出的同样合理的答案。因此,我们将人类-AI 一致性视为必要的,并辅以第二个维度,即判断是否在专家反思后认为是合理的。

### 2.3 动态与自进化基准

静态基准面临污染和饱和问题[chen-etal-2025-benchmarking-large],推动了动态和自进化设计的发展。早期代表 DyVal[zhu2024dyval] 从可控复杂度的有向无环图中生成推理项目。后来工作从项目生成转向实例演化,重新框架化现有实例[benchmarkselfevolving2025],沿可复现轨迹升级智能体任务[trace2026selfevolving],以及为非确定性后端推断代理状态[proxystate2025]。所有这些工作中,自进化操作在案例上,准则本身保持不变。

### 2.4 启发式学习研究

越来越多的工作使用 LLM 作为离散的、语言介导变量的优化器,这一方向最近被称为*启发式学习*[weng2026heuristic]。Self-Refine[madaan2023selfrefine] 在输出层面通过生成-批评-修订循环实例化这一思想,而后来方法将目标扩展到提示和更一般的文本变量[zhou2023large, pryzant-etal-2023-automatic, yuksekgonul2024textgrad]。这些工作表明,语言不仅可以作为模型输入或输出,还可以作为优化介质。密切相关的一条工作线将启发式优化扩展到评估标准本身。EvalGen[shankar2024evalgen] 研究了“标准漂移”,即评估标准通过与模型输出的交互而出现,而 RRD[shen2026rethinking] 递归分解粗粒度准则以提高评判者的区分能力。GrowLoop 也属于这一评估-优化路线,但据我们所知,是第一个将准则本身作为优化目标,并与探测它的案例共同进化的系统。

参见图注

**图2:** GrowLoop 的架构。系统由两个共同进化的循环组成:准则生成和案例生成。准则指导案例构建,而案例上的评估结果暴露准则缺陷,驱动两者的迭代改进。

## 3 方法

### 3.1 概述

如图2 (https://arxiv.org/html/2605.28882#S2.F2) 所示,系统由两个交互的循环组成:准则生成和案例生成。在准则生成循环中,一个多智能体模块将人类评分背后的潜在标准提取为可解释的评估准则,参考现有基准的准则设计范式。然后 LLM 评分器应用准则对种子数据进行评分,评分质量与人工标注的对比驱动迭代改进。在案例生成循环中,另一个多智能体模块根据生成的准则、领域规范和对话模式生成案例。然后评分器跨多个模型评估这些案例,迭代向预定义目标(如难度和区分度)前进。准则与案例之间的相互反馈形成了双循环共同进化。准则指导案例生成,而对生成案例的评估结果揭示准则的缺陷。人类注入新种子以解决这些差距,推动准则修订并扩展评估范围。此外,评估案例根据标注者一致性分为共识区和分歧区,每个区域应用不同的标准。

### 3.2 共识-分歧感知评估

**表1:** 开放式对话人类拟真度评估中标注者分歧的代表性案例。每个案例显示同一响应从不同标注者那里获得相反但同样合理的判断,说明固有的主观性。

我们发现,在开放式对话的人类拟真度评估中,标注者间一致性仅为 56.3%,远低于可验证任务通常报告的水平。对于某些案例,标注者达成高度一致,例如存在事实错误、情感不匹配、或自然且共情的响应。对于其他案例,标注者则产生了分歧判断。我们系统分析了分歧的来源,并总结为几个维度。一个是表达风格:标注者对响应长度、对话语气和公式化表达持有不同标准。

相似文章

通过联合生成与评估实现自进化深度研究

arXiv cs.CL

来自香港科技大学、字节跳动和UCL的研究人员提出了SCORE——一种协同进化训练框架,将LLM同时训练为深度研究报告生成器和评估器,并通过元约束机制动态调整评估难度,防止奖励饱和。实验表明,该方法在开放式研究报告质量上取得了持续提升。

基于未来反馈预测的可验证开放式对话技能自我进化

arXiv cs.CL

本文介绍了一种利用未来反馈预测实现开放式对话技能自我进化的方法,将对话反馈转化为固定的离线目标,从而无需实时流量即可进行可复现的技能优化。该方法在保护隐私的销售助手数据集上实现了超过75%的预测准确率。