解耦分析-判断:一种用于复杂多步创意任务的基于LLM的自动化创意评估器

arXiv cs.CL 论文

摘要

本文介绍了CreaEval,一种针对复杂多步任务的自动化创意评估器,通过解耦分析与判断来减少偏差并提高评估可靠性,实验显示其相比基线平均性能提升22.74%。

arXiv:2609.03432v1 Announce Type: new 摘要:对于LLM-as-a-Judge,自动化评估创意任务仍然具有挑战性,因为LLM容易受到诸如冗长偏差和宽大偏差等偏差的影响。这些局限性在基于上下文且具有流程结构的任务(CGPST)中尤为明显,CGPST是一种复杂的多步创意任务,其中步骤间的依赖性、高度主观性和广泛的评分范围导致更不稳定和有偏见的判断。现有方法要么依赖于特定任务的训练,要么直接应用LLM-as-a-Judge,两者都难以在如此复杂的条件下确保可靠的评估。为弥补这些差距,我们提出了CreaEval,一种针对CGPST的自动化创意评估器,将典型的LLM-as-a-Judge解耦为分析和判断两个阶段。相应地,CreaEval涉及两个关键阶段:记忆增强分析,一个SoT-LLM将多步响应转换为结构化的评估证据,结合跨步骤记忆;基于证据的判断,一个Judge-LLM使用提取的证据进行判断,而不访问原始响应。综合实验表明,CreaEval在CGPST和两个经典简单创意任务中,相比次优基线实现了平均22.74%的性能提升,证明了其泛化能力。代码可在https://github.com/Jaong/CreaEval获取。
查看原文
查看缓存全文

缓存时间: 2026/09/04 06:00

# 解耦式分析-评判:基于大语言模型的复杂多步创造力任务自动化评估方法
来源:https://arxiv.org/html/2609.03432  
作者:吴晋  
所属机构:华东师范大学上海人工智能教育学院  
所属机构:华东师范大学计算机科学与技术学院  
李晓宇  
所属机构:扬州大学教育学院与智能教育研究中心  
郑灿进  
所属机构:华东师范大学上海人工智能教育学院  
周逸峰  
所属机构:华东师范大学数据科学与工程学院  
邮箱:\{51274118009, 52275901018\}@stu\.ecnu\.edu\.cn, chjzheng@dep\.ecnu\.edu\.cn  

###### 摘要
创造力任务的自动化评估对于“LLM担任评判者”(LLM-as-a-Judge)方法而言仍具挑战,因为大语言模型易受冗长偏好和宽容偏见等偏差影响。这种局限性在“基于上下文与基于流程的结构化任务”(CGPST)中尤为明显。此类复杂多步创造力任务因步骤间依赖性强、主观性高以及评分范围广,导致评估更不稳定且易产生偏见。现有方法要么依赖任务特定训练,要么直接应用LLM-as-a-Judge,二者均难以在此类复杂性下确保可靠评估。为弥合这些差距,我们提出了**CreaEval**——一种针对CGPST的自动化创造力评估器,它将典型的LLM-as-a-Judge解耦为分析与评判两个阶段。相应地,CreaEval包含两个关键阶段:**记忆增强分析**(Memory-augmented Analysis),其中SoT-LLM将多步响应转换为结构化评估证据,并融入跨步记忆;以及**基于证据的评判**(Evidence-based Judging),其中Judge-LLM使用提取的证据进行评判,无需访问原始响应。全面实验表明,CreaEval在CGPST和两种经典简单创造力任务上,相比次优基线平均性能提升22.74%,证明了其泛化能力。代码已开源:https://github.com/Jaong/CreaEval。

00脚注:同等贡献。  
00脚注:通讯作者。

## 1 引言
大语言模型的创造力已引起日益增长的关注,其应用于创意写作、新颖数学推理及其他创意领域(Kumar et al., 2025 (https://arxiv.org/html/2609.03432#bib.bib5); Lin et al., 2025 (https://arxiv.org/html/2609.03432#bib.bib9); Ye et al., 2025b (https://arxiv.org/html/2609.03432#bib.bib10))。然而,当前自动化评估方法主要关注简单创造力任务,如“替代用途任务”(AUT)(Lu et al., 2024 (https://arxiv.org/html/2609.03432#bib.bib7))和“托兰斯创造性思维测验”(TTCT)(Kumar et al., 2025 (https://arxiv.org/html/2609.03432#bib.bib5)),而复杂多步创造力任务的自动化评估仍待探索。在创造力任务中,“基于上下文与基于流程的结构化任务”(CGPST)(Wang et al., 2026b (https://arxiv.org/html/2609.03432#bib.bib11))因其高复杂性(包括多步和基于场景的特征)而尤为具有挑战性。CGPST中的每个任务都基于完整的未来场景设定,并需要解决多个相互依赖的步骤(Treffinger, 1995 (https://arxiv.org/html/2609.03432#bib.bib19); Treffinger et al., 2012a (https://arxiv.org/html/2609.03432#bib.bib18))。现有针对上述创造力任务的自动化评估方法主要分为两类。第一类涉及训练任务特定模型,这需要额外的训练资源和标注数据集,开发成本高昂(Do et al., 2024 (https://arxiv.org/html/2609.03432#bib.bib20); Wang and Liu, 2025 (https://arxiv.org/html/2609.03432#bib.bib21); Li and Pan, 2025 (https://arxiv.org/html/2609.03432#bib.bib22))。另一类是LLM-as-a-Judge,一种免训练方法,因其强大的能力而日益占据主导地位(Zheng et al., 2023 (https://arxiv.org/html/2609.03432#bib.bib1); Li et al., 2025 (https://arxiv.org/html/2609.03432#bib.bib2); Ye et al., 2025b (https://arxiv.org/html/2609.03432#bib.bib10))。然而,直接将LLM-as-a-Judge应用于CGPST会导致一致性较低,因为大语言模型常易受冗长偏好和宽容偏见等偏差影响,难以准确捕捉主观维度上细微的分数差异(Wang et al., 2026b (https://arxiv.org/html/2609.03432#bib.bib11))。

表1:CGPST的步骤式信息。完整描述见附录A(https://arxiv.org/html/2609.03432#A1)。  
与其他简单创造力任务相比,将自动化评估应用于CGPST面临几个关键挑战。  
(1) 任务**高度复杂**。与传统创造力任务相比,每个任务需要在场景下评估多个相互依赖的步骤,每个步骤需在多个维度上进行评估。  
(2) 任务**本质上具有主观性**,因为不存在固定答案,且早期响应会影响后续响应,导致输出高度多样化(Zhao et al., 2025 (https://arxiv.org/html/2609.03432#bib.bib6); Wang et al., 2026b (https://arxiv.org/html/2609.03432#bib.bib11))。  
(3) 一些维度涉及**较大的评分范围**(例如10级评分),这进一步增加了评分的不稳定性。

为应对这些挑战,我们提出了**CreaEval**,一种利用大语言模型在复杂多步创造力任务(如CGPST)中进行评估的自动化创造力评估器。受人类评估实践启发——评估者首先分析每个维度的响应,然后根据评分准则打分(Klein et al., 1998 (https://arxiv.org/html/2609.03432#bib.bib26); Harsch and Martin, 2013 (https://arxiv.org/html/2609.03432#bib.bib25))——CreaEval将评估过程解耦为两个阶段:**记忆增强分析**(Memory-augmented Analysis)和**基于证据的评判**(Evidence-based Judging)。在第一阶段,SoT-LLM以“思维结构”(Structure-of-Thought, SoT)的形式(Qi et al., 2025 (https://arxiv.org/html/2609.03432#bib.bib17); Wang et al., 2026a (https://arxiv.org/html/2609.03432#bib.bib16))将原始响应逐步组织为结构化的中间评估证据。考虑到CGPST步骤间的依赖性,CreaEval进一步引入记忆机制,在分析过程中保持跨步一致性。在第二阶段,每个Judge-LLM基于提取的证据和预定义的评分准则进行评分,无需访问原始响应,从而实现基于证据的评分。

与典型的LLM-as-a-Judge相比,这种解耦设计通过结构化证据约束评判,从而缩小合理判断的范围。这不仅提高了评分的准确性和稳定性,还缓解了冗长偏好和宽容偏见。

贡献有三方面:
- • 我们提出了**CreaEval**,一种针对复杂主观创造力任务(如CGPST)的新型自动化创造力评估器,它将典型的LLM-as-a-Judge解耦为记忆增强分析和基于证据的评判。
- • 大量实验表明,CreaEval在CGPST上实现了平均0.64的人机-模型一致性(二次加权Kappa,QWK),比次优基线(监督训练)高出0.17。
- • 进一步分析表明,解耦设计增强了跨维度的评分稳定性,并缓解了LLM-as-a-Judge中的冗长偏好和宽容偏见,为评估创造力任务提供了新见解。

## 2 相关工作
### 2.1 创造力任务
传统创造力任务源于教育学和心理学研究,如AUT,要求参与者为一个常见物品生成尽可能多的新颖用途(Lu et al., 2024 (https://arxiv.org/html/2609.03432#bib.bib7); Zhao et al., 2025 (https://arxiv.org/html/2609.03432#bib.bib6); Organisciak et al., 2023 (https://arxiv.org/html/2609.03432#bib.bib31); Hadas and Hershkovitz, 2024 (https://arxiv.org/html/2609.03432#bib.bib32)),以及TTCT,通过应对开放式非常规场景来评估创造力(Torrance, 1966 (https://arxiv.org/html/2609.03432#bib.bib4); Kumar et al., 2025 (https://arxiv.org/html/2609.03432#bib.bib5))。然而,这些任务通常是单步且结构简单,限制了其捕捉复杂创造性过程的能力。

最近,Wang et al.(2026b)(https://arxiv.org/html/2609.03432#bib.bib11) 提出了CGPST,一个多步、基于场景的基准,用于评估大语言模型的创意问题解决能力。如表1(https://arxiv.org/html/2609.03432#S1.T1)所示,每个任务都基于完整的未来场景,要求大语言模型依次解决六个相互依赖的步骤,涉及多样化的能(Treffinger, 1995 (https://arxiv.org/html/2609.03432#bib.bib19); Treffinger et al., 2012a (https://arxiv.org/html/2609.03432#bib.bib18))。与传统创造力任务相比,CGPST表现出显著更高的复杂性。

图1:我们提出的CreaEval框架。CreaEval将评估过程解耦为两个阶段:1)记忆增强分析。SoT-LLM首先基于响应和维度,以逐步方式提取中间评估证据(蓝色)。2)基于证据的评判。每个Judge-LLM随后基于提取的证据和预定义的评分准则进行评分,无需访问原始响应。

### 2.2 用于创造力评估的LLM-as-a-Judge
最近,一些研究探索了创造力任务的自动化评估方法(Zheng et al., 2023 (https://arxiv.org/html/2609.03432#bib.bib1); Liang et al., 2024 (https://arxiv.org/html/2609.03432#bib.bib3); Li et al., 2025 (https://arxiv.org/html/2609.03432#bib.bib2); Ye et al., 2025b (https://arxiv.org/html/2609.03432#bib.bib10))。例如,Zhao et al. (2025) (https://arxiv.org/html/2609.03432#bib.bib6) 利用GPT-4生成TTCT启发的数据集,并采用大语言模型对响应进行评分。Lu et al. (2024) (https://arxiv.org/html/2609.03432#bib.bib7) 将LLM-as-a-Judge应用于AUT任务,在四个维度上实现了平均0.49的人机-模型一致性(Kendall’s τ),甚至超过了人类间一致性(0.39),这表明LLM-as-a-Judge在提高创造力任务评分可靠性方面具有潜力。然而,现有研究主要关注相对简单和传统的创造力基准。直接将LLM-as-a-Judge应用于更复杂的任务(如CGPST)仍具挑战。例如,Wang et al. (2026b) (https://arxiv.org/html/2609.03432#bib.bib11) 显示,采用少样本提示的直接LLM-as-a-Judge方法仅达到0.31的人机-模型一致性(皮尔逊相关系数,PCC),突显了需要更可靠和有效的框架来评估复杂多步创造力任务。

## 3 方法论
现有的LLM-as-a-Judge未能将分析与评判解耦,而是直接将原始响应Rs={Rts}t=1NR^\{s\}=\\\{R^\{s\}\_\{t\}\\\}\_\{t=1\}^\{N\}(NN=6)映射为分数列表SS。这导致大语言模型在处理复杂创造力任务时无法有效捕捉关键中间证据。为解决这一局限,我们提出**CreaEval**,一种新型评估框架,它以结构化方式明确建模评估过程,将分析与评判解耦。如图1(https://arxiv.org/html/2609.03432#S2.F1)所示,CreaEval包含两个顺序阶段:(1) 记忆增强分析;(2) 基于证据的评判。

### 3.1 阶段一:记忆增强分析
给定原始响应RtsR^\{s\}\_\{t\}和步骤-t的相应维度描述DtD\_\{t\},SoT-LLM以逐步方式执行结构化证据提取。具体来说,它通过联合考虑任务场景Scenario、步骤响应RtsR^\{s\}\_\{t\}和评估维度DtD\_\{t\},迭代处理CGPST的每个步骤。在步骤-t内,CreaEval中的SoT-LLM提取多维证据,表示为结构化映射et=\{⟨ki,vi⟩\}i=1|Dt|e\_\{t\}=\\left\\\{\\langle k\_\{i\},v\_\{i\}\\rangle\\right\\\}\_\{i=1\}^\{\\|\\mathcal\\{D\\}\_\{t\\}\\|},其中每个对⟨ki,vi⟩\\langle k\_\{i\},v\_\{i\\}\\rangle表示一个评估维度kik\_\{i\}及其相应证据viv\_\{i\}。这种渐进式设计防止了SoT-LLM一次性处理所有主观信息,从而提高了提取证据的可靠性和一致性。

CGPST的步骤表现出强烈的时间依赖性,因为后续步骤的响应取决于前期步骤做出的决策。例如,步骤-3提出的解决方案旨在解决步骤-2中确定的问题。为建模这些依赖性,CreaEval引入了记忆机制,保存步骤相关的记忆状态mtm\_\{t\}。具体来说,除了生成证据ete\_\{t\}外,SoT-LLM还产生相应的mt=Summary(Rts,Mt−1)m\_\{t\}=Summary(R^\{s\}\_\{t\},M\_\{t\-1\}),它总结RtsR^\{s\}\_\{t\}中的关键信息,并作为上下文输入传递到后续步骤,如图1(https://arxiv.org/html/2609.03432#S2.F1)所示。此机制保留了跨步上下文依赖性,从而增强了证据提取过程并提高了准确性,定义为:
(et,mt)=fSoT(Scenario,Rts,Dt,Mt−1)(e\_\{t\},m\_\{t\})=f\_\{SoT\}(Scenario,R^\{s\}\_\{t\},D\_\{t\},M\_\{t\-1\})(1)
其中ete\_\{t\}和mtm\_\{t\}分别表示SoT-LLM在步骤-t提取的评估证据和记忆状态。D={Dt}t=1ND=\\\{D\_\{t\}\\\}\_\{t=1\}^\{N\}和Rs={Rts}t=1NR^\{s\}=\\\{R^\{s\}\_\{t\}\\\}\_\{t=1\}^\{N\}分别表示所有步骤的维度信息和原始响应。Mt−1={mj}j=1t−1\{M\_\{t\-1\}\}=\\\{m\_\{j\}\\\}\_\{j=1\}^\{t\-1\}表示先前步骤累积的记忆,以保留跨步依赖性。

### 3.2 阶段二:基于证据的评判
在此阶段,Judge-LLM基于阶段一生成的结构化证据进行评分。Judge-LLM并非直接访问原始响应RsR^\{s\},而是将聚合的证据EE、评分准则RuR^\{u\}和Scenario作为输入,并在单次传递中生成整个响应的多步多维分数SS,定义为:
S=fJudge(Scenario,E,D,Ru)S=f\_\{Judge\}(Scenario,E,D,R^\{u\})(2)
其中E={et}t=1NE=\\\{e\_\{t\}\\\}\_\{t=1\}^\{N\}和Ru={Rtu}t=1NR^\{u\}=\\\{R^\{u\}\_\{t\}\\\}\_\{t=1\}^\{N\}分别表示SoT-LLM提取的所有步骤的证据和评分准则。如图1(https://arxiv.org/html/2609.03432#S2.F1)所示,考虑步骤-2中的“充分性”(Adequacy)维度:提取的证据(例如,“重要性低”和“次要问题”)表明在该维度上表现较弱,因此Judge-LLM给出了相对较低的分数(10分中的6分)。这种基于证据的评判增强了最终评分的准确性和稳定性。

## 4 实验
### 4.1 挑战性数据集
我们在“基于上下文与基于流程的结构化任务”(CGPST)数据集(Wang et al., 2026b (https://arxiv.org/html/2609.03432#bib.bib11))上进行实验,这是一个复杂的多步创造力基准。它基于“未来问题解决国际项目”(FPSPI)(Treffinger et al., 2012b (https://arxiv.org/html/2609.03432#bib.bib33); Alt et al., 2022 (https://arxiv.org/html/2609.03432#bib.bib34); Wang et al., 2026b (https://arxiv.org/html/2609.03432#bib.bib11))有着坚实的心理学基础,这是一个由心理学家Ellis Paul Torrance创立(Torrance, 1966 (https://arxiv.org/html/2609.03432#bib.bib4))的活跃国际创造力竞赛框架,拥有超过50年的历史。每个任务

相似文章

面向LLM-as-a-Judge的动态评估准则生成与优化

arXiv cs.CL

本文提出了一种无需训练的方法,可以在无需人工标注的情况下自动生成细粒度的评估准则用于LLM-as-a-Judge,并进一步介绍了一种迭代微调策略,使准则生成器的性能超过更大的专有模型。