使用Poly-Encoders实现计算高效的自动化创造力评估
摘要
该论文介绍了一种使用Poly-Encoders的新方法,用于计算高效的自动化创造力评估,其性能与大型语言模型相当,且计算需求显著降低。
arXiv:2608.26165v1 公告类型:新
摘要:自动化创造力评估长期以来一直是一个挑战,传统方法通常资源密集或缺乏实际准确性。我们介绍了一种新方法,使用Poly-Encoder进行计算高效且准确的自动化创造力评估。我们在一个来自科学创造性思维测试的公共数据集上微调了Poly-Encoder,该数据集包含大约18,000个由人工评分的问题回答。我们的方法利用小型预训练BERT编码器,实现了与微调大型语言模型相当的性能,同时显著降低了计算需求。使用BERT系列模型和poly-code计数的实验获得了高达r = 0.74的皮尔逊相关系数,95% CI [0.73, 0.75]与人工评分者匹配,达到了资源密集型LLMs的性能。这项研究弥合了高性能和计算效率之间的差距,有可能在易于获得的消费级硬件上实现自动化创造力评估的广泛应用。尽管有一些局限性,但我们的研究结果表明,Poly-Encoders是LLMs的一个有前途的替代方案,可用于各种背景下实用的、可扩展的创造力评估,尤其是在教育领域。
查看缓存全文
缓存时间: 2026/08/28 09:23
# 使用Poly-Encoder实现计算高效的自动化创造力评估 来源:https://arxiv.org/html/2608.26165 11机构文本:惠勒磁性高中,美国佐治亚州玛丽埃塔 11电子邮件:sam\.grouchnikov@gmail\.com 22机构文本:肯尼索尔州立大学,美国佐治亚州玛丽埃塔 22电子邮件:pgrego10@students\.kennesaw\.edu, jnoh3@kennesaw\.edu ###### 摘要 自动化创造力评估长期以来一直是个挑战,传统方法往往资源消耗大且缺乏实际准确性。我们提出了一种新方法,利用Poly-Encoder实现计算高效且准确的自动化创造力评估。我们在一个来自《科学创造性思维测试》的公共数据集上对Poly-Encoder进行了微调,该数据集包含约18,000个由人类评分的问题回答。我们的方法利用小型预训练BERT编码器,在计算需求显著降低的同时,达到了与微调大型语言模型相当的性能。使用BERT系列模型和不同数量的poly-code进行的实验,与人类评分者达到了高达r=0.74, 95%CI [0.73, 0.75]的皮尔逊相关性,其表现与资源密集型大语言模型(LLMs)相当。本研究弥合了高性能与计算效率之间的差距,有可能在普通消费级硬件上广泛实施自动化创造力评估。尽管存在一些局限性,我们的研究结果表明,Poly-Encoder是大语言模型的一种有前景的替代方案,适用于各种场景(尤其是教育领域)中实际、可扩展的创造力评估。 ## 1 引言 创造力是人类进步的基础,能够在科学、技术、工程和数学等多个领域催生新颖、有价值且可行的想法。然而,评估创造力仍然是一个持续存在的挑战,这最能由其主观性质所凸显[17 (https://arxiv.org/html/2608.26165#bib.bib17)]。传统方法依赖人工评判者,这证明该过程既耗时又资源密集[10 (https://arxiv.org/html/2608.26165#bib.bib10), 1 (https://arxiv.org/html/2608.26165#bib.bib1), 12 (https://arxiv.org/html/2608.26165#bib.bib12)]。即使使用共享的定义和通用的评分标准,评估者之间也常常出现不一致[10 (https://arxiv.org/html/2608.26165#bib.bib10), 7 (https://arxiv.org/html/2608.26165#bib.bib7), 3 (https://arxiv.org/html/2608.26165#bib.bib3)]。这就提出了核心问题:如何利用人工智能来自动化创造力评估,同时仍然捕捉到人类的创作意图? 有效的基于AI的创造力评估需要管理测试复杂性、高效部署以及与人类意图保持一致[23 (https://arxiv.org/html/2608.26165#bib.bib23)]。Transformer模型非常适合这项任务,因为它们旨在准确理解文本上下文并捕捉复杂的语义细微差别[15 (https://arxiv.org/html/2608.26165#bib.bib15)]。通过微调,可以训练这些Transformer模型来识别与各种创造力类型相关的语言模式[6 (https://arxiv.org/html/2608.26165#bib.bib6), 21 (https://arxiv.org/html/2608.26165#bib.bib21)]。 在科学语境中,创造力涉及双重空间搜索:从记忆中生成假设,并通过概括实验来解决问题[4 (https://arxiv.org/html/2608.26165#bib.bib4), 19 (https://arxiv.org/html/2608.26165#bib.bib19)]。因此,自动化模型必须理解科学推理,同时符合包括流畅性、独创性和阐述性在内的心理测量标准[11 (https://arxiv.org/html/2608.26165#bib.bib11), 13 (https://arxiv.org/html/2608.26165#bib.bib13)]。这在教育领域尤为重要,因为基于创造力的评估超越了严格的记忆测试,考察的是发散性思维和问题解决能力[5 (https://arxiv.org/html/2608.26165#bib.bib5), 20 (https://arxiv.org/html/2608.26165#bib.bib20)]。 然而,传统的人工评估可扩展性差。虽然大语言模型(LLMs)提供了一种解决方案,但它们可能不可靠,并且对输入的小变化很敏感[9 (https://arxiv.org/html/2608.26165#bib.bib9)]。此外,依赖GPT-4等基于云的LLMs会引入显著的数据隐私风险和可能对学区来说过于高昂的持续API成本。相比之下,本地部署确保敏感的学生数据保留在学校安全的基础设施内。像Poly-Encoder[16 (https://arxiv.org/html/2608.26165#bib.bib16)]这样高效的替代方案,为使用课堂中可用的消费级硬件进行实时评估提供了更可靠、可扩展和易得的途径。 在本研究中,我们使用Poly-Encoder[16 (https://arxiv.org/html/2608.26165#bib.bib16)]的实施与分析来回答以下问题: 1. 如何训练Poly-Encoder来评估创造力而非相似度? 2. Poly-Encoder的计算效率如何,能否在消费级硬件上使用? ## 2 相关工作 ### 2.1 创造力评估的演变 早期的自动化评估依赖于语义距离模型,如SemDis和GloVe。虽然这些模型在通过词级关系衡量语义(不)相似度方面很有效,但它们无法捕捉语义细微差别和句子级上下文,而这两者对于创造力评估都至关重要[21 (https://arxiv.org/html/2608.26165#bib.bib21)]。这导致人们转向利用大语言模型(LLMs),这些模型在句子级及更深层次上嵌入含义。最初使用GPT-4的基于提示的方法,在新颖性和可行性方面与人类评分的皮尔逊相关性介于0.2到0.67之间[18 (https://arxiv.org/html/2608.26165#bib.bib18)]。然而,这些系统在绝对评分方面存在困难,并且由于依赖调用外部API而缺乏可靠性[22 (https://arxiv.org/html/2608.26165#bib.bib22)]。 ### 2.2 微调预训练语言模型 下一波方法使用了微调,即在由人类评分者评分的问题和回答上训练语言模型。在27,000个替代用途任务响应上微调GPT-3和T5,获得了高达r=0.81的相关性[21 (https://arxiv.org/html/2608.26165#bib.bib21)]。类似地,《科学创造性思维测试》(SCTT)利用包含18,000个响应的数据集微调了LLaMA-2-7b,达到了r=0.74的皮尔逊相关性[4 (https://arxiv.org/html/2608.26165#bib.bib4)]。尽管这些方法表现出强大的评分能力,但它们对LLMs的依赖以及需要重新编码问题/响应,使其在计算上并非最优。 ### 2.3 Poly-Encoder替代方案 Poly-Encoder[16 (https://arxiv.org/html/2608.26165#bib.bib16)]在语义距离模型的效率和微调LLMs的准确性之间提供了一种折衷方案。Poly-Encoder通过使用一组固定大小的可学习全局注意力码,将上下文(或查询)嵌入投影到多个空间[2 (https://arxiv.org/html/2608.26165#bib.bib2), 24 (https://arxiv.org/html/2608.26165#bib.bib24)],从而有潜力学习文本的深层语义表示和创造力的不同方面,而无需LLMs带来的计算开销。当与BERT[8 (https://arxiv.org/html/2608.26165#bib.bib8)]等轻量级编码器结合时,poly-encoder能提供一致、可靠的评分,并可部署在消费级硬件上:这是LLMs无法完成的任务。 ## 3 方法 鉴于准确自动化创造力评估在教育和专业环境中的潜在应用和影响,我们采用并训练了一个Poly-Encoder来评估对问题的回答。这些问题特别围绕科学提示展开,包括研究性探究和假设制定。Poly-Encoder使用PyTorch Lightning实现,训练在三块Nvidia RTX 3090 GPU上以分布式数据并行(DDP)配置执行。 ### 3.1 数据集与训练方案 所有训练和测试数据均来自《科学创造性思维任务》(SCTT)验证研究的作者发布的公共仓库[1]。数据集包含约18,000个响应,每个响应都配有人类分配的、与特定提示相对应的真实创造力标签。共有15个提示,每个提示约有1,200个响应。在我们的系统中,提示作为上下文输入Poly-Encoder,而响应作为候选输入(见图1)。为确认SCTT测试的有效性和可靠性,作者采用了多种统计检验。评分者间信度系数达到w=0.85,重测分析在一个月间隔内显示出中等的时间稳定性,皮尔逊相关系数为r=0.67。采用了传统的70/10/20训练/验证/测试划分(在响应层面)。训练集中的提示也包含在测试集中,而训练集中的响应则未用于测试集。在每个提示内,70%的响应分配给训练集,10%用于验证,20%用于测试。 #### 3.1.1 用于上下文/候选嵌入的BERT 来自Transformer的双向编码器表示(BERT)为语义表示学习提供了坚实的基础[8 (https://arxiv.org/html/2608.26165#bib.bib8)],提供了学习潜力与计算效率的良好结合。为捕捉创造力的细微表示,我们探索了多种BERT系列模型用于上下文和候选编码,逐步增加规模以研究性能权衡(表1)。 表1:测试的BERT模型及其大小和参数数量 #### 3.1.2 测试Poly-Code数量 正如原始Poly-Encoder论文所述,改变poly-code(m)的数量会影响性能和计算成本。理想情况下,减少m不应显著降低结果,这表明表示的高效性。测试期间,除poly-code数量外的所有超参数保持不变。测试的poly-code数量为64、128、256和512。 ### 3.2 架构调整 Poly-Encoder的基础架构采用了Humeau等人[16 (https://arxiv.org/html/2608.26165#bib.bib16)]论文中提出的结构。信息和计算流如图1(a)所示。原始Poly-Encoder架构通过计算poly-context和候选嵌入之间的点积来产生相似度分数。虽然这对于检索和匹配任务有效,但这种机制在更深入的评分任务(如我们的创造力评估案例)中表现不佳。为解决这个问题,最终分数通过将poly-context嵌入通过一个轻量级回归头获得,允许模型识别最终嵌入的非线性。该回归头还处理候选向量以及poly-context和候选向量的逐元素乘积,解决了模型最初在区分候选者方面的困难。回归头本身由多个线性层、一个激活函数和dropout组成。这种架构调整在图1(b)中进行了视觉说明。 参考标题(a)原始Poly-Encoder。 参考标题(b)修改后的Poly-Encoder。 图1:架构对比(原始版 vs 我们的修改版) ## 4 结果 ### 4.1 BERT模型比较 在保持模型其他方面不变的情况下,测试了逐步增大的BERT模型。为确保正确的收敛性,我们从Weights & Biases日志器获取了图表。这些图表如图2(a)所示。BERT模型达到的最终最高相关性如表2所示。DeBERTa-v3-Large与人类创造力分数的相关性最强(p<0.001),优于所有其他测试的编码器。考虑到DeBERTa的解纠缠注意力机制[14 (https://arxiv.org/html/2608.26165#bib.bib14)](该机制通过独立的向量建模内容和位置信息),这一结果符合预期。然而,RoBERTa变体也展示了可比的结果,表明更小、计算效率更高的模型可能达到相似的准确性。但需要注意的是,在所有poly-code数量下,DeBERTa与RoBERTa变体之间的差异都达到了p<0.05。 ### 4.2 Poly-Code数量比较 使用DeBERTa-v3-Large作为编码器,评估了64、128、256和512的poly-code数量,测试相关性图如图2(b)所示。此外,RoBERTa-Base因其低参数量和强相关性的理想组合而被选用于poly-code数量比较。比较结果如表2所示。需要注意的是,在Poly-Encoder中使用DeBERTa-v3-Large达到了与LLaMA-2-7B[4 (https://arxiv.org/html/2608.26165#bib.bib4)]相同的皮尔逊相关性,同时使用的资源仅为LLaMA的一小部分。 参考标题(a)BERT模型比较 参考标题(b)Poly-code (m)数量比较 图2:训练收敛性与皮尔逊相关性结果 表2:不同poly-code数量(m)下的性能对比,含95%置信区间 模型预测分数与人类真实评分对比如图3(a)所示。模型与人类评分表现出高度一致性,在合理阈值内正确预测了大多数创造力分数(真实分数与预测分数之间的百分比差异),如表3(b)所示。此外,使用DeBERTa-v3-Large时,真实分数与预测分数之间的平均绝对误差(MAE)为0.0077,进一步证明了模型的准确性。 参考标题(a)人类评分 vs 模型评分 (b)模型评分阈值精度 图3:性能分析:(a)展示了预测分数与真实分数的相关性;(b)提供了在不同误差阈值下的精确累积精度。 ### 4.3 效率与评分时间 尽管在相关性方面并未优于以往的方法,但Poly-Encoder的真正优势在于其效率。在CPU(Intel i5,常见消费级CPU)上,DeBERTa-v3-Large和RoBERTa-Base模型的最终评分时间(每个候选)分别为0.010秒和0.0022秒。 ## 5 结论 性能与效率:虽然Poly-Encoder在绝对相关性方面并未超越大语言模型,但它们以显著更高的计算效率实现了相当的性能。通过一次性编码提示并利用轻量级基于BERT的编码器,Poly-Encoder绕过了GPT-3和LLaMA-2等大模型带来的巨大内存需求。这种架构允许在消费级硬件上进行亚秒级评分:这是在现实世界部署以及在资源有限的课堂中使用的必要特性。 Poly-Code的影响:与现有文献一致,poly-code(m)数量的变化对模型性能没有显著影响。这证实了poly-code在增强表示能力的同时,对模型大小的影响可以忽略不计。唯一显著影响性能的因素...
相似文章
评估大型语言模型的创造力:测试、局限与新前沿
本文系统评估了针对大型语言模型的人类创造力测试,发现它们无法预测科学构思能力。文章介绍了DRAT,一种结合了聚合思维与发散思维的新测试,能够可靠地预测语言模型的科学构思能力。
推进大型多模态模型中的创造性物理智能
本文介绍了MM-CreativityBench,这是一个用于在物理约束环境下评估大型多模态模型创造性工具使用的基准,并提出了基于功能可见性的对齐方法,利用直接偏好优化来减少幻觉并提高基于事实的推理。
CreativityNeuro:引导语言模型权重以提升发散性思维并减少模式崩溃
介绍CreativityNeuro,一种无需数据的方法,通过引导语言模型权重来增强发散性思维并减少模式崩溃,在不进行重新训练或微调的情况下,在创造力评估中实现了显著改进。
大型语言模型与人类在评估创造力时为何趋同与分歧
本文研究了LLM与人类在评估创造力时何时及为何趋同或分歧,发现对齐程度取决于维度(新颖性方面更强,上下文方面较弱),且不同LLM采用不同标准。
CreativityBench:基于可供性工具重新利用评估智能体创造性推理
本文介绍了 CreativityBench,这是一个用于评估大型语言模型基于可供性推理创造性地重新利用工具能力的基准测试。文章强调,尽管当前模型在通用推理方面表现出色,但在创造性问题解决方面仍面临困难。