GENIE:一种用于衡量新颖性的细粒度指标

arXiv cs.CL 论文

摘要

GENIE 是一种细粒度评估指标,用于衡量大语言模型在特定任务特征上的响应新颖性,相比整体性指标能提供更多洞察。

arXiv:2606.12790v1 公告类型: 新 摘要:大型语言模型在各项任务中始终表现出缺乏创造力和多样性的特点。以往的研究主要关注模型是否能够生成创造性输出。在此,我们旨在考虑新颖性,并以任务特定的方式探究模型生成内容新颖或不新颖的原因。我们提出了一种细粒度评估指标 GENIE,用于衡量响应在特定任务特征上相对于响应总体的新颖性。我们表明,与 GENIE 不同,整体性指标难以捕捉新颖性的高维特性,且无法提供有关其目标属性的洞察。最后,我们使用 GENIE 来衡量解决创造力问题的缓解方法的有效性,以更好地理解这些方法在哪些方面能够提升新颖性。
查看原文
查看缓存全文

缓存时间: 2026/06/12 08:50

# Genie: 一种细粒度的新颖性度量指标

来源:https://arxiv.org/html/2606.12790

Ramya Namuduri¹, Manya Wadhwa², Anshun Asher Zheng¹, Greg Durrett², Junyi Jessy Li¹  
¹德克萨斯大学奥斯汀分校  
²纽约大学  
[email protected]

###### 摘要

大型语言模型在各类任务中一直表现出缺乏创造力和多样性的特点。先前的工作主要关注模型是否能够生成创造性输出。本文旨在研究新颖性,并探讨在特定任务中,模型生成的内容为何新颖或不新颖。我们提出了一种细粒度的评估指标 **Genie**,用于衡量响应相对于响应群体在任务特定特征上的新颖性。我们证明,与 **Genie** 不同,整体性指标难以捕捉新颖性的高维特性,也无法提供关于它们针对哪些属性的见解。最后,我们使用 **Genie** 来衡量旨在提升创造力的缓解方法的有效性,以更好地理解这些方法能在哪些方面改善新颖性。

![[未标注图片]](https://arxiv.org/html/2606.12790v1/figures/genie.png)

**Genie: 一种细粒度的新颖性度量指标**
Ramya Namuduri¹, Manya Wadhwa², Anshun Asher Zheng¹, Greg Durrett², Junyi Jessy Li¹
¹德克萨斯大学奥斯汀分校
²纽约大学
[email protected]
代码 (https://github.com/AlliteraryAlligator/GENIE/tree/main)[![[未标注图片]](https://arxiv.org/html/2606.12790v1/figures/hf-logo.png)数据](https://huggingface.co/collections/AlliteraryAlligator/genie)项目页面 (https://alliteraryalligator.github.io/GENIE/)

## 1 引言

LLM 能否创作出创造性作品?先前的工作发现,模型在多种任务中难以生成多样化和创造性的输出 (Jiang et al., 2026 (https://arxiv.org/html/2606.12790#bib.bib19),使用词汇语义方法 (Zhang et al., 2025 (https://arxiv.org/html/2606.12790#bib.bib55); Lu et al., 2025 (https://arxiv.org/html/2606.12790#bib.bib26); Ismayilzada et al., 2025 (https://arxiv.org/html/2606.12790#bib.bib18))、创造力测试 (Wenger and Kenett, 2025 (https://arxiv.org/html/2606.12790#bib.bib49); Wadhwa et al., 2026 (https://arxiv.org/html/2606.12790#bib.bib46)) 以及人类专家 (Chakrabarty et al., 2024 (https://arxiv.org/html/2606.12790#bib.bib6))。模型创造力已通过多种指标在多种任务上得到测试。然而,先前的工作并未精确定位模型在特定任务上**缺乏创造力的具体方面**。新颖性是创造力的关键组成部分 (Boden, 1991 (https://arxiv.org/html/2606.12790#bib.bib3)),其中响应的独特性可归因于任务特定的不同原因。例如,**情节**和**角色发展**等特征与叙事写作相关,而**动机**和**方法论**则适用于科学发现。两个响应可能都极具原创性,但它们在使其新颖的方面却可能大相径庭。同样,一个响应可能在某些方面显得新颖,而在其他方面则显得平凡。例如,图1 (https://arxiv.org/html/2606.12790#S1.F1) 展示了 LLM 生成的响应如何同时具备独特和平庸的特征。然而,这种细粒度的新颖性并未被许多现有的整体性创造力指标捕捉到。与其他响应的余弦距离以及其他创造力指标 (Zhang et al., 2025 (https://arxiv.org/html/2606.12790#bib.bib55); Chakrabarty et al., 2025a (https://arxiv.org/html/2606.12790#bib.bib7); Fein et al., 2026 (https://arxiv.org/html/2606.12790#bib.bib11); Shaib et al., 2024 (https://arxiv.org/html/2606.12790#bib.bib42)) 虽然具有参考价值,但未能描述一个实例为何或多或少具有新颖性。

参见图注
图 1:**Genie** 的高层动机。现有的整体性指标未能捕捉新颖性的高维特性,而 **Genie** 的细粒度方法则提供了可解释性。

我们提出 **Genie**(**G**ranular **E**valuation of **N**ovel **I**deas with **E**xplainability,具备可解释性的细粒度新颖思想评估框架),该框架通过提取响应中存在的**特征**(相对于预定义的群体),量化了区分同等新颖响应的细粒度细微差别。受问题替代语义学文献的启发 (Hamblin, 1957 (https://arxiv.org/html/2606.12790#bib.bib14); Karttunen, 1977 (https://arxiv.org/html/2606.12790#bib.bib21); Lahiri, 2001 (https://arxiv.org/html/2606.12790#bib.bib24)),我们通过生成问题并将其映射到与任务自动相关的特征上,并通过测量答案之间的相似度来评估细粒度新颖性。Genie 专注于自动提取的**特征**,将新颖性与创造力的其他组成部分(如价值,即质量;Boden (1991 (https://arxiv.org/html/2606.12790#bib.bib3)))分离开来。这与某些现有指标不同,后者包含了响应的质量 (Chakrabarty et al., 2025a (https://arxiv.org/html/2606.12790#bib.bib7)) 或预测的审美价值 (Fein et al., 2026 (https://arxiv.org/html/2606.12790#bib.bib11))。通过将特征提取与**任务**绑定,Genie 的方法本质上具有领域无关性。Genie 的抽象层次(使用问答形式)使其能够比较不同指令遵循能力的模型,特别是对于指令遵循能力较差、表现出更大多样性但质量较低的模型 (West and Potts, 2025 (https://arxiv.org/html/2606.12790#bib.bib50); Le Bronnec et al., 2024 (https://arxiv.org/html/2606.12790#bib.bib25); Hamilton, 2024 (https://arxiv.org/html/2606.12790#bib.bib15))。此外,在没有参考点的情况下整体判断响应的独特性可能具有主观性。先前的工作使用了预训练语料库 (Lu et al., 2025 (https://arxiv.org/html/2606.12790#bib.bib26))、其他模型生成的 (Jiang et al., 2026 (https://arxiv.org/html/2606.12790#bib.bib19))、人类 (Wenger and Kenett, 2025 (https://arxiv.org/html/2606.12790#bib.bib49)) 或**自生成**的 (Zhang et al., 2026 (https://arxiv.org/html/2606.12790#bib.bib54), 2025 (https://arxiv.org/html/2606.12790#bib.bib55)) 响应作为参考点。在本工作中,我们使参考点明确化:**Genie** 测量的是相对于**一个群体**的新颖性;这个群体由用户定义。我们探索了创意写作领域。Genie 独立发现了该任务的 77 个细粒度特征,这些特征大致对应于理论定义的分类法 (Hamilton et al., 2026 (https://arxiv.org/html/2606.12790#bib.bib16))。我们构建并使用了由 21 个 LLM 生成的响应群体来评估 **Genie** 对在这些特征上仅有细微差异的 LLM 响应对的**敏感性**。Genie 成功检测到了这些响应对在细粒度新颖性上的差异。Genie 还展示了在仅通过释义改变的响应对上的**鲁棒性**;在这些情况下,它**没有**检测到任何特征上的显著差异。此外,我们进行了人类研究来内在评估组成 Genie 的各个组件。Genie 的细粒度为衡量新颖性、多样性和创造力的现有整体性指标提供了诊断视角。我们发现,这些指标要么捕捉到了有时与新颖性虚假相关的无关属性,要么在词汇层面敏感。此外,许多现有的缓解方法,如替代提示 (Zhang et al., 2026 (https://arxiv.org/html/2606.12790#bib.bib54); Huot et al., 2025 (https://arxiv.org/html/2606.12790#bib.bib17)) 和解码策略 (Peeperkorn et al., 2025 (https://arxiv.org/html/2606.12790#bib.bib35)) 等用于提升创造力的方法,已经通过这些整体性指标进行了评估。我们展示了 Genie 如何提供更具可解释性的评估,揭示了这些方法实际上**优化了哪些特征**(如果确实有优化的话)。

参见图注
图 2:**Genie** 使用自动发现的特定任务特征,捕捉目标响应相对于响应群体的细粒度新颖性。此处,Genie 发现了创意写作的特征及其描述。我们为给定的提示 p (步骤 3) 生成问题,并将每个问题映射到一个特征。步骤 2 计算群体中问题的答案。最后,Genie 使用平均成对答案不相似度,沿着每个特征(如设定或情节)测量目标响应相对于该群体的新颖性。

## 2 相关工作

越来越多的研究关注 LLM 是否具有创造力,这些研究借鉴了认知科学和计算创造力的理论框架。许多研究将 Boden 的创造力理论操作化 (Franceschelli and Musolesi, 2024 (https://arxiv.org/html/2606.12790#bib.bib12); Ismayilzada et al., 2025 (https://arxiv.org/html/2606.12790#bib.bib18); Schapiro et al., 2025 (https://arxiv.org/html/2606.12790#bib.bib41); Nagarajan et al., 2025 (https://arxiv.org/html/2606.12790#bib.bib31); Wadhwa et al., 2026 (https://arxiv.org/html/2606.12790#bib.bib46)),另一些则改编了心理测量测试,如托兰斯创造性思维测试 (Chakrabarty et al., 2024 (https://arxiv.org/html/2606.12790#bib.bib6))。过去的工作还关注了 LLM 输出的同质化效应 (Wenger and Kenett, 2025 (https://arxiv.org/html/2606.12790#bib.bib49); Jiang et al., 2026 (https://arxiv.org/html/2606.12790#bib.bib19)),并将其归因于后训练对齐方法 (Padmakumar and He, 2024 (https://arxiv.org/html/2606.12790#bib.bib33); West and Potts, 2025 (https://arxiv.org/html/2606.12790#bib.bib50); Slocum et al., 2025 (https://arxiv.org/html/2606.12790#bib.bib43))。此外,还有评估写作创造力的特定领域基准 (Fein et al., 2026 (https://arxiv.org/html/2606.12790#bib.bib11); Chakrabarty et al., 2025a (https://arxiv.org/html/2606.12790#bib.bib7); Xu et al., 2025 (https://arxiv.org/html/2606.12790#bib.bib51); Fein et al., 2026 (https://arxiv.org/html/2606.12790#bib.bib11); Zhang et al., 2025 (https://arxiv.org/html/2606.12790#bib.bib55))。大多数工作都在问模型是否具有创造力;而我们则询问给定响应的新颖性体现在哪里,并将其判断分解到任务特定的特征上。

近期的工作提出了用于评估文本生成中新颖性和创造力的明确指标和基准。一种常见方法是使用预训练语料库作为参考,将原创性量化为 n-gram 的比例 (Lu et al., 2025 (https://arxiv.org/html/2606.12790#bib.bib26); Padmakumar et al., 2026 (https://arxiv.org/html/2606.12790#bib.bib34); Merrill et al., 2024 (https://arxiv.org/html/2606.12790#bib.bib28))。NoveltyBench (Zhang et al., 2025 (https://arxiv.org/html/2606.12790#bib.bib55)) 通过检查输出是否属于预先存在的独特响应聚类之一来操作化多样性。过去的工作还训练了基于人类偏好数据的奖励模型来直接对创意写作进行评分 (Chakrabarty et al., 2025a (https://arxiv.org/html/2606.12790#bib.bib7); Fein et al., 2026 (https://arxiv.org/html/2606.12790#bib.bib11); Cao et al., 2026 (https://arxiv.org/html/2606.12790#bib.bib5))。在所有先前的工作中,新颖性被简化为一个标量,其参考是隐式的,或者通过表面单位(如 n-gram 或分布语义)来计算。QUDsim (Namuduri et al., 2025 (https://arxiv.org/html/2606.12790#bib.bib32)) 将相似性分解为话语层面的讨论问题 (QUD) (Roberts, 2012 (https://arxiv.org/html/2606.12790#bib.bib39); Velleman and Beaver, 2016 (https://arxiv.org/html/2606.12790#bib.bib45); Beaver et al., 2017 (https://arxiv.org/html/2606.12790#bib.bib2))。这确立了测量跨文档相同问题答案相似性的有效性。然而,QUD 捕捉的是话语,而 **Genie** 将新颖性分解为任务层面的特征,并针对明确的群体,将内容与输出评估的质量和审美分离开来。

## 3 新颖性度量指标 Genie

考虑一个由模型生成的文档群体 D_pop = {d_1, ..., d_m},这些文档是从提示 P 生成的。目标文档 d_t ∉ D_pop 的新颖性定义为它沿各个**特征**与所有 d ∈ D_pop 的相对不相似度。直观上,独特的响应与其他响应在特征上的共同点更少。Genie 是可解释的,因为每个特征都与自然语言定义相关联;在展开时,可以通过精确定位该特征下特定于提示的问题,以及我们计算相似度的自然语言答案,来获得进一步的可解释性。

### 3.1 特征

特征是任务特定的轴,旨在最大化对任务不同特性的覆盖。例如,创意写作这样的任务可能包含**情节**、**设定**和**视角**等特征。另一方面,**动机**和**方法论**可能适用于评估科学发现的新颖性。为任务手动定义这些特征可能是繁琐、主观或不可行的(由于缺乏专业知识)。相反,我们自动**发现**特征。我们提示一个 LLM 在给定任务(如创意写作)的情况下,形成带有描述的特征,重复 k 次。然后将结果集进行聚类,以找到常见的重复特征。具体来说,我们发现 N 个聚类,并将其标记为 F = {f_1, ..., f_N},形成**特征**集。图 2 (https://arxiv.org/html/2606.12790#S1.F2) 中的步骤 1 和 2 展示了我们如何为创意写作任务发现特征。每个特征 f 是一个函数 f: D → V_f,它将文档映射到其特征值,其中 D 是所有文档的集合,V_f 是特征可能取的所有值的集合。

### 3.2 Genie 评分

Genie 通过问题生成和回答来提取文档中每个特征 f ∈ F 的值(即 f(d))。这里,问题生成是一个中间过程,它将 F 具体化为特定于提示的维度,从而使特征值能够通过回答问题更可靠地提取。这一范式采用了问题的替代语义学视角 (Hamblin, 1957 (https://arxiv.org/html/2606.12790#bib.bib14); Karttunen, 1977 (https://arxiv.org/html/2606.12790#bib.bib21); Lahiri, 2001 (https://arxiv.org/html/2606.12790#bib.bib24)),其中分层组织的问题用于将可能的世界分割成“回答相同问题”的子空间,在我们的情况下是“相同特征 f 的值”,从而允许我们测量**每个特征**的新颖性。

##### 提示特定分解

给定一个提示 p ∈ P,我们生成一个问题集 Q = {q_1, ..., q_j}(见图 2 (https://arxiv.org/html/2606.12790#S1.F2) 中的步骤 3)。Q 集是在不知道 F 的情况下形成的,这样生成的问题特定于 p,同时不会过度拟合到已发现特征的分类体系。

##### 特征映射

然后,我们将 Q 中的每个问题映射到**恰好一个**特征 f ∈ F(图 2 (https://arxiv.org/html/2606.12790#S1.F2) 中的步骤 3)。映射到特征 f 的子集问题记作 Q_f ⊆ Q。我们可以将特征值 f(d) ∈ V_f 表示为文档 d 对于 Q_f 的答案集(见图 2 (https://arxiv.org/html/2606.12790#S1.F2) 中的步骤 2)。

##### Genie

d_t 的 **Genie** 新颖性定义为由一个向量组成,该向量包含沿每个特征 f ∈ F 的个体新颖性分数:

G(d_t) = [G_{fea}

相似文章

为何AI需要“Genie系数”

Reddit r/ArtificialInteligence

本文提出一个“Genie系数”来衡量AI代理理解用户意图的程度,认为当前的基准测试未能捕捉用户所说与所想之间的差距。

来自可学习新奇性的智能

arXiv cs.LG

本文提出“可学习新奇性”作为统计、复杂系统和自适应行为中智能的统一原理,并提供了一个使用储层计算的可微估计器,该估计器无需任何监督即可展示复杂性生成、抽象和探索。

Genie 3:世界模型的新前沿

Google DeepMind Blog

DeepMind 发布 Genie 3,一个通用世界模型,能够从文本提示生成交互式环境,分辨率达 720p、帧率 24fps,相比前代版本具有更好的一致性和实时交互能力。

GENEB:为何基因组模型难以相互比较

arXiv cs.CL

GENEB 是一个大规模诊断基准,在统一的探测协议下,跨 13 个功能类别的 100 项任务对 40 个基因组基础模型进行评估。研究结果揭示了综合排行榜的不稳定性,以及架构匹配度往往比模型规模更具决定性影响。该工作旨在解决基因组机器学习领域评估体系碎片化的问题,类似于 MTEB 在 NLP 领域所做的工作。