评估AI生成内容的多样性:多样性曲线方法
摘要
本文引入多样性曲线作为评估AI生成内容多样性的曲线值方法,通过提供更透明且分辨率感知的框架,解决模糊标量指标的局限性。
arXiv:2608.17731v1 Announce Type: new
摘要:多样性是评估生成式人工智能(AI)系统的基本标准,但其测量本质上是模糊的。现有方法通常将生成的样本表示在嵌入空间中,计算成对距离或相似度,并将其聚合为单一的标量分数。这种标量摘要虽然方便,但常常编码了不同的归纳偏差,并可能导致相同样本集的排名矛盾。在本文中,我们认为当AI生成内容的多样性评估被简化为单一数字时,其本质上是不充分指定的。我们首先回顾代表性的多样性指标,然后从两个互补的角度诊断其局限性:公理分析表明没有代表性的标量指标能同时满足所有理想属性,而实证分析显示高维表示空间可能诱导集中的、模态依赖的距离分布。为了解决这些问题,我们提出多样性曲线:曲线值、条件感知的摘要,评估参数化多样性族在指定表示和距离或核函数下,跨越一系列阈值、尺度、指数或阶次。多样性曲线揭示了比较是否在不同分辨率下稳健,还是依赖于任意的参数选择。我们实例化了几个代表性指标族的曲线,并展示了它们在生成式AI评估中的实际应用。总体而言,多样性曲线为比较AI生成内容的多样性提供了更透明且分辨率感知的框架。
查看缓存全文
缓存时间: 2026/08/19 10:14
# 使用多样性特征曲线评估人工智能生成内容的多样性 来源:https://arxiv.org/html/2608.17731 作者:Xuege Hou, Guoqing Liu(隶属:微软AI科学研究院),杨晓,李洁然,孙东彪,José Miguel Hernández-Lobato,张昊,刘学(致谢:通讯作者:张昊。隶属:清华大学电子工程系,MBZUAI,隶属:剑桥大学工程系,隶属:麦吉尔大学Mila - 魁北克AI研究所,[email protected],[email protected]) ###### 摘要 多样性是评估生成式人工智能系统的基本标准,但其测量本质上是模糊的。现有方法通常将生成的样本表示在嵌入空间中,计算成对距离或相似度,并将其聚合成单个标量分数。这种标量摘要虽然方便,但它们通常编码了不同的归纳偏置,并可能导致对同一组样本产生矛盾的排序。本文认为,当人工智能生成内容的多样性评估简化为单一数字时,其本质上是定义不明确的。我们首先回顾了代表性的多样性指标,然后从两个互补的角度诊断其局限性:公理分析表明没有代表性的标量指标能同时满足所有理想性质;实证分析表明高维表示空间可能导致距离分布集中且依赖模态。为解决这些问题,我们提出了多样性特征曲线:一种曲线值、条件感知的摘要,它在给定的表示空间、距离或核函数下,评估参数化多样性系列在阈值、尺度、指数或阶数范围内的表现。多样性特征曲线揭示了比较结果是否在不同分辨率下稳健,还是依赖于任意的参数选择。我们为几个代表性的指标系列实例化了这些曲线,并展示了它们在生成式AI评估中的实际用途。总体而言,多样性特征曲线提供了一个更透明、具有分辨率感知能力的框架,用于比较人工智能生成内容的多样性。 ## 1引言 多样性长期以来一直是自然科学中的一个核心概念。在生态学中,它以生物多样性的名义进行研究,研究人员不仅寻求量化一个群落中存在多少物种,还寻求量化个体在物种间的分布均匀程度以及物种间的独特程度[15]。经典的生物多样性指数,如香农熵[26]、辛普森指数[27]和希尔数[11],因此在比较生物群落方面发挥了核心作用。这一文献的一个关键教训是,多样性不是一个单一的原始概念:丰富度、均匀度、稀有性和相异性描述了一个种群中相关但不同的方面[16]。 在生成式人工智能时代,多样性评估已成为一个日益重要且具有挑战性的问题。生成模型不仅需要产生高质量的样本,还需要避免模式崩溃、过度重复以及对目标域的覆盖过于狭窄[29]。这个问题跨越了多种模态,包括图像、自然语言、图结构和分子。例如,在自然语言生成中,多样性可能指的是主题、推理路径、词汇选择、语法形式或语义意义的变化。这些概念在不同的分辨率上运作,并且通常由不同的表示方式诱导,使得难以用单一的通用标量来概括多样性[24]。 近期工作中的一个常见策略是将生成的样本嵌入到一个表示空间中,计算成对距离或相似度,然后将得到的矩阵聚合成一个多样性分数。代表性的指标包括平均成对距离[5]、基于能量的分数[30]、基于阈值的打包指标(如 Circles[33])、基于相似谱的方法(如 Vendi 分数[8][23])以及度量空间量值[20]。这些指标很有用且通常可解释,但它们编码了不同的归纳偏置。因此,不同的指标可能对相同的两个生成集给出相反的排序。 这种模糊性不仅仅是一个实现问题。我们认为,标量多样性评估本质上是定义不明确的。首先,广泛使用的多样性指标满足不同子集的理想公理,如大小单调性、对重复不变性、对成对距离的单调性和连续性。没有代表性的标量指标能在其自然定义域内同时满足所有这些性质。其次,许多现代多样性指标包含一个尺度、阈值、指数或阶数参数。即使在同一个指标系列内,该参数的不同选择也可能导致不同的结论。第三,生成式AI评估通常在高维表示空间中进行,成对距离可能集中,并且有意义的尺度范围强烈依赖于嵌入模型、模态和距离函数。 (a)Circles 特征曲线(b)Vendi 分数特征曲线(c)量值特征曲线 图1:一个最小一维示例的多样性特征曲线。集合 \(A=\{1,2,3\}\),集合 \(B=\{0,4\}\),距离通过绝对差来度量。扫描三个代表性多样性指标的特征曲线参数揭示了依赖分辨率的比较,说明了单一标量多样性分数如何模糊重要的权衡。图1说明了这个最小示例中的问题。丰富度倾向于 \(A\),因为 \(A\) 包含三个不同的元素,而 \(B\) 包含两个。平均距离倾向于 \(B\),因为 \(B\) 的两个元素相距更远。参数化指标进一步揭示,比较结果可能取决于所选的分辨率:随着阈值、阶数或尺度参数的变化,Circles、Vendi 分数和量值的曲线可能会交叉。因此,报告单个数字可能隐藏重要的权衡,并可能允许任意的指标或参数选择来决定声称的结论。 为解决这个问题,我们提出使用**多样性特征曲线**来评估人工智能生成内容的多样性。多样性特征曲线没有引入另一个标量指标,而是报告了一个参数化多样性系列在一系列有意义的参数值范围内的行为。生成的曲线提供了在给定表示空间、距离或相似性函数、指标系列和参数域下,对多样性的条件感知摘要。多样性特征曲线直观易懂:当一条曲线在整个参数域上都支配另一条曲线时,多样性比较对分辨率选择是稳健的;当曲线交叉时,交叉直接揭示了依赖尺度的权衡,而这种权衡会被单一标量分数所掩盖。 多样性特征曲线还使得不仅可以在固定指标系列内跨分辨率比较生成的样本集,还可以跨不同的多样性指标系列进行比较。由于不同的指标强调多样性的不同方面,联合检查它们的特征曲线有助于区分哪些结论是特定于指标系列的,哪些结论在多个多样性概念下是稳健的。在计算上,构建特征曲线的额外成本不高,使得该方法适用于常规的生成式AI评估。 我们的贡献如下: - 我们全面回顾了用于人工智能生成内容的代表性多样性指标,并通过公理分析和高维表示空间的几何特性,诊断了使用标量指标进行多样性评估的局限性。 - 我们引入了多样性特征曲线,作为曲线值、条件感知的摘要,通过阈值、尺度、指数或阶数来比较生成的样本集,而不是在单一任意参数值下进行比较。 - 我们为几个代表性的指标系列(包括能量、Circles、Vendi 分数和量值)实例化了多样性特征曲线,并展示了特征曲线比较如何既可用于跨分辨率在单个指标系列内,也可跨指标系列以获得更稳健的多样性评估。我们还讨论了它们的特征曲线属性、直观解释以及在生成式AI评估中的计算实用性。 总体而言,多样性特征曲线将多样性评估的目标从选择一个自认为最佳的标量指标,转向刻画多样性比较在不同分辨率和不同指标系列下的行为。这种视角使多样性评估更加透明、直观、对任意超参数选择的敏感性更低,并更好地契合生成式AI中多样性的多面性。 ## 2用于人工智能生成内容的现有多样性指标 多样性是评估生成式AI系统跨图像、文本、图结构、分子等模态的核心标准。一种常见的方法是首先将每个生成项表示在嵌入或特征空间中,计算所得表示之间的成对距离,然后通过一个标量分数来概括所得的矩阵。我们将这一大类称为*基于距离的多样性指标*。由于嵌入模型和距离函数决定了被测量的几何形状,此类指标应被解释为依赖于表示的多样性摘要。 ###### 定义 1(基于距离的多样性指标)。 令 \(X=\{x_1,...,x_n\}\) 表示一个有限集合(或多集)的生成项。令 \(d\) 是定义在表示空间上的非负成对距离(不相似度),并令 \(D\in\mathbb{R}_{\geq 0}^{n\times n}\) 为相应的距离矩阵,其元素为 \[D_{ij}=d(x_i,x_j).\] 一个基于距离的多样性指标是一个置换不变的泛函 \[\mu_n:\mathcal{D}_n\rightarrow\mathbb{R},\qquad\mu_n(D)=\mu_n(PDP^{\top})\] 对于任意置换矩阵 \(P\) 成立,其中 \(\mathcal{D}_n\) 表示可接受的成对距离矩阵集合。此类指标仅使用 \(X\) 中元素间的成对关系来量化多样性。 我们在下面回顾几个代表性的例子。 ###### 定义 2(平均距离[5])。 对于 \(n\geq 2\),平均成对距离(AvgDist)为 \[\mu_{\mathrm{AvgDist}}(D):=\frac{1}{n(n-1)}\sum_{i\neq j}D_{ij}.\] 该指标也常被称为内部多样性,简单、可解释,并在生成式建模应用中广泛使用。 ###### 定义 3(能量[30])。 对于 \(s>0\),基于能量的多样性分数为 \[\mu_{\mathrm{Energy}}(D;s):=-\frac{1}{n(n-1)}\sum_{i\neq j}\frac{1}{D_{ij}^s}.\] 指数 \(s\) 控制对小成对距离的惩罚强度。该泛函受排斥粒子势能的启发:包含非常近的粒子对的构型会受到大的惩罚。仅当所有 \(i\neq j\) 满足 \(D_{ij}>0\) 时,该分数才有良好定义;在实践中,实现方式可能会添加一个小的 \(\varepsilon>0\) 以避免奇点。 ###### 定义 4(Circles[33])。 对于阈值 \(\tau\geq 0\),定义 \[\mu_{\mathrm{Circles}}(D;\tau):=\max_{S\subseteq X}|S|,\quad\text{s.t.}\quad D_{ij}>\tau,\quad\forall\,i\neq j\text{ such that }x_i,x_j\in S.\] 该指标度量元素间相互间距大于 \(\tau\) 的最大生成项子集的大小。当 \(d\) 是一个度量时,它与打包数[31]一致。 ###### 定义 5(Vendi 分数[8][23])。 Vendi 分数是基于相似度的。令 \(K\in\mathbb{R}^{n\times n}\) 是一个对称半正定相似度矩阵,具有归一化的对角元素(例如 \(K_{ii}=1\)),可直接从相似度函数获得,或间接从 \(D\) 通过核变换得到。令 \(\lambda_1,...,\lambda_n\) 表示 \(K/n\) 的特征值,因此 \(\lambda_i\geq 0\) 且 \(\sum_i\lambda_i=1\)。对于阶数 \(q>0\) 且 \(q\neq 1\),阶数为 \(q\) 的 Vendi 分数为 \[\mu_{\mathrm{Vendi}}(K;q):=\left(\sum_{i=1}^n\lambda_i^q\right)^{\frac{1}{1-q}}.\] 原始的 Vendi 分数在极限 \(q\to 1\) 时得到: \[\mu_{\mathrm{Vendi}}(K;1):=\exp\left(-\sum_{i=1}^n\lambda_i\log\lambda_i\right),\] 约定 \(0\log 0=0\)。因此,当 \(q=1\) 时,Vendi 分数是香农熵的指数;当 \(q\neq 1\) 时,是瑞利熵的指数。阶数为 \(2\) 的情况与瑞利核熵[14]密切相关,并且已经提出了傅里叶特征近似方法来扩展相关的核熵计算[22]。 ###### 定义 6(量值[20])。 令 \(Z_t(D)\in\mathbb{R}^{n\times n}\) 为相似度矩阵 \[[Z_t(D)]_{ij}=\exp(-t\cdot D_{ij}),\quad t>0.\] 如果 \(Z_t(D)\) 是非奇异的,则尺度 \(t\) 下的量值为 \[\mu_{\mathrm{Mag}}(D;t):=\mathbf{1}^{\top}Z_t(D)^{-1}\mathbf{1}=\sum_{i,j}[Z_t(D)^{-1}]_{ij}.\] 该构造是度量几何中量值的有限空间版本[17],可以解释为尺度 \(t\) 下度量空间的有效大小。 #### 其他指标。 以上列表并非详尽无遗。其他近期基于距离的提案包括哈密顿多样性[13]、NovelSum[35]以及额外的公理化构造[21]。 除了基于距离的指标,多样性也可以通过**基于计数的指标**来量化。一个代表性的例子是**丰富度**,定义为一个批次中唯一元素的数量。特定领域的变体包括自然语言生成中唯一单词或 n-gram 的计数,以及化学信息学中唯一分子骨架的计数。这些指标稳健且易于解释,但它们无法捕捉不同生成项之间的分级距离。 ## 3现有指标的诊断 ### 3.1 公理分析 评估多样性指标的一个有用方法是通过公理:指定一个多样性度量量所需的理想属性。
相似文章
基于角色的生成式AI多元对齐评估框架
本文提出了一种基于角色的评估框架,利用合成认知档案代表不同人类视角,用于生成式AI的多元对齐,解决了单一基准测试的局限性。
多样性注入的位置至关重要:面向多样化生成的统一框架
本文提出了一个用于大型语言模型测试时多样化生成的统一框架,根据多样性注入的位置(表面级 vs. 规范级)对方法进行分类。它提出了规范级方法,首先生成多样化的中间规范,然后基于这些规范生成最终响应。在五个开放任务和四个骨干模型上,规范级注入在保持质量的同时提升了输出多样性。
一百万人,一百万个人工智能代理,三个基础模型。这能构成多元化的审议吗?——又如何衡量?
针对仅用三个基础模型支撑数百万个人工智能代理是否能产生真正多元化的审议进行批判性反思,认为模型间的相关误差可能造成虚假的一致意见,并寻求从集成学习中得出的可操作指标来衡量真正的人类代表性多样性。
衡量关键指标:医疗保健中生成式、多模态及智能体AI的基准测试
本文提出了一个针对医疗保健领域生成式、多模态及智能体AI进行基准测试的结构化框架,旨在解决高基准得分与实际临床可靠性、安全性和相关性之间的差距。
AI生成C++代码在生产环境中的质量特征分析
一项大规模实证研究,分析了生产环境中352万次C++代码变更,比较AI生成代码与人工编写代码的质量,发现AI代码具有更高的耦合度和计算开销,但有针对性的反馈可以缓解这些问题。