论大型语言模型中的类比生成多样性

arXiv cs.CL 论文

摘要

本文系统评估了十种大语言模型中的类比多样性,发现领域同质化以及多样性与质量之间的权衡,并对模型内部机制进行了分析。

arXiv:2608.03233v1 公告类型:新 摘要:大语言模型(LLMs)已展现出在类比生成方面的巨大潜力,类比生成是驱动新颖性和创造力的核心认知能力。尽管以往研究已广泛探讨了基于LLM的类比生成的应用和潜在机制,但其输出多样性在很大程度上仍未得到探索,尽管它对于拓宽跨领域联系和促进科学创新至关重要。在这项工作中,我们对十种最先进的开源和闭源大语言模型的类比多样性进行了全面评估。我们的研究结果突出了一个令人担忧的领域同质化问题,即LLM普遍倾向于从狭窄的目标领域集合中生成类比,从而限制了跨查询和模型内部的多样性。此外,我们的分析揭示了现有LLM多样性增强方法中的一个基本权衡:增加输出多样性往往以牺牲输出质量为代价。最后,我们对LLM信息流的因果分析显示,不同LLM之间控制类比多样性的模型敏感区域存在显著差异,这为观察到的多样性-质量权衡提供了一种潜在机制。据我们所知,这是首批系统研究基于LLM的类比生成中输出多样性的研究之一。
查看原文
查看缓存全文

缓存时间: 2026/08/05 07:44

# 论大型语言模型中类比生成的多样性
来源:https://arxiv.org/html/2608.03233
Daniel Xavier de SousaCaio César Sifuentes BarcelosHongyu GuoXiaodan Zhu

###### 摘要

大型语言模型(LLMs)已在类比生成方面展现出显著潜力,而类比生成是驱动新颖性与创造力的核心认知能力。尽管已有研究广泛探讨了基于 LLM 的类比生成的应用与底层机制,但其输出多样性在很大程度上仍未被探索,尽管多样性对于拓宽跨领域联系和促进科学创新至关重要。在这项工作中,我们对十个最先进的开源和闭源 LLM 的类比多样性进行了全面评估。我们的研究结果突出了一个令人担忧的领域同质化问题,即 LLM 倾向于从一小部分目标领域生成类比,限制了查询间和模型内的多样性。此外,我们的分析揭示了现有 LLM 多样性增强方法中一个根本性的权衡:增加输出多样性往往以牺牲输出质量为代价。最后,我们对 LLM 内部的因果分析揭示了不同 LLM 之间控制类比多样性的模型敏感区域存在显著差异,这为观察到的多样性-质量权衡提供了潜在的机制基础。据我们所知,这是首批系统研究基于 LLM 的类比生成中输出多样性的工作之一。我们的研究结果为开发更具多样性的类比生成 LLM 提供了实证见解和实践指导。我们的代码可在[url_placeholder]获取。

Machine Learning, ICML

## 1 引言

大型语言模型(LLMs)的最新进展已显示出加速科学发现的巨大潜力,开启了 AI for Science(AI4S)的新时代。除了在蛋白质设计(Fry et al., 2026 (https://arxiv.org/html/2608.03233#bib.bib8); Liu et al., 2025 (https://arxiv.org/html/2608.03233#bib.bib20))、可持续能源(Hong et al., 2026 (https://arxiv.org/html/2608.03233#bib.bib15); Zhang et al., 2026 (https://arxiv.org/html/2608.03233#bib.bib39))、材料科学(Park & Walsh, 2026 (https://arxiv.org/html/2608.03233#bib.bib24))以及跨学科知识发现(Shen et al., 2026b (https://arxiv.org/html/2608.03233#bib.bib29))等领域的广泛应用之外,最近的研究开始探索 LLM 在科学领域间生成多样且富有创造力的类比这一新兴能力。这种认知能力是人类智能的核心,能够激发科学创新(Shen et al., 2026a (https://arxiv.org/html/2608.03233#bib.bib28))。

在 AI4S 中,科学创新由跨学科知识整合驱动,类比多样性增强了 LLM 揭示各领域和学科间显性与隐性联系的能力(Shen et al., 2026b (https://arxiv.org/html/2608.03233#bib.bib29))。一个经典的历史例子是詹姆斯·克拉克·麦克斯韦对电磁理论的发展(Clerk Maxwell, 1864 (https://arxiv.org/html/2608.03233#bib.bib4))。麦克斯韦使用流体和机械系统作为源领域来推理目标领域——电磁现象。尽管这些领域在概念上相距甚远,但它们之间的结构对应关系促成了科学理解上的突破,凸显了多样化类比在推动创新中的重要性,如图1 (https://arxiv.org/html/2608.03233#S1.F1) 所示。

参照标题图1:麦克斯韦通过跨领域类比推理发展电磁理论。左子图展示了从密切相关领域得出的类比,右子图则展示了更多样化的跨领域类比。这个例子说明了更大的类比多样性如何实现更广泛的知识整合并促进科学发现,从而启发了我们对大型语言模型中类比多样性的研究。基于这一观察,一个基本的问题是:当前的 LLM 是否能够生成促进跨领域知识转移和科学创新所需的多样化类比?尽管基于 LLM 的类比生成已受到越来越多的关注,现有研究主要集中于类比质量、应用和底层机制(Shen et al., 2026a (https://arxiv.org/html/2608.03233#bib.bib28)),但所生成类比的多样性在很大程度上仍未被探索。与传统生成任务不同,类比生成明确要求脱离源领域并大胆选择目标领域,其中源领域和目标领域共享相似的功能抽象(Gentner, 1983 (https://arxiv.org/html/2608.03233#bib.bib9); Turney, 2012 (https://arxiv.org/html/2608.03233#bib.bib34))。类比生成中对多样性的忽视进一步阻碍了对 LLM 类比生成机制的全面理解,给这一核心研究问题留下了显著空白:**LLM 是否能够生成多样化且信息丰富的类比?**

参照标题图2:LLM 类比生成多样性实验与评估方法概览。模型接收格式为 [指令,源] 的输入,并配合左列中的不同推理时方法。然后我们将输出生成聚类到不同目标领域,并对这些生成进行多层面评估。在这项工作中,我们从两个互补的角度对多个 LLM 的类比生成多样性进行了全面评估。首先,我们评估主流 LLM 在多大程度上能够通过引入新颖且多层面的、聚焦于领域选择多样性的指标来生成类比句。我们的实验结果表明,LLM 倾向于生成与相似目标领域紧密对齐的类比句,在不同模型家族中呈现出同质化趋势。类比生成中的过度同质化对这些模型应用于科学发现时构成了根本性限制,因为科学发现本质上依赖于多样性和创造力。

其次,为了更好地理解现有多样性增强方法在类比生成环境下的效果,我们评估了跨越三类推理时扰动的方法,包括 (i) 基于多样性提示的方法,(ii) 概率与 logits 引导,以及 (iii) 熵门控引导。我们的实验结果表明,现有方法对类比多样性的提升有限,且常常以牺牲类比质量为代价。类比多样性与输出质量之间的权衡表明,最初为通用生成而设计的技术可能无法轻易解决类比生成任务中的领域同质化问题。对 LLM 内部层的进一步分析表明,这种低效可能源于不同模型之间缺乏一致的类比生成区域。

据我们所知,我们的工作是首批在 LLM 类比生成背景下系统研究输出多样性的工作之一。我们的主要贡献总结如下:

- • **LLM 类比生成多样性的全面评估。** 我们的工作使用新颖且多层面的指标对 LLM 类比生成中的多样性进行了全面评估,为 LLM 生成的输出提供了详细见解。
- • **LLM 类比生成中的领域同质化。** 我们的结果从查询内和模型内两个角度揭示了这些模型在类比生成中的领域同质化,凸显了在科学创新中应用 LLM 时,促进创造力和多样性方面的一个令人警惕的限制。
- • **LLM 类比生成中的多样性-质量权衡。** 对在 LLM 类比生成中应用多样性增强框架有效性的进一步分析表明,输出多样性与质量之间存在权衡。我们还识别出不同模型在扰动敏感性上的显著差异,显示模型在类比生成中内部行为的差异性。

## 2 相关工作

#### 生成多样性。

大型语言模型(LLMs)中的生成多样性已被广泛研究,尤其是在创意写作应用领域(Chung et al., 2025 (https://arxiv.org/html/2608.03233#bib.bib3))。先前的工作已证明了多样性在短篇故事补全(Tian et al., 2024 (https://arxiv.org/html/2608.03233#bib.bib31))和创意写作(Ding et al., 2026 (https://arxiv.org/html/2608.03233#bib.bib5))等应用中的重要性,因为在这些应用中,创造性变化和替代叙事的探索是高质量生成的基础。为了提高多样性,早期工作旨在解决 LLM 中的模式坍缩现象(Jiang et al., 2025 (https://arxiv.org/html/2608.03233#bib.bib17)),即模型经常生成重复、平淡或通用的输出。此外,诸如束搜索(Wu et al., 2016 (https://arxiv.org/html/2608.03233#bib.bib37))、Top-k 和 Nucleus(Top-p)采样(Fan et al., 2018 (https://arxiv.org/html/2608.03233#bib.bib6); Holtzman et al., 2020 (https://arxiv.org/html/2608.03233#bib.bib14))等框架被提出以缓解该问题。除了促进多样性的推理时策略外,Distinct-n (https://arxiv.org/html/2608.03233#bib.bib18)(Li et al., 2016)和 Self-BLEU (https://arxiv.org/html/2608.03233#bib.bib41)(Zhu et al., 2018)等指标已成为衡量分布广度的标准,而最近的工作开始强调“有效语义多样性”,以确保多样性不会以牺牲任务特定质量为代价(Wiher et al., 2022 (https://arxiv.org/html/2608.03233#bib.bib36))。然而,这些工作通常处理创意写作中的表面或风格多样性,给认知任务(如类比推理)中结果多样性的探索留下了很少空间。

#### LLM 中的类比推理。

类比推理被认为是人类智能的核心能力(Minegishi et al., 2026 (https://arxiv.org/html/2608.03233#bib.bib21); Hofstadter & Sander, 2013 (https://arxiv.org/html/2608.03233#bib.bib13))。研究人类类比的现代方法通常涉及抽象和结构映射的过程,这些过程实现了跨领域跳跃(Gentner, 2010 (https://arxiv.org/html/2608.03233#bib.bib10))。近年来,机械可解释性方法的蓬勃发展(Huben et al., 2024 (https://arxiv.org/html/2608.03233#bib.bib16); Belrose et al., 2023 (https://arxiv.org/html/2608.03233#bib.bib1); Ghandeharioun et al., 2024 (https://arxiv.org/html/2608.03233#bib.bib11))推动了对 LLM 类比推理能力从解剖学角度的研究,使人们对 LLM 内部的理解比对其人类对应者更为全面。借鉴将类比生成视为领域与功能双重相互作用的开创性工作(Gentner, 1983 (https://arxiv.org/html/2608.03233#bib.bib9)),近期工作取得了显著进展,从模型行为研究(Webb et al., 2023 (https://arxiv.org/html/2608.03233#bib.bib35))到探索底层机制的尝试,并提出了结构映射(Gentner, 1983 (https://arxiv.org/html/2608.03233#bib.bib9))和图函子(Minegishi et al., 2026 (https://arxiv.org/html/2608.03233#bib.bib21))等假设。然而,据我们所知,所有这些探索都是在分类设置下进行的,通常涉及对类比对的比较,因此这些工作要么仍然相对肤浅,要么有抹杀类比生成解空间广阔性的风险,正如 Hofstadter & Sander (2013 (https://arxiv.org/html/2608.03233#bib.bib13)) 一书中所论证的那样。为弥合这一空白,我们的工作超越了二元标签的比较,转向 LLM 类比推理中的开放式生成分析。

## 3 实验设置

#### 数据集。

为了全面评估基于 LLM 的类比多样性,我们在三个最近发布的类比生成数据集上进行了实验。AnaloBench (AB)(Ye et al., 2024 (https://arxiv.org/html/2608.03233#bib.bib38))是一个专门用于故事级类比评估的基准,包含 340 对人类标注者提供的高质量类比故事。Metaphoric Analogies (MA)(Boisson et al., 2025 (https://arxiv.org/html/2608.03233#bib.bib2))侧重于从文学隐喻中提取结构化类比映射,包含 203 个样本,以四项类比结构构建源概念和目标概念对。Metaphor Understanding Challenge (MUNCH)(Tong et al., 2024 (https://arxiv.org/html/2608.03233#bib.bib33))通过改写评估 LLM 是否能够将隐喻理解为跨领域映射,为包含隐喻使用的句子提供了超过 10K 条改写。我们对 AB 和 MA 使用完整评估数据集;对于 MUNCH,我们随机抽取 1K 个样本。

#### 模型与设备。

我们在评估中包含了五个闭源和五个开源模型。我们使用GPT-5.2、Grok-4.5、gemini-2.5-pro、gemini-3.1-pro和claude-4.6-sonnet进行生成多样性评估。我们还测试了五个开源模型,包括llama-3.1-8B-instruct、gemma2-9B-it、qwen-3-8B、mistral-7B-Instruct和phi-4-mini-instruct。所有开源模型的最大生成长度设置为 100 个输出 token。我们使用单个l40s和h100 GPU运行实验。

#### 生成扰动方法。

我们按照 Ostermann et al. (2026 (https://arxiv.org/html/2608.03233#bib.bib23)) 定义的类别评估了一系列推理时扰动方法,以全面理解它们在 LLM 类比生成中的有效性。

- • **多样性提示。** 除了基础提示外,我们还运行了多样性提示策略,包括 Logic prompts 和 Diversity prompts,以明确鼓励从创意和多样化领域生成类比。
- • **概率与 Logits 引导。** 我们在实验中运行了包括 Top-k(\(k=20​\))、Top-p(\(p=0.9​\))、Top-ησ(\(ησ=1.0​\)) 和 Min-p(\(p=0.1​\)) 在内的概率方法,这些方法通过对输出 logits 重采样来提高输出多样性。我们还在实验中包含了 G2(Ruan et al., 2025 (https://arxiv.org/html/2608.03233#bib.bib27)),其中我们将迭代轮数设置为 3。
- • **熵门控引导。** 我们还纳入了 Li et al. (2026 (https://arxiv.org/html/2608.03233#bib.bib19)) 的一种改编方法,该方法使用熵作为指示器来控制输出多样性。我们将重采样阈值 \(τ​\) 设置为大于整个生成 token 序列的第 90 百分位数。

#### 输出评估。

我们对每个样本进行 \(K=10​\) 次生成评估。参照先前通过将自然语言映射到语义空间来评估生成多样性的研究(Reimers & Gurevych, 2019 (https://arxiv.org/html/2608.03233#bib.bib26)),我们采用了类似范式。具体来说,我们使用all-MiniLM-L6-v2句子变换器作为编码器获取语义嵌入,并计算它们的平均成对余弦距离。此外,我们引入 MAUVE 分数(Pillutla et al., 2022 (https://arxiv.org/html/2608.03233#bib.bib25))以更好地捕捉分布差异,从而对生成的质量和多样性进行更全面的分析。为了评估所生成类比的连贯性和质量,我们使用GPT-4o-mini在现有的 LLM-as-a-judge 设置下进行评估(Zheng et al., 2023 (https://arxiv.org/html/2608.03233#bib.bib40))。

参照标题

参照标题

图3:(a) 比较

相似文章

大型语言模型总是讲相同的故事吗?

arXiv cs.CL

本文研究大型语言模型是否能够生成多样化的故事。通过叙事相似性分析,作者发现,LLM生成的叙事彼此之间的相似度始终高于人类撰写的故事,而常见的缓解策略(如负面提示和温度缩放)未能解决这种同质化问题。

大型语言模型中的类人回指消解

arXiv cs.CL

本文研究了五个开放权重的大型语言模型在回指消解中是否表现出对心理语言学因素的人类类似敏感性,使用惊奇度和理解准确率作为行为指标。结果显示选择性认知对齐:一些模型在回指消解中匹配了人类的话语敏感性,但对语义干扰效应的敏感性较弱或缺失。

大型语言模型有多像人类?一个关注语域的语言评估框架

arXiv cs.CL

本文提出了一种关注语域的语言评估框架,通过使用最大均值差异(MMD)比较人类与LLM生成文本中67个词汇语法特征的分布,来评估大型语言模型(LLM)的人类相似度。在七个经过指令微调的开源模型和五个语域上的实验表明,没有模型能完美匹配人类基线,且与人类语言的接近程度因语域而异,而非模型规模。

面向多样化科学假设搜索的大语言模型方法

Hugging Face Daily Papers

本文提出了一种受并行回火启发的进化框架,该框架利用多温度采样和信息交换,提高了大语言模型生成科学假设的多样性和质量,并在分子发现、方程发现和算法发现等领域中得到了验证。