多模态语言模型中的校准模糊性:人类倾向于文化引用,而模型描述画面
摘要
本文探讨校准模糊性作为人类交流与多模态语言模型中的生成资源,通过Dixit游戏展示AI表现出模糊性崩溃且缺乏文化引用,与人类形成对比。
arXiv:2609.12575v1 公告类型:新
摘要:模糊性常被视为AI系统需要解决的缺陷——但在人类交流和文化中,模糊性也可以是一种生成资源。从幽默到政治到艺术,人们用足够开放以邀请不同解释、但又足够受限以可解读的文字和图像来表达自己。我们通过源自聚会游戏Dixit的任务操作化校准模糊性的概念。我们比较人类与多模态语言模型生成的提示差异,基于一种新颖的校准模糊性编码标准,发现模型始终表现出模糊性崩溃(即,其输出过度具体化,没有为多重合法解释留出空间)。与人类提示不同,AI生成的提示还表现出文化扁平化;它们几乎不引用文化情境知识,即使被提示使用典故和修辞语言。
查看缓存全文
缓存时间: 2026/09/14 08:37
# 多模态语言模型中的校准模糊性:人类倾向于文化引用,而模型则描述图片 来源:https://arxiv.org/html/2609.12575 DOI:XXXXXXX\.XXXXXXX (https://doi.org/XXXXXXX.XXXXXXX) 会议:ACM CHI人机交互计算系统人因学大会;待定;待定 ISBN:978\-1\-4503\-XXXX\-X/27/XX CCS:以人为中心的计算 人机交互(HCI) Cody Kommers https://orcid.org/https://orcid.org/0009-0007-8985-0085 注:两位作者对此研究贡献均等。 邮箱:[ckommers@turing\.ac\.uk](mailto:[email protected]) 所属机构:艾伦·图灵研究所,英国伦敦 Mingrui Ye https://orcid.org/https://orcid.org/0009-0002-8338-8778 邮箱:[mingrui\.ye@kcl\.ac\.uk](mailto:[email protected]) 所属机构:伦敦国王学院,英国伦敦 Evelyn Gius https://orcid.org/https://orcid.org/0000-0001-8888-8419 所属机构:达姆施塔特工业大学,德国达姆施塔特 Daniela Mihai https://orcid.org/https://orcid.org/0000-0003-3368-9062 所属机构:南安普顿大学,英国南安普顿 Hoyt Long https://orcid.org/https://orcid.org/0000-0002-8562-5426 所属机构:芝加哥大学,美国芝加哥 Zheng Yuan https://orcid.org/https://orcid.org/0000-0003-2406-1708 所属机构:谢菲尔德大学,英国谢菲尔德 以及 Drew Hemment https://orcid.org/https://orcid.org/0000-0002-0068-5500 所属机构:艾伦·图灵研究所,英国伦敦 所属机构:爱丁堡大学,英国爱丁堡 2027 ###### 摘要\. 模糊性通常被视为AI系统需要解决的缺陷——但在人类沟通和文化中,模糊性也可以是一种生成性资源。从幽默到政治再到艺术,人们使用文字和图像表达自我,这些表达既足够开放以邀请不同的解读,又足够受限以能够被理解。我们通过源自客厅游戏*Dixit*的任务,将“校准的模糊性”这一概念操作化。我们基于一种新颖的校准模糊性编码标准,比较了人类与多模态语言模型生成的线索之间的差异,发现模型始终表现出模糊性坍缩(即,它们的输出被过度规定,没有为多种合理解释留下空间)。与人类线索不同,AI生成的线索还表现出文化扁平化;即使被提示使用典故和比喻语言,它们也几乎从不引用具有文化情境的知识。 ###### 关键词:模糊性,文化,校准,同质化,坍缩,文化扁平化,多模态语言模型,解释性技术 五张标记为A到E的Dixit卡牌,其中B卡(雪中的披风人物)被红框标出作为目标。下方有针对此牌局的三条线索及标准标签:人类线索“Let it go”,标签为“校准的”和“文化引用”;Gemma 3的线索“Lost in wintry contemplation”,标签为“校准的”和“无文化引用”;GLM 4.6V的线索“A woman in a long blue cloak”,标签为“过度规定”和“无文化引用”。 图1\. 我们使用客厅游戏*Dixit*作为测量校准模糊性的范式。该任务要求一名“讲述者”生成一条“线索”,以模棱两可的方式从一组干扰项中指出目标卡牌——其成功与否取决于其他玩家中部分而非全部是否能正确选择。在此示例中,人类玩家围绕对电影《冰雪奇缘》中一首歌曲的典故构建线索——这是一个广为人知的文化引用。我们的结果展示了模型生成的线索如何与人类给出的线索存在系统性差异。在此示例中,Gemma 3提供了一条为模糊性校准过的线索,但描述图像时未引用具有文化情境的知识;而GLM-4.6V则简单提供了一条明确无误的字面线索。 五张标记为A到E的Dixit卡牌,其中B卡(雪中的披风人物)被红框标出作为目标。下方有针对此牌局的三条线索及标准标签:人类线索“Let it go”,标签为“校准的”和“文化引用”;Gemma 3的线索“Lost in wintry contemplation”,标签为“校准的”和“无文化引用”;GLM 4.6V的线索“A woman in a long blue cloak”,标签为“过度规定”和“无文化引用”。 ## 1\.引言 在AI研究中,模糊性通常被视为需要最小化的量。关于词义消歧的长期工作传统(Navigli, 2009 (https://arxiv.org/html/2609.12575#bib.bib22); Yuan and Strohmaier, 2021 (https://arxiv.org/html/2609.12575#bib.bib77))以及近期测试语言模型能否解决模糊问题和句子的基准(Min et al., 2020 (https://arxiv.org/html/2609.12575#bib.bib5); Liu et al., 2023 (https://arxiv.org/html/2609.12575#bib.bib6))都共享一个前提:当模糊性被消除时,系统才算成功。然而,模糊性不仅由语义模糊定义;它可能是人类沟通和文化的一个关键方面(Empson, 1930 (https://arxiv.org/html/2609.12575#bib.bib23); Piantadosi et al., 2012 (https://arxiv.org/html/2609.12575#bib.bib24); Sennet, 2023 (https://arxiv.org/html/2609.12575#bib.bib36); Kommers et al., 2026a (https://arxiv.org/html/2609.12575#bib.bib74)\)。例如,模糊性在叙事中扮演着角色,其中对主题或见解的明确阐述往往会削弱故事的趣味性(例如,“讲述”而非“展示”(Booth, 1961 (https://arxiv.org/html/2609.12575#bib.bib25))),而文本留下的空白恰恰是读者必须填补以赋予其意义的部分(Iser, 1978 (https://arxiv.org/html/2609.12575#bib.bib26))。它在人际对话和语用含义中也发挥作用,人们倾向于暗示意义而非直接陈述,以避免引起不必要的冒犯或紧张(Grice, 1975 (https://arxiv.org/html/2609.12575#bib.bib27); Brown and Levinson, 1987 (https://arxiv.org/html/2609.12575#bib.bib70); Pinker et al., 2008 (https://arxiv.org/html/2609.12575#bib.bib68))。对模糊性的审慎管理在许多审议过程中都扮演着角色:群体经常就能做什么达成一致,而将基本原则悬而未决(Sunstein, 1995 (https://arxiv.org/html/2609.12575#bib.bib71))。当陪审团面临不完整信息时,他们的集体任务是在模糊性仍然存在的情况下得出结论(Hastie et al., 1983 (https://arxiv.org/html/2609.12575#bib.bib72))。校准模糊性对于设计和评估作为文化技术的生成式AI至关重要(Farrell et al., 2025 (https://arxiv.org/html/2609.12575#bib.bib73); Kommers et al., 2026a (https://arxiv.org/html/2609.12575#bib.bib74)),同时也是为应对文化复杂性而设计的解释性AI系统需要考虑的重要因素(Hemment et al., 2025 (https://arxiv.org/html/2609.12575#bib.bib59))。 AI系统越来越多地被部署用于那些没有简单标准答案的任务(Leibo et al., 2024 (https://arxiv.org/html/2609.12575#bib.bib75))。评估这些系统的输出不仅需要关于正确与错误的二元判断——还需要传统上由人文学科学者执行的解释性行为(Klein et al., 2025 (https://arxiv.org/html/2609.12575#bib.bib66); Underwood, 2025 (https://arxiv.org/html/2609.12575#bib.bib34); Hemment et al., 2025 (https://arxiv.org/html/2609.12575#bib.bib59); Beguš, 2025 (https://arxiv.org/html/2609.12575#bib.bib41))。这些解释直接考虑了模糊性,具体而言是考虑了多种冲突但合法持有的观点的共存,而不是优先考虑一个规范性的标准答案(Kommers et al., 2026a (https://arxiv.org/html/2609.12575#bib.bib74))。因此,生成式AI系统的一个重大风险是模糊性坍缩(Gur-Arieh et al., 2026 (https://arxiv.org/html/2609.12575#bib.bib4)):尽管大多数现实世界的情况或结果可以由多种合理的解释来描述,但AI界面通常提供单一的、权威呈现的判断(Metzger et al., 2024 (https://arxiv.org/html/2609.12575#bib.bib35))。挑战在于,根据定义,模糊的事物抵制单一的标准答案评估(Sennet, 2023 (https://arxiv.org/html/2609.12575#bib.bib36))。在其最一般的形式中,模糊性仅仅意味着一个词、陈述、图像或其他文化产物可以有多种解释或含义(Gur-Arieh et al., 2026 (https://arxiv.org/html/2609.12575#bib.bib4))。但这种情况可能存在多种细微差别。例如,克林特·伊斯特伍德1992年的电影《不可饶恕》以道德模糊性为特征:每个角色都试图做正确的事,但最终都越过了界限。观众应该支持的典型“好人”是谁?相比之下,罗伊·利希滕斯坦对图像小说风格的使用也具有模糊性。这些作品是在颂扬漫画艺术,还是在嘲讽它?即使仅在这两个案例中,也没有统一的方法来全面地操作化模糊性——只能说所讨论的产物允许多种解释。 因此,AI系统中模糊性的校准根本上是一个设计问题(Gaver et al., 2003 (https://arxiv.org/html/2609.12575#bib.bib65); Di Lodovico et al., 2025 (https://arxiv.org/html/2609.12575#bib.bib44))。我们希望AI系统不仅仅在任何情况下都最小化模糊性——而是能够在何时、何地以及如何建设性或有效地运用模糊性。答案取决于具体情况:它取决于涉及的人员、他们的背景、所处的情境以及他们试图做什么(Kommers et al., 2026a (https://arxiv.org/html/2609.12575#bib.bib74))。虽然对于所有人在所有情况下都不存在一种放之四海而皆准的模糊性水平,但在任务具有文化情境性的情境中,适当地管理模糊性尤为重要(Kommers et al., 2026a (https://arxiv.org/html/2609.12575#bib.bib74); Heuser, 2025 (https://arxiv.org/html/2609.12575#bib.bib29); Veselovsky et al., 2026 (https://arxiv.org/html/2609.12575#bib.bib33); de Rooij and Biskjaer, 2026 (https://arxiv.org/html/2609.12575#bib.bib30); Montesinos and Løvlie, 2026 (https://arxiv.org/html/2609.12575#bib.bib62); Yadav et al., 2025 (https://arxiv.org/html/2609.12575#bib.bib60); Liu et al., 2025 (https://arxiv.org/html/2609.12575#bib.bib54); Bergman et al., 2023 (https://arxiv.org/html/2609.12575#bib.bib48); Sorensen et al., 2024 (https://arxiv.org/html/2609.12575#bib.bib46); Ge et al., 2024 (https://arxiv.org/html/2609.12575#bib.bib45); Roland et al., 2026 (https://arxiv.org/html/2609.12575#bib.bib40))。例如,AI系统越来越多地被用于塑造或创作故事及其他文化产物(Gupta et al., 2026 (https://arxiv.org/html/2609.12575#bib.bib64))。这类叙事为人们如何理解自我及周围世界提供了关键结构(Kommers and DeDeo, 2025 (https://arxiv.org/html/2609.12575#bib.bib63); Bruner, 1990 (https://arxiv.org/html/2609.12575#bib.bib61))。从宏观角度看,AI如何塑造叙事和文化产物,因此可能对身份认同和意义建构产生重大影响(Kommers and Holtzman, 2026 (https://arxiv.org/html/2609.12575#bib.bib69); Kommers et al., 2026b (https://arxiv.org/html/2609.12575#bib.bib58); Zhi et al., 2026 (https://arxiv.org/html/2609.12575#bib.bib39))。但是,一个文化产物(如故事)在给定文化框架内是否合适,不仅取决于检查特定的人口统计类别,还取决于导航和管理内在模糊概念之间的权衡(Zhou et al., 2025 (https://arxiv.org/html/2609.12575#bib.bib28))。同样,确定什么样的故事对给定的人或社区有意义,不仅取决于原始的参与度指标,还取决于对情境化视角中固有模糊性的考量(Kommers et al., 2025 (https://arxiv.org/html/2609.12575#bib.bib67); Lowe et al., 2025 (https://arxiv.org/html/2609.12575#bib.bib57))。这些考虑因素以难以量化著称(Leibo et al., 2024 (https://arxiv.org/html/2609.12575#bib.bib75))。 在本文中,我们提出了一个测量多模态AI系统模糊性校准的范式。虽然“消歧”有一个清晰的操作定义(Navigli, 2009 (https://arxiv.org/html/2609.12575#bib.bib22); Yuan and Strohmaier, 2021 (https://arxiv.org/html/2609.12575#bib.bib77); Liu et al., 2023 (https://arxiv.org/html/2609.12575#bib.bib6); Tsai et al., 2026 (https://arxiv.org/html/2609.12575#bib.bib43)),但一个用于校准模糊性的评估框架仍然必要(Gur-Arieh et al., 2026 (https://arxiv.org/html/2609.12575#bib.bib4))。我们开发了一个旨在将校准模糊性编码的任务,并对以下问题提供了初步答案:生成式AI系统校准模糊性的能力如何?模型在管理模糊性时依赖什么策略?这些策略与人类有何不同?以及我们如何为特定的背景或用例校准模糊性? ### 1\.1\.贡献总结 我们提出了一种基于流行客厅游戏*Dixit*(第3节 (https://arxiv.org/html/2609.12575#S3))测量多模态语言模型校准模糊性的新颖方法。 我们开发了一种新颖的标注标准,以区分与任务相关的不同模糊性维度(第4节 (https://arxiv.org/html/2609.12575#S4))。 我们发现,人类和模型倾向于以根本不同的方式校准模糊性——人类更可能利用具有文化情境的知识(第5节 (https://arxiv.org/html/2609.12575#S5))。 在模型比较中,我们展示了模型在默认管理模糊性的行为上存在显著差异,并表明提示(特别是强调任务的“社会认知”框架)可以在一定程度上缓解校准不当,但无法完全防止模糊性坍缩(第6节 (https://arxiv.org/html/2609.12575#S6))。 ## 2\.相关工作 Gur-Arieh、Wang和Fazelpour(Gur-Arieh et al., 2026 (https://arxiv.org/html/2609.12575#bib.bib4))之前的工作建立了一个关于大语言模型(LLMs)中模糊性坍缩所带来的认识论风险的分类法[1];我们明确旨在构建在他们的工作之上。Gur-Arieh等人(Gur-Arieh et al., 2026 (https://arxiv.org/html/2609.12575#bib.bib4))区分了与模糊性坍缩相关的三类风险——过程、输出和生态系统。在本文中,我们特别关注输出坍缩:系统产生的产物在多大程度上支持多种合理的解释。Gur-Arieh等人(Gur-Arieh et al., 2026 (https://arxiv.org/html/2609.12575#bib.bib4))对模糊性坍缩的担忧,反映了对大语言模型在扁平化或同质化具有文化情境的输出方面所施加的同质化力量的更广泛担忧(Heuser, 2025 (https://arxiv.org/html/2609.12575#bib.bib29); Xie and Xie, 2026 (https://arxiv.org/html/2609.12575#bib.bib56); Xiao et al., 2025 (https://arxiv.org/html/2609.12575#bib.bib50); Wilkens, 2026 (https://arxiv.org/html/2609.12575#bib.bib38); Jain et al., 2025 (https://arxiv.org/html/2609.12575#bib.bib32))。 ### 2\.1\.测量模糊性 虽然目前尚无公认的通用度量标准来评估计算系统校准模糊性的能力,但先前的工作试图评估系统是否能识别或解决多种(合理的)
相似文章
评估大型语言模型中的中文歧义理解能力
本文介绍了基于潜在歧义理论的汉语歧义数据集CHA-Gen,并评估了多个LLM在歧义检测任务上的表现。研究发现,模型虽然面临挑战,但通过思维链提示有所改进,而指令调优则导致过度自信。
语言模型受困于歧义诅咒
本文发现语言模型中存在歧义诅咒:下一个词分布越模糊,学习难度越大,这源于架构和学习方面的原因,并通过合成数据和真实数据进行了验证。
多模态大语言模型中的不确定性感知决策
本综述整理了多模态大语言模型中不确定性感知决策的研究,涵盖了不确定性的来源、校准方法,以及提高系统可靠性和安全性的行动。
大语言模型不确定性中的人类对齐、校准与激活模式
本文研究大语言模型的不确定性与人类不确定性的相似程度,探讨LLMs在多个数据集上的对齐、校准和激活模式,以及指令微调的影响。
校准与决策:重新审视未学习语言模型中的可靠性悖论
本文重新审视了语言模型机器遗忘背景下的可靠性悖论,证明模型在依赖基于捷径的决策规则的同时能够实现较低的校准误差,从而将该悖论扩展至未学习模型。