多模态大语言模型能否解码创造性飞跃?引入C4进行跨概念理解

Hugging Face Daily Papers 论文

摘要

本文介绍了C4,一个受认知启发的、使用中文成语进行跨概念理解的评估框架,并发现当前多模态大语言模型难以理解创造性编码的含义。

多模态大语言模型(MLLMs)的创造能力在设计、沟通、教育和人机协作中具有重要意义,但由于与面向准确性的任务相比,明确的目标和奖励信号稀缺,因此仍然难以评估。跨概念理解是接受性创造力背后的核心认知能力。它使感知者能够从非显而易见但有意义的概念关系中恢复出预期的含义。我们将项目构建操作化为跨概念编码,将模型推理操作化为跨概念解码。我们引入C4,一个受认知启发的、基于成语的跨概念创造力评估框架。其编码组件将目标槽映射到手动注释且经第三方评审的跨概念网络中的桥梁路径上的可成像替代概念,从而实现具有明确结构、以桥梁数量和深度为索引的难度以及精确答案的批量生成。利用该框架,我们实例化了C4评估集(C4-Eval),包含184个合成项目和37个从在线来源收集的人类创建的跨概念成语图形。我们为收集的图形手动构建并审查了跨概念关系、桥梁路径和推理过程。每个C4-Eval项目在五种任务设置中实例化,产生884个主要答案恢复案例。在十个评估的MLLMs中,最强的闭源模型达到50.7%和48.0%的主要准确率,而开源模型则明显较低。候选约束显著提高了准确率,但桥梁提示和解释请求仅带来适度提升。这些结果揭示了当前MLLMs在通过跨概念关系解码创造性编码含义方面存在的巨大差距。代码见补充材料。
查看原文
查看缓存全文

缓存时间: 2026/08/10 06:13

论文页面 - MLLM 能否解码创造性跳跃?C4:面向跨概念理解的新基准

摘要

MLLM 的创造性能力在设计、沟通、教育和人机协作中具有重要意义,但与以准确性为导向的任务相比,由于明确目标和奖励信号稀缺,其评估一直困难重重。跨概念理解是接受性创造力的核心认知能力,使感知者能够从非显而易见但有意义的概念关系中恢复出预期含义。我们将题目构建操作化为跨概念编码,将模型推理操作化为跨概念解码。为此,我们提出 C4——一个受认知启发的评估框架,用于基于成语的跨概念创造力(Chengyu-based Cross-Concept Creativity)。其编码组件沿着桥接路径将目标槽位映射到可图像化的替代概念,构建一个手工标注且经第三方审核的跨概念网络,从而支持显式结构的批量生成、以桥接数量和深度为索引的难度分级以及精确答案。利用该框架,我们实例化了 C4 评估集(C4-Eval),包含 184 个合成题目和 37 个从在线来源收集的人工创建跨概念成语修辞。我们为收集的修辞手工构建并审核了跨概念关系、桥接路径和推理过程。每个 C4-Eval 题目在五种任务设置下实例化,共产生 884 个主要答案恢复案例。在评估的十个 MLLM 中,最强的闭源模型分别达到 50.7% 和 48.0% 的主要准确率,而开源模型则显著较低。候选约束能大幅提升准确率,但桥接提示和解释请求带来的提升有限。这些结果暴露了当前 MLLM 在通过跨概念关系解码创造性编码意义方面的显著差距。代码见补充材料。

查看 arXiv 页面 查看 PDF 添加到收藏

在你的智能体中获取该论文:

hf papers read 2608\.06501

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型 0

暂无模型链接该论文

在模型 README.md 中引用 arxiv.org/abs/2608.06501,即可从本页面链接到该模型。

引用该论文的数据集 0

暂无数据集链接该论文

在数据集 README.md 中引用 arxiv.org/abs/2608.06501,即可从本页面链接到该数据集。

引用该论文的 Space 0

暂无 Space 链接该论文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.06501,即可从本页面链接到该 Space。

收录该论文的合集 0

暂无合集收录该论文

将该论文添加到合集中(https://huggingface.co/new-collection),即可从本页面链接到该论文。

相似文章

推理还是记忆:LLM能理解并生成中文歇后语谜语吗?

arXiv cs.CL

本文评估了LLM在理解和生成新型中文歇后语谜语方面的表现,发现像Gemini 3.1 Pro这样的模型虽然因记忆而在理解上表现出色,但在创造性生成方面却逊于人类,凸显了数据污染问题和推理能力的局限性。

探索大语言模型在中文抽象语言掌握中的能力边界

arXiv cs.CL

本文介绍了Mouse基准测试,用于评估大语言模型在六个自然语言处理领域的中文抽象语言任务表现。研究表明,尽管当前最先进的模型在上下文理解任务中表现良好,但在这种亚文化网络语言上仍存在重大局限。

ArtECulture:多模态大语言模型中文化条件视觉情感理解的基准测试

arXiv cs.CL

本文介绍了ArtECulture,这是一个用于多模态大语言模型中文化条件视觉情感理解的基准测试,涵盖英语、中文和阿拉伯文化,并包含均衡的西方和非西方艺术作品。评估表明该任务仍具挑战性,作者提出了一种检索增强框架,将文化知识注入多模态大语言模型(MLLMs)。

多模态大语言模型内部视觉表征的因果探针

arXiv cs.AI

本文提出了一种用于探测多模态大语言模型内部视觉表征的因果框架,揭示了实体与抽象概念在编码方式上的差异。研究强调增加模型深度对于编码抽象概念至关重要,并揭示了当前多模态大语言模型在感知与推理之间的脱节。