多模态大语言模型能否解码创造性飞跃?引入C4进行跨概念理解
摘要
本文介绍了C4,一个受认知启发的、使用中文成语进行跨概念理解的评估框架,并发现当前多模态大语言模型难以理解创造性编码的含义。
查看缓存全文
缓存时间: 2026/08/10 06:13
论文页面 - MLLM 能否解码创造性跳跃?C4:面向跨概念理解的新基准
摘要
MLLM 的创造性能力在设计、沟通、教育和人机协作中具有重要意义,但与以准确性为导向的任务相比,由于明确目标和奖励信号稀缺,其评估一直困难重重。跨概念理解是接受性创造力的核心认知能力,使感知者能够从非显而易见但有意义的概念关系中恢复出预期含义。我们将题目构建操作化为跨概念编码,将模型推理操作化为跨概念解码。为此,我们提出 C4——一个受认知启发的评估框架,用于基于成语的跨概念创造力(Chengyu-based Cross-Concept Creativity)。其编码组件沿着桥接路径将目标槽位映射到可图像化的替代概念,构建一个手工标注且经第三方审核的跨概念网络,从而支持显式结构的批量生成、以桥接数量和深度为索引的难度分级以及精确答案。利用该框架,我们实例化了 C4 评估集(C4-Eval),包含 184 个合成题目和 37 个从在线来源收集的人工创建跨概念成语修辞。我们为收集的修辞手工构建并审核了跨概念关系、桥接路径和推理过程。每个 C4-Eval 题目在五种任务设置下实例化,共产生 884 个主要答案恢复案例。在评估的十个 MLLM 中,最强的闭源模型分别达到 50.7% 和 48.0% 的主要准确率,而开源模型则显著较低。候选约束能大幅提升准确率,但桥接提示和解释请求带来的提升有限。这些结果暴露了当前 MLLM 在通过跨概念关系解码创造性编码意义方面的显著差距。代码见补充材料。
在你的智能体中获取该论文:
hf papers read 2608\.06501
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型 0
暂无模型链接该论文
在模型 README.md 中引用 arxiv.org/abs/2608.06501,即可从本页面链接到该模型。
引用该论文的数据集 0
暂无数据集链接该论文
在数据集 README.md 中引用 arxiv.org/abs/2608.06501,即可从本页面链接到该数据集。
引用该论文的 Space 0
暂无 Space 链接该论文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.06501,即可从本页面链接到该 Space。
收录该论文的合集 0
暂无合集收录该论文
将该论文添加到合集中(https://huggingface.co/new-collection),即可从本页面链接到该论文。
相似文章
推理还是记忆:LLM能理解并生成中文歇后语谜语吗?
本文评估了LLM在理解和生成新型中文歇后语谜语方面的表现,发现像Gemini 3.1 Pro这样的模型虽然因记忆而在理解上表现出色,但在创造性生成方面却逊于人类,凸显了数据污染问题和推理能力的局限性。
探索大语言模型在中文抽象语言掌握中的能力边界
本文介绍了Mouse基准测试,用于评估大语言模型在六个自然语言处理领域的中文抽象语言任务表现。研究表明,尽管当前最先进的模型在上下文理解任务中表现良好,但在这种亚文化网络语言上仍存在重大局限。
ArtECulture:多模态大语言模型中文化条件视觉情感理解的基准测试
本文介绍了ArtECulture,这是一个用于多模态大语言模型中文化条件视觉情感理解的基准测试,涵盖英语、中文和阿拉伯文化,并包含均衡的西方和非西方艺术作品。评估表明该任务仍具挑战性,作者提出了一种检索增强框架,将文化知识注入多模态大语言模型(MLLMs)。
多模态大语言模型内部视觉表征的因果探针
本文提出了一种用于探测多模态大语言模型内部视觉表征的因果框架,揭示了实体与抽象概念在编码方式上的差异。研究强调增加模型深度对于编码抽象概念至关重要,并揭示了当前多模态大语言模型在感知与推理之间的脱节。
Mind's Eye:面向多模态大模型的视觉抽象、变换与组合基准
研究者推出 Mind’s Eye,一项包含八道视觉认知任务的基准测试,显示顶级多模态大模型得分不足 50%,而人类可达 80%,暴露出视觉抽象、关系映射与心理变换方面的巨大差距。