推进大型多模态模型中的创造性物理智能

arXiv cs.AI 论文

摘要

本文介绍了MM-CreativityBench,这是一个用于在物理约束环境下评估大型多模态模型创造性工具使用的基准,并提出了基于功能可见性的对齐方法,利用直接偏好优化来减少幻觉并提高基于事实的推理。

arXiv:2605.26396v1 公告类型:新 摘要:大型多模态模型(LMMs)在感知和推理方面取得了快速进展;然而,这些能力是否能推广到在开放环境中发现基于视觉的解决方案(超越模式识别)仍不清楚。在这样的环境中,智能不仅仅需要回答明确的问题,还涉及识别场景中的元素如何以非显而易见但物理可行的方式被重新利用。这种创造性问题解决形式是人类智能的核心,但在当前基准测试中基本未经测试。为评估这一能力,我们引入了MM-CreativityBench,这是一个在视觉丰富、物理受限的环境中进行基于功能可见性的创造性工具使用的基准。每个实例呈现一个场景图像,其中包含候选实体及其部件的结构化视图,从而能够对模型如何迭代检查场景、识别相关功能可见性并组合视觉和物理上可行的解决方案进行细粒度的交互式评估。我们的实验表明,当前的LMMs往往表现不佳,并非由于生成能力不足,而是因为无法持续进行基于事实的探索。模型常常忽略相关实体,对关键部件检查不足,或幻觉出图像中不存在的属性。受此失败模式的启发,我们提出了基于功能可见性的对齐方法,将创造性工具使用视为一个偏好学习问题。通过直接偏好优化,我们鼓励模型倾向于基于视觉证据的属性-功能可见性推理,而非产生幻觉的替代方案。此外,我们纳入了从功能可见性知识库中获得的监督,以指导更广泛的实体探索和多轮规划。我们的结果显示,在选择正确实体和部件方面取得了持续改进,同时大幅减少了幻觉和与基础相关的错误。
查看原文
查看缓存全文

缓存时间: 2026/05/27 09:04

# 推动大型多模态模型中的创造性物理智能 来源:https://arxiv.org/html/2605.26396 Cheng Qian∗11, Hyeonjeong Ha∗11, Jiayu Liu11, Jeonghwan Kim11, Emre Can Acikgoz11, Bingxuan Li11, Kunlun Zhu11, Jiateng Liu11, Aditi Tiwari11, Zhenhailong Wang11, Xiusi Chen11, Mahdi Namazifar22, Heng Ji11 11UIUC,22Amazon ###### 摘要 大型多模态模型 \(LMMs\) 在感知和推理方面取得了快速进展;然而,尚不清楚这些能力是否能够泛化到开放环境中发现视觉上可行的解决方案,而不仅仅是模式识别。在此类设置中,智能不仅需要回答精心设计的问题:它还需要识别场景中的元素如何以非明显但物理上可行的方式被重新利用。这种形式的创造性问题解决是人类智能的核心,但在当前的基准测试中基本未得到测试。为了评估这种能力,我们引入了 **MM-CreativityBench**,这是一个针对视觉丰富、物理受限环境中可供性驱动的创造性工具使用的基准。每个实例都提供了一个场景图像,包含候选实体及其部件的结构化视图,从而能够进行细粒度、交互式的评估,以了解模型如何逐步检查场景、识别相关可供性,并组合出视觉和物理上可行的解决方案。我们的实验表明,当前的 LMMs 往往表现不佳,并非由于生成能力不足,而是因为它们无法维持基于视觉的探索。模型常常忽略相关实体、未充分检查关键部件,或者幻觉出图像中不存在的属性。受这种失败模式的启发,我们提出了**可供性驱动的对齐**,将创造性工具使用视为一个偏好学习问题。通过直接偏好优化,我们鼓励模型优先考虑基于视觉证据的属性-可供性推理,而非幻觉替代方案。此外,我们融入了从可供性知识库中导出的监督信号,以引导更广泛的实体探索和多轮规划。我们的结果显示,在选择正确的实体和部件方面持续改进,同时大幅减少了幻觉和与视觉基础相关的错误。这些发现表明,创造性智能并非一种外围能力,而是多模态人工智能下一阶段的基础,使系统能够随时间学习、适应不熟悉的环境,并解决超出其训练范围的问题,从而更接近人类智能。 **脚注文本:表示同等贡献** ## 1 引言 根据**智力的三元理论**[sternberg1985beyond],人类智能不仅包括分析能力和实践能力,还包括**创造性智能**:即在约束条件下产生新颖且有价值的解决方案的能力。在现实、资源有限的环境中,这种能力通常表现为工具的重新利用,即人们调整可用物体以发挥超出其预期用途的功能。这种创造力不仅仅是语言或联想性的。人类通过持续的观察和在物理世界中的具身体验来学习物体属性、物理可供性以及物体间交互。他们能够将工具和日常物体分解为功能模块,如边缘、尖端、手柄、表面和容器,并在脑海中重新组合这些模块以支持新的目标。例如,一个坚硬的边缘可以用作刮刀,一个细金属尖端可以用作杠杆,一个透明的曲面可以用作聚焦装置。这些解决方案并非任意;它们源于识别任务目标与环境可供性之间非明显但物理上有效的映射[gibson1977theory,gibson1979ecological]。我们研究这种特定形式的创造力——**创造性工具重新利用**,作为大型多模态模型(LMMs)中创造性智能的具体测试平台。参见图注 图1:超越常规工具使用,**创造性工具重新利用**需要物理可供性的视觉基础,使模型能够发现钥匙的锯齿边缘可以切割箱子胶带。MM-CreativityBench 表明,这种可供性引导的推理在前沿VLMs中难以捕捉,但可以通过训练得到改进。

尽管数据驱动的LMMs取得了快速进展,但尚不清楚它们是否获得了这种创造性智能。当前模型通常能够描述物体、检索常见的工具使用模式或根据文本先验生成看似合理的解决方案。然而,它们经常无法在功能相似性、物理可供性或任务上下文之间转移知识。这种局限性表明,它们的推理可能仍然受限于词汇级或像素级的捷径,而不是对物理属性如何启用功能的抽象、组合式理解[yuksekgonul2023when]。此外,创造性工具使用需要将物体部件、几何形状、材料以及潜在的人-物交互在物理世界中落地,这对现有的LMMs仍然具有挑战性[qian2024affordancellm]。与通过感知、身体经验和情境行动构建概念知识的人类[barsalou2008grounded]不同,通用LMMs缺乏从与环境具身交互中获得的基于经验的学习。因此,它们的推理往往类似于快速、局部且看似合理的“系统1”推理[kahneman2011thinking],而在长程探索和规划方面仍然薄弱[valmeekam2023planbench]。这使得它们难以发现既具有视觉基础又物理可行的新物体-功能映射。

为了应对这些挑战,最近的工作已开始通过开放生成和受约束的问题解决任务来探索大型语言和多模态模型中的创造力[tian2024macgyver,qian2024escapebench,lim2025visescape]。然而,现有的评估仍然主要是文本中心的和场景驱动的,对于模型如何将创造性推理落地于物理环境提供的洞察有限。一个核心挑战在于,现实世界的创造力本质上依赖于感知:智能体必须检查环境,识别候选物体,关注相关部件,并判断其物理属性(如几何形状和材料)是否支持预期用途。如果没有这样的基础,模型可能会产生语言上看似合理但物理上无效的解决方案,忽略相关物体、误解属性或幻觉出视觉上不支持的可供性[zeng2024investigating,chen2024multiobject,wu2024autohallusion]。因此,基于文本的推理成功并不一定能转移到基于视觉的问题解决[zeng2024investigating]。这一差距促成了一个更基本的问题:**LMMs能否将创造性推理作为一项基于感知证据驱动的过程来执行?**[liu2024convbench,liu2024visualagentbench,cao2024visdiahalbench]

解决这个问题需要超越静态的多模态输入,转向交互式设置,其中模型主动决定检查什么,迭代地完善其理解,并将视觉证据与任务需求联系起来。挑战不仅仅是生成一个创造性解决方案,而是通过一个**基于视觉且物理上可行的搜索过程**来达到一个解决方案,该过程支持抽象、功能转移和物体部件的组合使用。为此,我们引入了 **MM-CreativityBench**,这是一个用于多模态环境中基于视觉的创造性问题解决的基准。该基准由需要在约束条件下重新利用日常物体的任务组成,每个任务都配有一个结构化的视觉上下文,包括场景图像、实体级图像和放大的部件图像。这种设计保留了底层的可供性结构,同时引入了现实世界推理中固有的感知挑战:一个成功的系统不仅必须推断出什么可能有效,还必须通过视觉检查识别正确的物体和部件,并证明其可行性。虽然创造力本质上是开放的,但我们的评估侧重于受约束的创造力,其中可能存在多种解决方案,但必须满足基于场景的物理和功能要求。因此,任务成功的定义是模型是否识别出一个物理上有效且上下文合适的物体-部件组合,以满足任务约束。为了支持这一点,我们采用了一种交互式协议,允许模型在提交答案之前探索环境、更新推理并细化候选解决方案。

我们的实验揭示了表面合理性与有根据的推理之间的差距。当前的 LMMs 经常产生表面上看似合理的答案,但难以进行基于证据的创造性探索:即使是最强的模型也达不到 25% 的准确率。值得注意的是,一些顶级的闭源模型,例如 GPT-5.4,可能表现不如 Qwen 等开源模型,这表明仅靠规模化不足以进行基于视觉的创造性推理。错误分析显示出一致的失败模式:模型固着于显著但不相关的物体,忽略决定性的物体部件,或者推断出视觉证据不支持的可供性。在许多情况下,瓶颈不是缺乏候选想法,而是无法维持一个将感知、交互和物理合理性连接起来的具有基础探索的过程。

为了解决这些局限性,我们进一步研究了可供性感知的对齐是否能够改善基于视觉的交互行为。我们的核心思想是为模型提供属性-可供性关联的基本构建块,使其能够将可观察属性与潜在功能用途联系起来。在此基础上,我们设计了鼓励基于证据探索的监督信号,引导模型主动检查候选实体,维护未观察部件的结构化记录,并将中间推理步骤基于视觉证据。我们还引入了偏好数据,其中包含捕获常见失败模式的负轨迹,包括幻觉属性、过早承诺以及视觉上无依据的推理。使用这些信号,通过监督微调和直接偏好优化对开源 Qwen3-VL 模型进行微调,取得了持续改进,在最佳设置下性能提升了一倍以上。这些改进表明,注入可供性级别的知识和探索策略对于基于视觉的创造性推理至关重要,从而带来更强的视觉基础、减少幻觉以及更准确的创造性工具使用。

总之,我们将贡献总结如下:

- **视觉创造力基准**:我们引入了 MM-CreativityBench,这是一个用于评估视觉环境中基于视觉的创造性工具重新利用的基准,其中模型必须根据视觉证据和物理可行性识别物体和部件,以进行创造性问题解决。
- **基于视觉的交互式协议**:我们设计了一个交互式评估设置,允许模型主动检查场景、实体和部件,从而可以衡量创造性解决方案是来自基于证据的探索还是无依据的猜测。
- **可供性驱动的对齐**:我们系统地分析了当前 LMMs 在基于视觉的创造性推理中的失败模式,并表明使用逐步监督和偏好优化进行后训练可以在性能、视觉基础和减少幻觉方面取得改进。

## 2 相关工作

| 基准 | 创造性工具使用 | 可供性基础 | 属性基础 | 部件级推理 | 细粒度创造力级别 | 包含干扰项 | 视觉基础 | 评估协议 |
|:---|:---|:---|:---|:---|:---|:---|:---|:---|
| PROST[aroca2021prost] | ✗ | ✓ | ✓ | ✗ | ✗ | ✓ | ✗ | 静态 |
| NEWTON[wang2023newton] | ✗ | ✗ | ✓ | ✗ | ✗ | ✓ | ✗ | 静态 |
| Creation-MMBench[tian2024macgyver] | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✓ | 静态 |
| VillagerBench[dong2024villageragent] | ✗ | ✓ | ✗ | ✗ | ✗ | ✗ | ✓ | 交互式 |
| VisEscape[lim2025visescape] | ✗ | ✓ | ✗ | ✗ | ✗ | ✓ | ✓ | 交互式 |
| PIQA[bisk2020piqa] | ✓ | ✓ | ✓ | ✗ | ✗ | ✓ | ✗ | 静态 |
| MacGyver[tian2024macgyver] | ✓ | ✓ | ✓ | ✗ | ✗ | ✗ | ✓ | 静态 |
| EscapeBench[qian2024escapebench] | ✓ | ✓ | ✗ | ✗ | ✓ | ✗ | ✓ | 交互式 |
| CretivityBench[qian2026creativitybench] | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✗ | 静态 |
| **MM-CreativityBench (本文)** | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | **交互式** |

表 1:对于每个现有基准,表格指示了相应维度是否完全解决(✓)、部分解决(✓)或未解决(✗)。

**多模态和语言模型中的创造力**。LLMs中的创造力已通过开放生成任务进行了研究,例如故事讲述[akoury2020storium,brown2020language]、设计[qian2023creator,cai2023large,ha2025synthia]和构思[si2024can,wang2024scimon,qian2025modelingagent,yang2024large,wang2026creativebench],通常使用新颖性、多样性和有用性等概念进行评估。最近的工作将其扩展到创造性问题解决,包括工具使用和物体重新利用场景,其中模型必须在约束条件下生成非常规但可行的解决方案[tian2024macgyver,qian2024escapebench,qian2026creativitybench],以及多模态设置,涉及非字面图像理解、上下文感知生成和探索驱动的决策制定[huang2025causality,fang2025creation,lim2025visescape]。然而,在LLM和LMM基准中,这些评估主要是场景驱动的,强调规划、推理或交互,而不是可供性驱动的创造性工具使用的细粒度机制(见表̃1 (https://arxiv.org/html/2605.26396#S2.T1));模型如何从物体属性中推导出新颖解决方案,特别是在视觉基础下,仍然研究不足。

**可供性驱动的推理与对齐**。可供性推理已被研究为感知与行动之间的桥梁,包括在物理常识基准如PIQA、PROST和NEWTON[bisk2020piqa,aroca2021prost,wang2023newton]中,以及在机器人和具身AI中用于操作和规划[montesano2008learning,jamone2016affordances,chu2019learning,brohan2022rt,brohan2024rt]。最近的MLLM工作引入了结构化和部件级可供性表示[yu2025seqafford,ma2024glover],改进了基于视觉的感知和推理。然而,这些方法主要侧重于识别规范可供性或行动可行性,而不是实现灵活的重新组合以进行基于细粒度属性的创造性工具使用。与此同时,诸如监督微调和直接偏好优化[rafailov2023direct]等对齐方法,以及多模态扩展[wang2024mdpo,liu2024mia],已被证明通过基于偏好的探索轨迹学习能够有效提高推理质量和视觉基础。然而,这些方法主要在通用推理中进行了研究。我们的工作通过利用来自可供性知识库的训练信号,将可供性驱动的创造力重新定义为偏好优化问题,从而弥补了这一差距,鼓励模型偏好基于视觉证据的属性-可供性推理。这将细粒度的属性-可供性知识作为创造性重新组合的组合式原语注入到模型中,从而实现对基于视觉的、高效的创造性工具使用。

## 3 MM-CreativityBench

### 3.1 初步实验

参见图注 图2:初步实验结果:在创造性工具使用任务上,直接提示与结构化可供性级别思维链的比较。

作为LMMs创造性智能的初步探索,我们从MacGyver[tian2024macgyver]中选取了100个创造性工具使用任务进行评估,每个任务需要重新利用日常物体以满足一组约束条件。为了引入视觉基础要求,我们使用Gemini-2.5-Pro为每个任务生成了一个场景图像。附带的任务描述仅包含从图像中无法直接观察到的约束条件,因此模型必须依赖视觉证据来识别候选物体和部件。

相似文章

评估大型语言模型的创造力:测试、局限与新前沿

arXiv cs.AI

本文系统评估了针对大型语言模型的人类创造力测试,发现它们无法预测科学构思能力。文章介绍了DRAT,一种结合了聚合思维与发散思维的新测试,能够可靠地预测语言模型的科学构思能力。