城市感知中多模态大语言模型代理生成解释的角色效应分析

arXiv cs.CL 论文

摘要

本文研究了角色提示如何影响多模态大语言模型在城市感知中生成的语言,发现不同角色的描述趋于一致,而解释则随着角色属性系统性地变化。

arXiv:2605.29064v1 Announce Type: new 摘要:我们研究了角色提示如何在城市感知环境中塑造多模态大语言模型生成的语言。利用来自1,200个角色条件代理和两个无角色设置的59,808条标注,我们分析了不同角色下的描述、解释和感知标签。结果表明,不同角色的描述高度趋同,而解释则呈现与社会经济和政治属性相关的系统性变化,尽管感知标签未显示统计上显著的角色差异,但观察到了效应趋势。主题分析进一步揭示,角色在解读同一场景时强调不同的评价主题。
查看原文
查看缓存全文

缓存时间: 2026/05/29 09:15

# 多模态大语言模型在城市感知中生成解释的角色效应分析
来源:https://arxiv.org/html/2605.29064
Neemias da Silva¹, Myriam Delgado¹, Rodrigo Minetto¹, Daniel Silver², Thiago H Silva¹,² 
¹Universidade Tecnologica Federal do Parana, Curitiba, Brazil 
²University of Toronto, Toronto, Canada 
通讯邮箱:neemiasbuceli@alunos\.utfpr\.edu\.br (https://arxiv.org/html/2605.29064v1/[email protected])

###### 摘要

我们研究了在城市感知场景中,角色提示如何塑造多模态大语言模型生成的语言。通过使用来自 1,200 个角色条件化智能体和两种无角色设置的 59,808 条标注,我们分析了跨角色的标题、理由和感知标签。结果表明,不同角色的标题表现出强烈的收敛性,而理由则显示出与经济社会和政治属性相关的系统性变化,感知标签在统计上未表现出与角色相关的显著差异,但可观察到效应趋势。主题分析进一步揭示,角色在解读相同场景时会强调不同的评价主题。

## 1 引言

大语言模型 (LLMs) 越来越多地被用作*社会模拟器*,通过角色提示来逼近不同视角 (Filippas et al. 2024 (https://arxiv.org/html/2605.29064#bib.bib9); Aher et al. 2023 (https://arxiv.org/html/2605.29064#bib.bib1); Argyle et al. 2023 (https://arxiv.org/html/2605.29064#bib.bib2))。这一范式已在多个任务中得到探索,例如研究社会偏见,并引发了越来越多的兴趣,即 LLM 生成的智能体能否模拟集体感知和行为的某些方面 (Park et al. 2024 (https://arxiv.org/html/2605.29064#bib.bib17); Li et al. 2025 (https://arxiv.org/html/2605.29064#bib.bib12))。

大多数先前的工作使用结构化输出(如标签、选择或任务表现)来评估角色提示 (Hu and Collier 2024 (https://arxiv.org/html/2605.29064#bib.bib11); Beck et al. 2024 (https://arxiv.org/html/2605.29064#bib.bib6); da Silva et al. 2026 (https://arxiv.org/html/2605.29064#bib.bib8))。而对于角色如何塑造其生成的*语言*——特别是角色效应是否出现在描述、理由和感知标签中,或者生成的语言是否会因不同的智能体属性而趋同——我们知之甚少。这个问题在多模态设置中尤为重要,因为描述性内容(标题)和解释性框架(理由)可能会产生分歧。在城市场景中,感知是主观且依赖于背景的 (Lopes et al. 2023 (https://arxiv.org/html/2605.29064#bib.bib13); da Silva et al. 2025 (https://arxiv.org/html/2605.29064#bib.bib7))。这表明模型可能在视觉内容上达成一致,但在解释上存在差异。这一区别对于理解角色条件化 MLLM 及其在社会模拟中的应用至关重要。

在本文中,我们分析了总共 59,808 条描述和评估城市场景的标注。其中,59,708 条由 1,200 个角色条件化 MLLM 智能体生成,其余 100 条是在无角色消融设置下生成的。我们将 MLLM 的输出概念化为一个功能区分:(i) *描述性基础*,体现在描述视觉内容的标题中;(ii) *解释性框架*,体现在评价和情境化该内容的理由中。感知标签提供了场景属性的结构化语义表示,将视觉描述与评价性解释联系起来。

理解这一区分使我们能够检验角色效应是主要出现在视觉描述中还是评价性解释中。我们检验假设:角色条件化主要影响解释阶段,而描述性基础基本保持不变。

结果揭示了三个主要发现。首先,标题在不同角色之间表现出持续的高语义相似性,表明描述性基础具有强烈的收敛性。其次,理由显示出与社会经济和政治属性相关的系统性变化,揭示角色效应集中在解释性框架而非描述性内容上。第三,主题级分析表明,角色在解读相同场景时会强调不同的评价主题。这些发现表明,角色条件化 MLLM 主要影响解释性框架而非描述性基础。

我们的贡献有四个方面:(i) 我们引入了一个功能框架,将多模态 LLM 输出中的描述性基础与解释性框架区分开来;(ii) 我们提供了经验证据,表明角色效应在解释性语言中明显强于描述性内容;(iii) 我们表明解释性框架效应主要沿着经济地位和政治维度结构化,而性别和个性的影响有限;(iv) 我们提供了一个公开可用的 GitHub 仓库111链接:\[将在发表后提供\],包含所有代码和处理后的输出,以支持可重复性和进一步研究。

## 2 相关工作

先前的研究表明,LLM 可以再现程式化的实验结果并模拟决策过程 (Aher et al. 2023 (https://arxiv.org/html/2605.29064#bib.bib1); Filippas et al. 2024 (https://arxiv.org/html/2605.29064#bib.bib9)),支持在调查、实验和内容分析中的应用 (Bail 2024 (https://arxiv.org/html/2605.29064#bib.bib3))。然而,仍然存在重要的局限性,包括偏差、有限的有效性以及代表性人类多样性的困难 (Wang et al. 2024 (https://arxiv.org/html/2605.29064#bib.bib19), 2025 (https://arxiv.org/html/2605.29064#bib.bib18))。

一条相关的研究方向是研究 LLM 作为合成受访者和模拟群体。研究表明,LLM 可以逼近类人响应并支持大规模智能体模拟 (Argyle et al. 2023 (https://arxiv.org/html/2605.29064#bib.bib2); Park et al. 2024 (https://arxiv.org/html/2605.29064#bib.bib17)),同时也揭示了在建模信念结构和推理过程中的局限性 (Li et al. 2025 (https://arxiv.org/html/2605.29064#bib.bib12); Barrie and Cerina 2026 (https://arxiv.org/html/2605.29064#bib.bib5))。这些发现表明,评估应超越预测准确性,还需考虑一致性和可解释性。

角色提示在此背景下起着核心作用。基于人口统计学或心理属性对模型进行条件化会影响输出,尽管效果通常有限或依赖于任务 (Hu and Collier 2024 (https://arxiv.org/html/2605.29064#bib.bib11); Beck et al. 2024 (https://arxiv.org/html/2605.29064#bib.bib6))。这类工作大多在结构化输出(标签、评分或选择)上评估角色效应,而角色如何塑造开放式回答的语言仍是一个开放问题 (Lutz et al. 2025 (https://arxiv.org/html/2605.29064#bib.bib14); Malik et al. 2025 (https://arxiv.org/html/2605.29064#bib.bib15))。

我们的工作还与多模态 LLM 和城市感知的研究相关。先前的研究表明,城市图像感知是主观且受社会背景影响的,对安全、无序、美丽和财富的感知在观察者和环境之间系统性地变化 (He et al. 2026 (https://arxiv.org/html/2605.29064#bib.bib10); Balsa-Barreiro et al. 2026 (https://arxiv.org/html/2605.29064#bib.bib4); Lopes et al. 2023 (https://arxiv.org/html/2605.29064#bib.bib13); Xu et al. 2025 (https://arxiv.org/html/2605.29064#bib.bib21); Oliveira et al. 2020 (https://arxiv.org/html/2605.29064#bib.bib16)),并且多模态 LLM 能够部分帮助捕捉这些方面的某些特征 (Wu et al. 2026 (https://arxiv.org/html/2605.29064#bib.bib20); da Silva et al. 2025 (https://arxiv.org/html/2605.29064#bib.bib7))。同时,最近的研究报告显示,在诸如情感标签等输出中,角色内部具有高度一致性,但角色之间的变异有限 (da Silva et al. 2026 (https://arxiv.org/html/2605.29064#bib.bib8)),这引发了问题:角色效应是否在解释性语言中比在结构化输出中更清晰地显现。

我们直接解决这一空白,分析多模态 LLM 生成的标题、理由和感知标签,以考察角色效应如何在描述性基础和解释性框架中出现。关键问题是:即使描述性内容趋同,角色条件化是否会在场景解释方式上产生结构化的变异。

## 3 数据与方法

### 3.1 数据集与条件

我们分析了一个公开可用的标注语料库 (da Silva et al. 2026 (https://arxiv.org/html/2605.29064#bib.bib8)),包含由 1,200 个多模态 LLM 智能体和两种无角色设置生成的 59,808 条记录,用于标注 50 个城市场景图像。每条记录包含四个输出:(i) 预测的情感标签,(ii) 描述图像的标题,(iii) 从控制词汇表中选择的一个或多个感知标签,以及 (iv) 解释所分配情感的理由。标题和理由的平均词数分别为 \(16.9 \pm 5.0\) 和 \(18.0 \pm 4.9\)。角色条件化的理由以完整的散文式解释形式书写,而非简单的标签理由,这使得能够进行超越情感标签的语言分析。图 1 (https://arxiv.org/html/2605.29064#S3.F1) 展示了同一城市图像在每个角色下的一个标注记录。

**角色:** 女性,低收入,保守,务实  
**情感:** 轻微正面  
**标题:** “一栋有石质基座的砖砌高层建筑,周围绿树环绕,天空晴朗。”  
**感知标签:** 城市环境,清洁度,日常环境,旧建筑,光线充足的环境  
**理由:** “一个干净、维护良好的城市景象,建筑井然有序,符合保守派注重实际城市维护的观点。”

**角色:** 女性,低收入,进步,共情  
**情感:** 正面  
**标题:** “一所大学校园,有砖砌高层建筑、一棵树,入口附近有人,天空晴朗。”  
**感知标签:** 宜人环境,日常环境  
**理由:** “这个校园感觉温馨且维护良好,与可及教育价值观一致。”

**角色:** 男性,低收入,保守,分析型  
**情感:** 中性  
**标题:** “一栋有石质基座的砖砌高层建筑,周围有树,天空晴朗。”  
**感知标签:** 旧建筑,日常环境,清洁度  
**理由:** “看起来是一个稳定、传统的城市环境,建筑维护良好,有绿植。”

**图注**  
**图 1:** 标注示例:3 个角色条件化智能体标注同一图像,产生不同的感知标签、标题和理由。

所有标注均使用 Qwen3-VL:8B 多模态 LLM(温度 = 0.1,种子 = 42)生成,遵循 GitHub 代码中记录的标准配置(\[将在发表后提供\])。我们考虑三种标注条件:

- **角色。** 主体语料库包含由 \(|P| = 24\) 个角色档案生成的标注,这些档案来自 \(|D| = 4\) 个人口统计学和个性属性的笛卡尔积:*性别*(男性,女性),*经济状况*(低收入,高收入),*政治取向*(保守,进步),以及*个性*(务实,共情,分析型)。每个档案被实例化为 \(A = 50\) 个独立智能体(合计 \(24 \times 50 = 1,200\) 个智能体),每个智能体使用角色条件化提示(启用扩展推理,think=True)标注所有 \(|I| = 50\) 张图像。智能体的独立性体现在每次标注都是在相同的解码配置下,通过独立的推理调用生成的。完整的档案列表见图 2(第 4.1 节)中的各行。

- **无角色。** 一种无角色设置,同一模型使用中性观察者提示标注相同图像,包括两种变体:启用扩展推理(NPT, think=True)和未启用(NPNoT, think=False)。两种变体每张图像各生成一条标注(各 50 条),为角色生成语料库提供互补的基线。

角色条件化设置表现出强烈双峰的情感标签分布(42.9% 负面,34.5% 正面),中间类别相对于人工标注大幅减少。相反,无角色设置的两种变体偏向负面,且比角色条件化设置更频繁地使用中间类别(轻微负面/轻微正面),产生了更不极化的分布。这些差异为后续文本分析提供了额外背景。感知标签表现出连贯的语义规律性,常见共现如 *废弃* 和 *缺乏维护*,以及 *宁静环境* 和 *平和环境*,表明生成的感知标签中具有一致的结构。

### 3.2 评估角色内部稳定性

遵循我们关于描述性基础和解释性框架的区分,我们分别评估标题、理由和感知标签的稳定性。我们首先评估共享相同角色的智能体之间的内部稳定性,即当所有人口统计和个性属性保持不变时,生成输出的可重复性。对于每张图像 \(i \in I\) 和每个角色档案 \(p_* \in P\),我们计算该档案下所有实例化智能体之间的成对相似度,并报告跨智能体对 \((p_x, p_y)\) 的均值。我们评估三种输出模态的稳定性:

- **标题(描述性基础)和理由(解释性框架):** 语义相似度通过句子嵌入的余弦相似度衡量。
- **感知标签(中间语义层):** 每条标注包含一组来自控制词汇表的感知标签。这些标签构成了描述性基础和解释性框架之间的中间语义层,捕捉场景解释的结构化方面。我们使用 Jaccard 相似度(交集除以并集)衡量集合重叠。

对于每种模态(标题、理由或感知标签),我们计算角色内相似度的分布,并使用均值对每个档案进行总结。值越高,表明共享相同角色的智能体在相似输出上收敛的迹象越强。主题结构仅针对理由进行分析,因为标题显示跨智能体相似度高且主题区分度有限。我们最初探索了对标题和理由的主题建模,但由于标题的语义变异性低,仅保留了理由的主题。

### 3.3 评估跨角色差异

接下来,我们评估不同角色群体是否产生系统性的不同输出。我们不分析完整的角色组合,而是跨角色维度 \(D\)(性别、经济状况、政治取向和个性)分析差异。对于每张图像 \(i \in I\) 和维度 \(d \in D\),我们将标注对划分为:

- **组内对:** 共享相同维度的智能体

相似文章

赋予角色的大型语言模型表现出类似人类的动机推理

arXiv cs.CL

本文研究了为大语言模型赋予角色是否会引发类似人类的动机推理,发现赋予角色的大语言模型真实性辨别能力最多下降9%,并且以与其诱导的政治身份一致的方式评估科学证据的可能性最多增加90%,而基于提示的去偏见方法基本无效。

大型语言模型捕捉人类性格的效果如何?

arXiv cs.AI

本文系统评估了关于LLM角色提示的假设,并识别出'角色流形坍缩'现象,即更丰富的角色描述会降低行为多样性和模拟逼真度。研究结果发现,简单的年龄-性别角色通常比更详细的档案表现更好。

程序问题:面向数据驱动的公民商议的行动感知LLM角色建模

arXiv cs.CL

一个可复现的流水线将公共Zoom录音转换为带有发言人归属的转录文本,并丰富角色画像、话题及行动标签,然后在此数据上微调LLM角色。行动感知微调显著提升了角色保真度、一致性和商议响应性,从而实现了逼真的公民商议模拟。

超越合作模拟器:为LLM代理的稳健评估生成逼真的用户角色

arXiv cs.AI

提出了Persona Policies(PPol),一种即插即用的控制层,利用LLM驱动的进化程序搜索来生成多样且逼真的用户角色,用于评估LLM代理。相比基线实现了33-62%的适应度提升,逼真度评分达到80.4%,并将代理鲁棒性提升了+17%的任务成功率。