可步行性对谁而言?利用多模态深度学习捕捉步行感知中的主观变异性
摘要
本文介绍了包含来自1,196名受访者的29,870条步行适宜性评分的数据集,并提出了一种用户条件多模态深度学习框架,将视觉特征与个体评分者属性相结合,以捕捉步行感知中的主观变异性。该模型在排名一致性上比仅基于图像的基线提高了65%,表明评估环境的主体至关重要。
arXiv:2608.06934v1 公告类型:新
摘要:步行环境的视觉感知在个体间存在显著差异,反映了个人特征、经历和偏好的不同。然而,现有研究往往将这些多样化的判断简化为汇总分数,隐含地假设感知是统一的,并且通常依赖车载街景图像,这些图像并不能反映行人的视觉体验。本文介绍了来自1,196名受访者的29,870条步行适宜性评分数据集,将澳大利亚城市、郊区和区域环境中的人行道视角图像与个体评分者属性相关联,并提出了首个用于步行感知的用户条件多模态深度学习框架,融合视觉特征与受访者级别的表示。一项视角比较研究表明,人行道视角图像获得的步行适宜性评分显著高于匹配的街景图像,表明图像来源是感知调查中的一个实质性设计决策。用户条件模型在排名一致性方面比仅基于图像的基线提高了65%(二次加权卡帕系数0.47对0.29),表明评估者是谁除了图像内容本身之外还携带着预测信息。这些发现支持从汇总的、与观察者无关的步行适宜性评分转向代表多样化用户的模型,从而实现对行人环境更具包容性的评估。
查看缓存全文
缓存时间: 2026/08/10 08:04
# 行人友好,对谁友好?——利用多模态深度学习捕捉步行适宜性感知中的主观差异 来源:https://arxiv.org/html/2608.06934 Moloud Damandehhttps://orcid.org/0009-0001-4344-9858, , Meead Saberihttps://orcid.org/0000-0002-6526-239X 本工作受澳大利亚研究理事会资助(项目编号 DP220102382)。M. Saberi 同时受澳大利亚研究理事会未来学者奖(Future Fellowship FT250100584)资助。本研究涉及人类受试者。所有伦理程序和方案均已获得新南威尔士大学人类研究伦理委员会批准(批准号 8361)。数据和代码可在 https://github.com/Moloudd/user-conditioned-walkability-assessment 获取。 利益冲突声明:M. Saberi 是 footpath.ai 的联合创始人兼首席执行官,该公司为本研究提供图像数据,但在研究设计或发表决策中未发挥作用。 作者单位:澳大利亚新南威尔士州悉尼市新南威尔士大学(UNSW)土木与环境工程学院,以及综合交通创新研究中心(rCITI)。 通讯作者:Meead Saberi(电子邮件:[email protected])。 ###### 摘要 步行适宜性的视觉感知在不同个体之间存在显著差异,反映了个人特征、经历和偏好的不同。然而,现有研究往往将这些多样化的判断简化为聚合评分,隐含地假设感知是均质的,并且通常依赖车载街景图像,这些图像并不能反映行人的视觉体验。本文引入了一个包含 1,196 名受访者、29,870 条步行适宜性评分的数据集,将澳大利亚城市、郊区和区域环境中的人行道视角图像与个体评分者属性相关联,并提出了首个面向步行适宜性感知的用户条件多模态深度学习框架,将视觉特征与受访者层面的表征相融合。一项视角对比研究表明,人行道视角图像获得的步行适宜性评分显著高于匹配的街景图像,这表明在感知调查设计中,图像数据源的选择是一个实质性决策。用户条件模型在排名一致性方面相比仅使用图像的基线模型提高了 65%(加权二次卡帕系数 0.47 对 0.29),表明“谁在评价环境”所携带的预测信息超越了图像内容本身。这些发现支持从聚合的、与观察者无关的步行适宜性评分,转向能够代表多样化用户的模型,从而实现更具包容性的步行环境评估。 ###### 关键词:步行适宜性感知、人行道视角图像、基于数据的方法(学习、深度学习、强化学习)、交通规划与设计、行人流与人群 ## I 引言 步行友好型街区能够增强社区内的社会互动和经济活动,因此步行适宜性成为城市规划和设计中的重要考量因素[1(https://arxiv.org/html/2608.06934#bib.bib1),2(https://arxiv.org/html/2608.06934#bib.bib2)]。理解人们如何感知其环境的步行适宜性,以及这些感知为何存在差异,对于设计服务于多样化社区的道路至关重要[3(https://arxiv.org/html/2608.06934#bib.bib3)]。尽管建成环境的视觉特征在塑造步行适宜性感知方面发挥着关键作用[4(https://arxiv.org/html/2608.06934#bib.bib4),5(https://arxiv.org/html/2608.06934#bib.bib5)],但感知并非仅由环境特征决定[3(https://arxiv.org/html/2608.06934#bib.bib3),6(https://arxiv.org/html/2608.06934#bib.bib6)]。它还受到用户特定因素的影响,包括人口统计特征、地理背景、社会文化背景以及出行相关需求。因此,同一环境可能被不同人群感知为不同的状态[3(https://arxiv.org/html/2608.06934#bib.bib3),6(https://arxiv.org/html/2608.06934#bib.bib6),7(https://arxiv.org/html/2608.06934#bib.bib7)],这为本已困难的步行适宜性量化任务增添了更多复杂性[5(https://arxiv.org/html/2608.06934#bib.bib5),7(https://arxiv.org/html/2608.06934#bib.bib7)]。尽管已有研究在从视觉特征建模城市感知方面取得了实质性进展[11(https://arxiv.org/html/2608.06934#bib.bib11),27(https://arxiv.org/html/2608.06934#bib.bib27),14(https://arxiv.org/html/2608.06934#bib.bib14)],但能够解释这种主观变异性的预测模型仍然研究不足。 现有基于图像的步行适宜性感知预测方法的另一个局限,在于它们依赖从车载摄像头而非行人视角拍摄的街景图像。这类图像可能会遗漏与行人相关的重要细节。相比之下,人行道视角图像提供了更以行人为中心的视角,减少了视角偏差,并能够更好地捕捉对活跃出行用户重要的元素[8(https://arxiv.org/html/2608.06934#bib.bib8)]。然而,这种视角不匹配是否会影响感知到的步行适宜性评分,在很大程度上仍未得到检验,尽管近期研究已开始建立基于图像的城市感知调查协议[9(https://arxiv.org/html/2608.06934#bib.bib9)]。除了标准化的调查协议外,该领域的进展还依赖于可支持可复现基准测试的开放数据集的可用性[4(https://arxiv.org/html/2608.06934#bib.bib4)]。Place Pulse 2.0 至今仍是最广泛使用的大规模城市视觉感知公共基准之一,它提供了高质量的感知标注,但受访者属性有限[11(https://arxiv.org/html/2608.06934#bib.bib11)]。近期,据我们所知,SPECS 提供了唯一公开可用的城市感知数据集,该数据集将感知评分与更丰富的受访者特征相关联,并分析了不同人口统计和人格群体之间的差异[6(https://arxiv.org/html/2608.06934#bib.bib6)]。然而,SPECS 主要支持更广泛城市感知指标的小组层面分析。专为个体层面、用户条件下的步行适宜性感知建模而设计的公开数据集仍然稀缺,尤其是那些将人行道视角图像与步行适宜性评分及评分者特定属性配对的数据集。 参见图说明 图1:所提出数据集结构概览。(a) 在城市、郊区和区域环境中采样的代表性人行道视角全景图像。(b) 示例图像—受访者记录,展示每张人行道视角图像如何与步行适宜性评分及受访者层面属性相关联。 本文通过三项主要贡献来弥补上述空白。首先,本文引入了一个与个体评分者属性相关联的新的人行道视角步行适宜性感知数据集。其次,本文证明图像视角会影响感知到的步行适宜性,表明在进行步行适宜性感知研究的调查设计时,应慎重考虑视觉数据源的选择。第三,本文提出并评估了一个多模态用户条件深度学习框架,该框架将视觉特征与评分者层面的表征相融合,以建模步行适宜性感知中的个体层面变异性。通过将受访者属性与图像内容相结合,该框架表明步行适宜性感知中的主观差异可以被学习和解释,从而提供比仅使用图像的方法更个性化的视觉步行适宜性表征。除了城市评估和设计之外,这些用户条件预测还可支持个性化行人路线规划,即将预测的街道步行适宜性评分与出行时间一起纳入路线成本函数。这将使不同用户能够获得更符合其自身感知和偏好的路线,类似于将舒适度和安全性等主观标准纳入其中的多准则骑行路线规划方法[12(https://arxiv.org/html/2608.06934#bib.bib12)]。 ## II 相关工作 ### II-A 视觉步行适宜性评估 视觉步行适宜性评估越来越多地使用街道级图像和深度学习,以捕捉行人在街道层面所体验到的物理特征[4(https://arxiv.org/html/2608.06934#bib.bib4)]。基于图像的城市感知研究中的一个主导方法论是众包成对比较,其中城市感知被表述为一个排序问题。这一范式最初是使用 Place Pulse 2.0 数据集建立的,该数据集包含 56 个城市中的 117 万次成对比较,并使用孪生卷积神经网络(CNN)训练来预测两幅街景中哪一幅被认为更安全、更有活力或更美观[11(https://arxiv.org/html/2608.06934#bib.bib11)]。此后,同一框架被应用于步行适宜性,通过收集成对视觉步行适宜性评分,并训练一个多任务 CNN 来同时预测整体步行适宜性及其贡献维度,包括安全性、舒适性和可达性[5(https://arxiv.org/html/2608.06934#bib.bib5)]。一种相关的基于比较的方法也被应用于骑行安全感知,其中使用成对比较训练孪生 CNN,并进行全市范围评估[27(https://arxiv.org/html/2608.06934#bib.bib27)]。 其他研究则使用直接评分而非成对比较。例如,使用谷歌街景图像(SVI)的五点李克特量表评分来训练 CNN,将图像分类为五个有序的步行适宜性类别[14(https://arxiv.org/html/2608.06934#bib.bib14)]。然而,这些模型独立于观察者来描述视觉环境,将个体感知差异视为应被平均掉的噪声,而非需要建模的有意义变异。 在本研究中,步行适宜性评分采用五点李克特量表收集。与成对比较方法不同——后者产生图像层面的聚合分数,并且需要额外的分组来分析人口统计差异[6(https://arxiv.org/html/2608.06934#bib.bib6)]——直接评分保留了每张图像的受访者层面分数。这是所提出的用户条件建模框架的结构性要求。李克特量表还要求每张图像获得稳健估计所需的评分数量更少[9(https://arxiv.org/html/2608.06934#bib.bib9)],因此非常适合本研究的规模。 ### II-B 城市感知中的观察者层面变异性 步行适宜性的概念通常假设行人构成一个同质群体,但实证证据日益挑战这一假设[7(https://arxiv.org/html/2608.06934#bib.bib7)]。跨文化研究表明,尽管不同群体之间可能对步行适宜性有大致相同的理解,但定义步行友好场所的具体建成环境属性会随着社会文化背景和居住历史而系统性变化[7(https://arxiv.org/html/2608.06934#bib.bib7)]。在更广泛的尺度上,一项覆盖五个国家参与者的大规模调查发现,街景感知会因社会人口统计属性而显著变化[6(https://arxiv.org/html/2608.06934#bib.bib6)]。该研究进一步表明,基于聚合响应训练的模型可能因掩盖这种变异而引入系统性偏差。在行人规划领域,研究同样表明,步行适宜性最重要的属性在不同用户群体之间存在显著差异,其中基础设施质量和物理可达性对老年行人尤为重要[3(https://arxiv.org/html/2608.06934#bib.bib3)]。 尽管有这些证据,当前考虑用户差异的规划方法通常依赖于基于专家知识预定义的群体类型,而非从个体层面感知数据中学习观察者特定差异[3(https://arxiv.org/html/2608.06934#bib.bib3)]。与此同时,计算步行适宜性模型通常不将观察者特征作为基于经验评分训练的预测函数的输入。因此,这些研究记录的个体层面感知变异性在当前预测架构中基本上未被表征。 ### II-C 个性化主观图像评估 为个体观察者预测主观图像分数(而非单一的聚合分数)这一任务近年来在图像美学评估文献中受到关注[15(https://arxiv.org/html/2608.06934#bib.bib15),20(https://arxiv.org/html/2608.06934#bib.bib20)]。该领域的一个关键区别是通用图像美学评估(预测所有评分者的平均意见分数)与个性化图像美学评估(预测观察者特定分数)之间的区别[20(https://arxiv.org/html/2608.06934#bib.bib20)]。早期的个性化图像美学评估方法主要使用图像层面属性,将通用预测调整到个体偏好[28(https://arxiv.org/html/2608.06934#bib.bib28)]。较新的工作将人口统计特征和人格特质等个人属性纳入预测模型。例如,PARA 数据集包含 438 名受试者对图像的评分,以及年龄、性别、教育程度和大五人格分数等属性[15(https://arxiv.org/html/2608.06934#bib.bib15)]。基于 PARA 训练的模型在加入受试者信息时表现出更好的性能。类似地,LAPIS 数据集为艺术图像提供了丰富的标注者属性,消融研究表明去除某些属性会降低预测性能[20(https://arxiv.org/html/2608.06934#bib.bib20)],这证实了观察者特征携带的预测信号超越了图像内容本身。 在交通规划领域,现有的步行适宜性和城市感知模型仍更接近通用公式。它们通常为每张图像或每个地点生成一个单一的聚合分数,将所有观察者视为等同。因此,用户条件预测——其中显式观察者属性与图像特征联合编码——尚未应用于步行适宜性或行人环境感知。学习个体用户偏好也已在视觉感知之外的应用中得到认可,包括个性化多模式路线规划系统,其中学习用户特定偏好以改善路线选择建模[37(https://arxiv.org/html/2608.06934#bib.bib37)]。更广泛地说,异构数据源的多模态融合已被确定为智能交通系统(ITS)深度学习文献中的一个重要方向[38(https://arxiv.org/html/2608.06934#bib.bib38)]。然而,先前的应用主要集中在交通预测、感知和控制方面。本研究将多模态学习扩展到行人步行适宜性感知,通过联合编码人行道视角图像和受访者层面特征来实现。 ### II-D 人行道视角图像与视角偏差 街景图像(SVI)已成为城市研究中的重要数据源,因为它能够实现对街道层面建成环境特征的可扩展评估,而这些特征难以用传统 GIS 方法捕捉[8(https://arxiv.org/html/2608.06934#bib.bib8),29(https://arxiv.org/html/2608.06934#bib.bib29)]。然而,大多数现有基于 SVI 的研究依赖于从车载摄像头收集的图像[35(https://arxiv.org/html/2608.06934#bib.bib35)]。这引入了潜在的视角偏差,因为基于车辆的图
相似文章
上下文学习评估建成环境对行动不便老年人感知邻里步行性的影响
本文研究使用TabPFN模型的上下文学习,基于建成环境特征预测行动不便老年人的感知邻里步行性,性能优于基线模型,并采用SHAP-IQ进行交互分析。
学习量化行人行走中的社会互动约束
本文提出了一种名为“学习聚类”的方法,用于量化和解读行人之间的社会互动,以实现更准确的轨迹预测。该方法利用概率潜变量生成学习,在无标签的情况下对社会互动进行聚类,提高了自动驾驶和社交机器人的鲁棒性。
通过感知扰动与奖励建模缓解多模态LLM评判中的感知判断偏差
本文识别出多模态LLM评判者存在的感知判断偏差,即它们倾向于过度奖励流畅但视觉错误的回答,并提出了数据集PPJD以及利用GRPO与批量排序奖励训练的模型Perception-Judge,以缓解此偏差并提升基于感知的评估质量。
通过语言模型的视角描绘城市
本文通过将匿名化的城市画像按40项指标进行评分,衡量了语言模型对“城市”所做的隐含假设,发现它们普遍偏好规模更大、增长更快、基础设施更完善的城市。研究使用开放权重检查点和可复现数据,使语言模型中城市默认画像的经验性追溯成为可能。
Urban-ImageNet: 大规模多模态数据集与城市空间感知评估框架
Urban-ImageNet是一个大规模多模态数据集和评估基准,用于从社交媒体图像进行城市空间感知,支持场景分类、跨模态检索和实例分割任务,覆盖中国24个城市的61个城市地点。