标签
本文介绍了包含来自1,196名受访者的29,870条步行适宜性评分的数据集,并提出了一种用户条件多模态深度学习框架,将视觉特征与个体评分者属性相结合,以捕捉步行感知中的主观变异性。该模型在排名一致性上比仅基于图像的基线提高了65%,表明评估环境的主体至关重要。
本文研究了角色提示如何影响多模态大语言模型在城市感知中生成的语言,发现不同角色的描述趋于一致,而解释则随着角色属性系统性地变化。