面向多模态大语言模型的移动用户体验推理:任务、基准与方法
摘要
本文介绍了UXBench,这是一个用于评估多模态大语言模型在移动用户体验推理任务上的多模态基准,并提出了UI-UX,一种基于Qwen3-VL-4B-Thinking微调的多模态大语言模型,在该基准上取得了最先进的性能。
arXiv:2606.13192v1 公告类型:新
摘要:以可用性、感知一致性和功能清晰度为核心的用户体验(UX)是真实用户界面(UI)的基础。多模态大语言模型在用户界面领域的应用正在迅速发展,例如视觉元素定位、图形用户界面(GUI)代理以及从设计到代码的生成。然而,基于UI截图评估用户体验的研究仍不成熟。为此,我们提出了UXBench,这是一个新颖的多模态基准,包含2000个VQA数据样本,旨在评估多模态大语言模型执行基于UI的推理能力。UXBench包含基于真实世界UI截图的8个任务,要求对布局关系、视觉层次和内容一致性中的用户体验问题进行细粒度诊断。我们对主流多模态大语言模型的广泛评估表明,它们在基于UI的推理能力上仍存在根本性局限。这一结果凸显了在该领域进一步推进的必要性。为弥补这一差距,我们提出了UI-UX,一种基于Qwen3-VL-4B-Thinking基础模型并通过强化学习增强的多模态大语言模型,具有两项关键创新:奖励路由机制(在推理过程中动态平衡感知理解与逻辑推理)和非对称转移奖励(抑制冗余或不足的推理步骤)。实验表明,UI-UX在UXBench上达到了最先进的性能,准确率为0.7963——超过了Claude-4.5-Sonnet的0.6550——同时在多样化的UI任务中表现出强大的泛化能力,并保持了较低的推理延迟。
查看缓存全文
缓存时间: 2026/06/12 08:55
# 面向多模态大语言模型的移动端用户体验推理:任务、基准与方法
来源:https://arxiv.org/html/2606.13192
Ruichao Mao, Zhou Fang, Teng Guo, Hao Yang, Yaping Li, Shaohua Peng, Maji Huang, Xiaoyu Lin, Shuoyang Liu, Xuepeng Li, Yuyu Zhang, Hai Rao
Ant Group
{maoruichao.mrc, yingnan.fz, gt447200, charles.yh, pinky.lyp, shaohua.psh}@antgroup.com
{huangmaji.hmj, axiao.lxy, liushuoyang.lsy, healy.lxp, yuyu.zyy, raohai.rh}@antgroup.com
###### 摘要
以可用性、感知一致性和功能清晰度为核心的用户体验(UX)是现实世界用户界面(UI)的基础。多模态大语言模型(MLLMs)在用户界面领域的应用正在快速发展,例如视觉元素定位、图形用户界面(GUI)代理以及设计到代码的生成。然而,基于UI截图评估UX的研究工作尚不成熟。为此,我们提出了UXBench,一个新颖的多模态基准测试,包含2000个VQA数据样本,旨在评估MLLMs执行基于UI的推理能力。UXBench包含基于真实UI截图的8个任务,需要对布局关系、视觉层次和内容一致性中的UX问题进行细粒度诊断。我们对主流MLLMs的广泛评估表明,它们在进行基于UI的推理能力方面仍然存在根本性的局限。结果凸显了该领域进一步发展的必要性。为弥补这一差距,我们提出了UI-UX,一个基于Qwen3-VL-4B-Thinking基础模型并通过强化学习增强的MLLM,其包含两个关键创新:一个奖励路由机制,在推理过程中动态平衡感知理解和逻辑推理;以及一个非对称过渡奖励,用于抑制冗余或不足的推理步骤。实验表明,UI-UX在UXBench上取得了最先进的(SOTA)性能,准确率达到0.7963——超过了Claude-4.5-Sonnet的0.6550——同时在各种UI任务中展现出强大的泛化能力,并保持低推理延迟。
## 1 引言
在现代人机交互系统中,成功的决定因素已从单纯的功能实现转向了用户体验(UX)的质量[1]。虽然UI设计侧重于视觉和交互组件,如布局、排版和屏幕元素,但UX设计涵盖了整个用户旅程——交互之前、期间和之后的情感、认知和行为反应[7]。
大语言模型(LLMs)和多模态大语言模型(MLLMs)的兴起极大地推动了人机交互中的用户体验,实现了从原始视觉或多模态输入进行UI理解[41,21,15]、UI生成[39,22,13,25]以及用户情感识别[43,30,14]。这些模型提供了诸如像素级界面解析、意图驱动的UI合成和情感感知交互建模等能力,将基础模型定位为数据驱动、以用户为中心的界面系统的可扩展基础设施。
然而,用户体验问题往往源于设计惯例与用户心智模型之间的错位,而非可见的布局缺陷。例如,遮挡导航栏的模态对话框,或广告内容与实际内容不一致,可能在视觉上看起来正确,却会导致用户沮丧、信任度降低和用户流失。这种从“感知界面”到“推断体验”的转变,对旨在实现自动化UX评估的多模态模型构成了根本性挑战。
现有的基于UI的基准测试,如Screen2Words[32]、Mobile-bench[12]和VisualWebBench[19],主要评估视觉感知任务(例如,生成描述、元素检测、布局解析),而非用户体验推理。这些基准缺乏基于行为结果、认知心理学和信任动态的目标,因此不足以检测那些会引发用户错误或负面情绪的设计模式。因此,当前的MLLMs在UI设计评估、自动化测试和智能设计辅助等应用中仍然受限。
参考图注图1:UXBench样本涵盖效率、可信赖性和可用性维度。每个案例都需要视觉语义推理来检测UX问题(例如,重叠的模态框、欺骗性内容、缺失的控件)。红色边界框表示用于定量评估的真实缺陷区域。任务涉及推断超越像素级感知的体验后果。近期工作探索了一些基于UI的任务,例如设计到代码生成[39]、自动GUI操作和组件识别。然而,这些方法通常依赖手动标注的指令-动作对,或将UX评估简化为二元的“好/坏”分类,忽略了UX问题的多维度和上下文依赖性。对于复杂案例(例如,嵌套式弹窗导致操作不可逆、服务名称与功能不匹配),现有模型经常产生模糊、错误或矛盾的推理。这揭示了在语义关联、反事实推理和意图建模方面的缺陷;仅对齐视觉和文本不足以实现真正的UX理解。
为了解决这些局限性,我们引入了UXBench,这是第一个用于评估MLLMs UI-UX推理能力的多模态基准测试。UXBench包含2000多张带有用户反馈的真实UI截图,将UX问题分为三个维度:可用性、效率和可信赖性,并进一步细分为8个细粒度诊断任务(见图1)。每个任务都作为一个两选或三选问题提出,需要因果推理并映射到设计原则,而非关键词匹配。大规模MLLM辅助标注,结合四位资深UX专家进行的两轮专家验证,确保了高标签一致性。
我们进一步提出了UI-UX,一个基于Qwen3-VL-4B-Thinking[5,33,6]构建的、基于强化学习的MLLM增强框架。UI-UX采用任务自适应奖励路由,对UX诊断任务使用准确性奖励,对一般UI理解中的语义对齐使用ROUGE-L分数,对定位任务使用命中奖励。此外,我们引入了一种非对称过渡奖励机制,以抑制冗余推理并减少推理延迟。无需人工偏好标注,该模型通过GRPO[27]算法进行端到端优化,在UXBench上达到73.8%的准确率,并展现出强大的跨领域泛化能力。
我们的贡献如下:
* •首个UX推理基准:我们提出了UXBench,定义了8个细粒度的、可评估的、以用户为中心的UI诊断任务,填补了该领域的一个关键空白。
* •奖励路由:我们引入了硬负样本采样和语义保持增强策略,以解决现实场景中的正样本稀缺和极端类别不平衡问题。
* •高效推理:提出的UI-UX模型结合了奖励路由和过度思考惩罚,实现了超越人类专家的MLLM UX推理性能,同时具有低延迟和高鲁棒性。
## 2 相关工作
### 2.1 基于UI的基准测试
最近的基准测试侧重于评估模型对用户界面(UI)的视觉理解。Screen2Words[32]和GUI-Text[10]训练模型从配对的截图-文本数据生成UI描述,但局限于静态元素识别和命名,没有模拟交互逻辑或用户意图。RICO[11]和VisualWebBench[19]进一步引入了布局解析和元素定位任务,仍停留在“感知”层面——检测按钮、读取文本、提取结构——而不是判断一个设计是否可能让用户困惑。这些基准都没有定义与用户体验相关的评估维度,因此无法衡量诸如弹窗是否会遮挡关键操作或徽章是否会误导用户等推理。我们的工作通过构建第一个以细粒度UX诊断为中心的基准测试来填补这一空白,使模型能够从理解界面转向理解用户。
### 2.2 用户体验问题与检测方法
用户界面通常存在文本重叠、图像缺失和布局扭曲等问题,这些问题源于设备多样性和设计复杂性,损害了可用性和可访问性。基于视觉的工具如OwlEyes-online[29]和Nighthawk[20]可以定位视觉漏洞,而Metamorphosis[28]通过变体测试检测缩放缺陷。然而,大多数基于分类的方法仅在有限或合成数据集中处理预定义的问题类型,忽略了更高级别的设计气味和跨组件不一致性。UISGPT[38]应用大语言模型识别带有解释的指南违规,但在处理复杂、上下文敏感的推理时存在困难。我们的工作不同之处在于构建了一个丰富的真实世界数据集,捕获了视觉和结构性的UX问题,并利用具有因果推理能力的MLLMs来检测和解释复杂的设计缺陷。
### 2.3 MLLM中的推理
具备推理能力的MLLMs通过引入明确的思维链(CoT)生成和自一致性验证,推动了复杂视觉推理的发展。例如,用于多步图像推理的LLaVA-1.5[16],用于指令调优的逻辑场景分析的MiniGPT-4-v2[44]和InternVL[9,45,34],以及用于MMMU和ChartQA等任务中结构化输出推理的CogVLM和Visual-CoT[26]。最近的工作如GRPO-λ[23]、Step Pruner[36]和CoRE-Eval[42]通过修剪冗余步骤和评估步骤级重要性来解决推理效率问题,为在保持准确性的同时降低延迟提供了见解。尽管取得了这些进展,大多数模型仍然强调基于事实的推理,而非基于经验的推理,这使得它们无法识别诸如按钮位置不当、弹窗干扰或描述误导等UX问题。我们的工作是首次将这种推理嵌入到人机交互的上下文中,使MLLMs能够执行以用户为中心的UI场景因果推理。
## 3 UXBench
现有的视觉-语言基准主要针对一般场景理解和图像生成,对模型在现实世界UI中的推理和理解能力的评估有限。为弥补这一差距,我们提出了UXBench——第一个用于UX缺陷诊断的视觉-语言基准测试——旨在系统性地评估多模态大语言模型在真实UI场景中进行细粒度、高阶推理的能力。
### 3.1 任务定义
传统的UI识别侧重于视觉感知,从截图中检测和分类可见的界面组件,并重构其布局。这些方法依赖于显式特征提取,产生可以直接从像素信息推导出的输出——没有对用户行为或意图进行建模。相比之下,UX诊断需要识别组件并评估其布置、交互逻辑和语义是否构成潜在的体验风险。这类问题通常源于设计惯例与人类使用习惯之间的不匹配。例如,评估“弹窗是否遮挡了按钮”涉及检测、空间分析以及关于操作影响的因果推断——这反映了超越像素级感知的推理。
为了进行细粒度评估,我们将UX诊断组织为三个维度,这些维度从严格的人机交互框架中操作化得到:
1. 可用性:操作和反馈的清晰度。该维度与人机交互框架中的“可操作性”[35]相一致,侧重于屏幕对象的可见性和可访问性。
1. (a) BubbleOcclT:文字覆盖层遮挡页面文本。
2. (b) BubbleOcclBtn:文字覆盖层阻挡可点击元素。
2. 效率:最小化操作和认知成本。经验数据表明,效率是评价最高的可用性因素(平均值:4.07/5)[35]。
1. (a) PopupNoClose:弹窗没有明确的关闭控件。
2. (b) PopupBlockClose:弹窗影响原生关闭按钮的可点击性。
3. (c) PopupStack:同时存在多个模态弹窗。
3. 可信赖性:维护一致性和可信度。该维度操作化了人机交互框架中的“说服力”和“安全性”[8]。
1. (a) MismatchBadge:徽章内容与落地页不一致。
2. (b) MismatchContent:服务名称与页面文本不一致。
3. (c) MismatchFunc:描述与提供的功能不一致。
### 3.2 数据管道
UXBench通过一个多阶段管道构建,结合了大规模真实用户反馈、MLLM辅助标注和专家质量控制。
- 原始数据收集:来自多种移动应用场景的App内反馈中的截图和文本描述。
- 相关性过滤:Gemini-2.5-Pro对相关反馈进行分类;一个微调后的Qwen3-VL-2B大规模复制其决策,以保留高置信度的UX样本。
- 核心分类:相关的样本由Gemini使用少样本提示进行分类标签到维度和子任务,对于歧义案例进行多轮投票。
- 人工验证:四位资深UX研究人员进行两阶段手动验证,首先由所有四位研究员独立标注,然后进行交叉验证并解决分歧。
- 最终数据集:从正样本池和负样本池中均衡采样,得到2000个高质量图像-问题对,涵盖典型问题场景和正常UI场景。
参考图注图2:UXBench中的数据分布。(A) 基准数据集中不同子任务的分布(总计2000个样本)。(B) 用户交互选项的分布。
### 3.3 数据分布
UXBench强调任务和选项分布的多样性。(见图2相似文章
多模态大语言模型评估中我们缺失了什么?
本文回顾了当前多模态大语言模型评估基准,找出了关键差距,如时空连贯性、物理世界理解、多模态一致性和选择性注意力,并指出现有的孤立任务基准无法衡量真正的跨模态整合。
视觉正确、运行正确:多屏移动应用生成的项目级基准
MobileForge 是一个面向项目级多屏移动应用生成的基准测试,用于评估多模态大语言模型在构建成功、跨页导航、视觉保真度、可维护性和效率方面的表现。对六个前沿多模态大语言模型的实验表明,当前模型能够编译并到达目标页面,但在交互式导航和视觉质量方面仍存在困难。
Mind's Eye:面向多模态大模型的视觉抽象、变换与组合基准
研究者推出 Mind’s Eye,一项包含八道视觉认知任务的基准测试,显示顶级多模态大模型得分不足 50%,而人类可达 80%,暴露出视觉抽象、关系映射与心理变换方面的巨大差距。
WorldBench:一个具有挑战性且视觉多样化的多模态推理基准
介绍WorldBench,一个视觉多样化的多模态推理基准,揭示了当前多模态大语言模型在视觉理解方面的显著局限性。
文献综述:边缘端LLM推理:持续负载下移动设备、NPU和GPU的性能效率权衡 | 手机上LLM的Bnechmarking [R]
本文献综述分析了持续负载下移动设备、NPU和GPU上LLM推理的性能效率权衡,重点关注手机上LLM的基准测试。