UI2App:可执行网页应用生成中的视觉交互推理基准测试

Hugging Face Daily Papers 论文

摘要

UI2App 提出了一个基准测试,用于评估视觉语言模型从 UI 截图生成可执行网页应用的能力,重点关注超越视觉保真度的交互推理,并发现当前模型在推断完整交互行为方面存在显著差距。

大语言模型(LLMs)在网页生成方面展现出了日益增强的能力。然而,现有的文本驱动方法依赖于复杂的提示词,这对用户提出了很高的要求,并且在页面布局和跨页面视觉一致性方面表达能力有限。以图像驱动的范式将 UI 截图作为输入,更贴近实际的开发流程。然而,当前的基准测试主要关注视觉保真度,缺乏对生成产物交互能力的系统评估。为填补这一空白,我们提出了 UI2App,这是首个针对交互推理的基准测试——即仅凭截图恢复应用行为的能力,无需任何文本或行为指导。UI2App 包含 327 张截图,这些截图被组织成 45 个状态一致的截图集,用于可运行的多路由网页应用。我们设计了一个端到端流水线,从四个维度评估每个产物:可执行性、导航可达性、视觉保真度和交互推理。交互度量(IIS)通过功能正确性和状态管理复杂度来评估推断的交互,对任何有效实现予以认可,而非匹配单一参考标准。在六个前沿视觉语言模型上的实验揭示了视觉重建与交互实现之间的显著能力不匹配:视觉保真度领先者的 IIS 得分仅为 7.5,排名第四,落后 IIS 领先者 5.2 倍。高复杂度交互(如跨页面状态)仍然是普遍瓶颈,一半的评估模型在此维度得分为零。总体而言,结果表明从静态截图中推断完整的交互行为仍然是模型面临的关键挑战。
查看原文
查看缓存全文

缓存时间: 2026/07/21 18:38

论文页面 - UI2App:在可执行Web应用生成中基准测试视觉交互推理

来源:https://huggingface.co/papers/2607.06306 发布于7月7日

·

提交者https://huggingface.co/cestlavieChen

CHEN (https://huggingface.co/cestlavieChen) 于7月21日

摘要

大型语言模型(LLMs)在网页生成方面展现出日益增强的能力。然而,现有的文本驱动方法依赖于复杂提示,这给用户带来较大负担,并且对页面布局和跨页面视觉一致性的表达能力有限。以图像为输入的范式(将UI截图作为输入)更贴合实际开发工作流程。然而,当前的基准测试主要关注视觉保真度,缺乏对生成制品中交互能力的系统性评估。为填补这一空白,我们引入 UI2App——首个针对交互推理(即仅从截图恢复应用行为的能力,无需任何文本或行为引导)的基准测试。UI2App 包含 327 张截图,按状态一致性分组为 45 组截图集,用于构建可运行的多路由 Web 应用。我们设计了一个端到端流水线,从四个维度评估每个制品:可执行性、导航可达性、视觉保真度和交互推理。交互指标(IIS)通过功能正确性和状态管理复杂度来评估推理出的交互,只要实现有效即可得分,而非匹配单一参考。在六个前沿视觉-语言模型上的实验揭示了视觉重建与交互实现之间的显著能力差距:视觉保真度领先的模型在 IIS 上仅得 7.5 分,排名第四,落后于 IIS 领先者 5.2 倍。高复杂度交互(如跨页面状态)仍是普遍瓶颈,半数被评估模型在此维度上得零分。总体而言,结果表明从静态截图推理完整交互行为对模型而言仍是一项关键挑战。

查看 arXiv 页面 (https://arxiv.org/abs/2607.06306) 查看 PDF (https://arxiv.org/pdf/2607.06306) 项目页面 (https://chenmancm169.github.io/UI2App-ProjectPage/) GitHub1 (https://github.com/chenmancm169/UI2App) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.06306)

在您的代理中获取这篇论文:

hf papers read 2607\.06306

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有引用此论文的模型

在模型 README.md 中引用 arxiv.org/abs/2607.06306 即可从此页面链接。

引用此论文的数据集 1

UI2App/UI2App 更新于8天前 • 492 • 1 (https://huggingface.co/datasets/UI2App/UI2App)

引用此论文的 Spaces 0

没有引用此论文的 Space

在 Space README.md 中引用 arxiv.org/abs/2607.06306 即可从此页面链接。

包含此论文的收藏 0

没有包含此论文的收藏

将这篇论文添加到一个收藏 (https://huggingface.co/new-collection) 中即可从此页面链接。

相似文章

视觉正确、运行正确:多屏移动应用生成的项目级基准

arXiv cs.AI

MobileForge 是一个面向项目级多屏移动应用生成的基准测试,用于评估多模态大语言模型在构建成功、跨页导航、视觉保真度、可维护性和效率方面的表现。对六个前沿多模态大语言模型的实验表明,当前模型能够编译并到达目标页面,但在交互式导航和视觉质量方面仍存在困难。

WBench:面向交互式视频世界模型评估的综合多轮基准

Hugging Face Daily Papers

WBench是一个全面的多轮基准,用于评估交互式世界模型在五个维度上的表现,包含289个测试用例和1,058次交互轮次,提供自动子指标和诊断洞察。它揭示了没有单一模型能在所有维度上都表现优异。