UI2App:可执行网页应用生成中的视觉交互推理基准测试
摘要
UI2App 提出了一个基准测试,用于评估视觉语言模型从 UI 截图生成可执行网页应用的能力,重点关注超越视觉保真度的交互推理,并发现当前模型在推断完整交互行为方面存在显著差距。
查看缓存全文
缓存时间: 2026/07/21 18:38
论文页面 - UI2App:在可执行Web应用生成中基准测试视觉交互推理
来源:https://huggingface.co/papers/2607.06306 发布于7月7日
·
提交者https://huggingface.co/cestlavieChen
CHEN (https://huggingface.co/cestlavieChen) 于7月21日
摘要
大型语言模型(LLMs)在网页生成方面展现出日益增强的能力。然而,现有的文本驱动方法依赖于复杂提示,这给用户带来较大负担,并且对页面布局和跨页面视觉一致性的表达能力有限。以图像为输入的范式(将UI截图作为输入)更贴合实际开发工作流程。然而,当前的基准测试主要关注视觉保真度,缺乏对生成制品中交互能力的系统性评估。为填补这一空白,我们引入 UI2App——首个针对交互推理(即仅从截图恢复应用行为的能力,无需任何文本或行为引导)的基准测试。UI2App 包含 327 张截图,按状态一致性分组为 45 组截图集,用于构建可运行的多路由 Web 应用。我们设计了一个端到端流水线,从四个维度评估每个制品:可执行性、导航可达性、视觉保真度和交互推理。交互指标(IIS)通过功能正确性和状态管理复杂度来评估推理出的交互,只要实现有效即可得分,而非匹配单一参考。在六个前沿视觉-语言模型上的实验揭示了视觉重建与交互实现之间的显著能力差距:视觉保真度领先的模型在 IIS 上仅得 7.5 分,排名第四,落后于 IIS 领先者 5.2 倍。高复杂度交互(如跨页面状态)仍是普遍瓶颈,半数被评估模型在此维度上得零分。总体而言,结果表明从静态截图推理完整交互行为对模型而言仍是一项关键挑战。
查看 arXiv 页面 (https://arxiv.org/abs/2607.06306) 查看 PDF (https://arxiv.org/pdf/2607.06306) 项目页面 (https://chenmancm169.github.io/UI2App-ProjectPage/) GitHub1 (https://github.com/chenmancm169/UI2App) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.06306)
在您的代理中获取这篇论文:
hf papers read 2607\.06306
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有引用此论文的模型
在模型 README.md 中引用 arxiv.org/abs/2607.06306 即可从此页面链接。
引用此论文的数据集 1
UI2App/UI2App 更新于8天前 • 492 • 1 (https://huggingface.co/datasets/UI2App/UI2App)
引用此论文的 Spaces 0
没有引用此论文的 Space
在 Space README.md 中引用 arxiv.org/abs/2607.06306 即可从此页面链接。
包含此论文的收藏 0
没有包含此论文的收藏
将这篇论文添加到一个收藏 (https://huggingface.co/new-collection) 中即可从此页面链接。
相似文章
视觉正确、运行正确:多屏移动应用生成的项目级基准
MobileForge 是一个面向项目级多屏移动应用生成的基准测试,用于评估多模态大语言模型在构建成功、跨页导航、视觉保真度、可维护性和效率方面的表现。对六个前沿多模态大语言模型的实验表明,当前模型能够编译并到达目标页面,但在交互式导航和视觉质量方面仍存在困难。
Chat2Workflow:用自然语言生成可执行可视化工作流的基准测试
Chat2Workflow 提出了一套基准与智能体框架,用于将自然语言直接转化为可执行的可视化工作流。实验表明,现有大模型虽能捕捉意图,却难以胜任工业级自动化。
SWE-WebDevBench:评估编码智能体应用平台作为虚拟软件代理商的能力
本文介绍了 SWE-WebDevBench,这是一个包含 68 项指标的综合框架,用于评估 AI 驱动的应用开发平台作为虚拟软件代理商的表现。研究强调了当前平台在规范理解、后端可靠性、生产就绪性和安全性方面存在的关键差距。
WBench:面向交互式视频世界模型评估的综合多轮基准
WBench是一个全面的多轮基准,用于评估交互式世界模型在五个维度上的表现,包含289个测试用例和1,058次交互轮次,提供自动子指标和诊断洞察。它揭示了没有单一模型能在所有维度上都表现优异。
MobileExplorer: 通过在线探索加速移动GUI智能体的设备端推理
MobileExplorer是一个新框架,通过在模型推理期间对UI元素进行轻量级并行探索,加速移动GUI智能体的设备端推理,将推理步骤和延迟降低23%,同时保持或提高任务成功率。