EvoGenUI-Bench: 评估LLMs作为多轮生成UI助手的基准测试
摘要
EvoGenUI-Bench引入了一个用于评估LLMs作为多轮生成UI助手的基准测试,专注于接口维护,涵盖150个任务,在状态传播和外部基础方面存在挑战。
查看缓存全文
缓存时间: 2026/09/01 11:41
论文页面 - EvoGenUI-Bench:评估大语言模型作为多轮生成式UI助手的能力
来源:https://huggingface.co/papers/2608.29387
摘要
大型语言模型可以生成交互式Web界面,但可靠的生成式UI要求能够随着用户请求的演进维护一个可执行的产物。我们推出了EvoGenUI-Bench,一个用于多轮界面维护的基准测试,包含150个五轮任务和750个对话轮次,涵盖三个场景:信息呈现、可执行交互和基于工具的外部状态维护。我们在浏览器中执行生成的产物,并使用截图、源代码和DOM证据、操作者轨迹以及运行时日志进行评估。除了单轮和整个对话轮次级别的成功率,我们还使用相邻轮次通过保留率(Adjacent Pass Retention)来衡量跨轮次的保持能力。在八种模型中,即使是最强的模型也仅达到74.9%的单轮通过率,而完成全部五轮对话的比例仅为37.3%;在基于工具的任务中,APR进一步降至52.4%。诊断分析表明,呈现类失败主要集中在信息架构上,交互类失败涉及衍生状态传播和功能绑定,而基于工具的失败还额外涉及外部状态的基础定位和需求分解。这些结果将生成式UI的评估从判断孤立的输出重新定义为测试界面行为、衍生状态、外部状态和助手声明在产物演进过程中是否保持同步。
查看arXiv页面 (https://arxiv.org/abs/2608.29387) 查看PDF (https://arxiv.org/pdf/2608.29387) GitHub0 (https://github.com/MAPS-research/EvoGenUI-Bench) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.29387)
通过代理获取此论文:
hf papers read 2608.29387
尚未安装最新CLI? curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
无模型关联此论文
在模型的README.md中引用 arxiv.org/abs/2608.29387 以将其从本页面链接。
引用此论文的数据集0
无数据集关联此论文
在数据集的README.md中引用 arxiv.org/abs/2608.29387 以将其从本页面链接。
引用此论文的Spaces0
无Space关联此论文
在Space的README.md中引用 arxiv.org/abs/2608.29387 以将其从本页面链接。
包含此论文的集合0
无集合包含此论文
将此论文添加到一个集合 (https://huggingface.co/new-collection) 以将其从本页面链接。
相似文章
面向多模态大语言模型的移动用户体验推理:任务、基准与方法
本文介绍了UXBench,这是一个用于评估多模态大语言模型在移动用户体验推理任务上的多模态基准,并提出了UI-UX,一种基于Qwen3-VL-4B-Thinking微调的多模态大语言模型,在该基准上取得了最先进的性能。
OmniAssistBench: 针对全能大语言模型的助理式交互基准测试
OmniAssistBench 是一个用于评估作为实时视频助理的全能大语言模型的基准测试,揭示当前模型在视觉提示、上下文保持和及时响应方面存在困难。
DashArena:对LLM在交互式分析仪表板生成上的基准测试
介绍了DashArena,这是首个针对LLM开放式、任务驱动的交互式分析仪表板生成的基准测试。它使用浏览器执行器重放交互轨迹,并使用VLM评判器评估结果,人工研究证实了其有效性。
视觉正确、运行正确:多屏移动应用生成的项目级基准
MobileForge 是一个面向项目级多屏移动应用生成的基准测试,用于评估多模态大语言模型在构建成功、跨页导航、视觉保真度、可维护性和效率方面的表现。对六个前沿多模态大语言模型的实验表明,当前模型能够编译并到达目标页面,但在交互式导航和视觉质量方面仍存在困难。
UI2App:可执行网页应用生成中的视觉交互推理基准测试
UI2App 提出了一个基准测试,用于评估视觉语言模型从 UI 截图生成可执行网页应用的能力,重点关注超越视觉保真度的交互推理,并发现当前模型在推断完整交互行为方面存在显著差距。