EvoGenUI-Bench: 评估LLMs作为多轮生成UI助手的基准测试

Hugging Face Daily Papers 论文

摘要

EvoGenUI-Bench引入了一个用于评估LLMs作为多轮生成UI助手的基准测试,专注于接口维护,涵盖150个任务,在状态传播和外部基础方面存在挑战。

大语言模型可以生成交互式Web界面,但可靠的生成UI需要随着用户请求的演变维护一个可执行的工件。我们介绍了EvoGenUI-Bench,这是一个用于多轮接口维护的基准测试,包含150个五轮任务和750轮,涵盖三种场景:信息呈现、可执行交互和工具基础的外部状态。我们在浏览器中执行生成的工件,并使用截图、源代码和DOM证据、参与者轨迹和运行时日志进行评估。除了回合级别和场景级别的成功外,我们使用相邻通过保留率来衡量跨回合保留。在八个模型中,即使是最强的模型也达到了74.9%的回合通过率,但仅完成了37.3%的五轮场景;在工具基础任务上,APR进一步下降到52.4%。诊断分析显示,呈现失败主要集中在信息架构,交互失败在于派生状态传播和功能绑定,而工具基础失败还涉及外部状态基础和需求分解。这些结果将生成UI评估从判断孤立输出重新定义为测试随着工件演变,接口行为、派生状态、外部状态和助手声明是否保持同步。
查看原文
查看缓存全文

缓存时间: 2026/09/01 11:41

论文页面 - EvoGenUI-Bench:评估大语言模型作为多轮生成式UI助手的能力

来源:https://huggingface.co/papers/2608.29387

摘要

大型语言模型可以生成交互式Web界面,但可靠的生成式UI要求能够随着用户请求的演进维护一个可执行的产物。我们推出了EvoGenUI-Bench,一个用于多轮界面维护的基准测试,包含150个五轮任务和750个对话轮次,涵盖三个场景:信息呈现、可执行交互和基于工具的外部状态维护。我们在浏览器中执行生成的产物,并使用截图、源代码和DOM证据、操作者轨迹以及运行时日志进行评估。除了单轮和整个对话轮次级别的成功率,我们还使用相邻轮次通过保留率(Adjacent Pass Retention)来衡量跨轮次的保持能力。在八种模型中,即使是最强的模型也仅达到74.9%的单轮通过率,而完成全部五轮对话的比例仅为37.3%;在基于工具的任务中,APR进一步降至52.4%。诊断分析表明,呈现类失败主要集中在信息架构上,交互类失败涉及衍生状态传播和功能绑定,而基于工具的失败还额外涉及外部状态的基础定位和需求分解。这些结果将生成式UI的评估从判断孤立的输出重新定义为测试界面行为、衍生状态、外部状态和助手声明在产物演进过程中是否保持同步。

查看arXiv页面 (https://arxiv.org/abs/2608.29387) 查看PDF (https://arxiv.org/pdf/2608.29387) GitHub0 (https://github.com/MAPS-research/EvoGenUI-Bench) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.29387)

通过代理获取此论文:

hf papers read 2608.29387

尚未安装最新CLI? curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

无模型关联此论文

在模型的README.md中引用 arxiv.org/abs/2608.29387 以将其从本页面链接。

引用此论文的数据集0

无数据集关联此论文

在数据集的README.md中引用 arxiv.org/abs/2608.29387 以将其从本页面链接。

引用此论文的Spaces0

无Space关联此论文

在Space的README.md中引用 arxiv.org/abs/2608.29387 以将其从本页面链接。

包含此论文的集合0

无集合包含此论文

将此论文添加到一个集合 (https://huggingface.co/new-collection) 以将其从本页面链接。

相似文章

视觉正确、运行正确:多屏移动应用生成的项目级基准

arXiv cs.AI

MobileForge 是一个面向项目级多屏移动应用生成的基准测试,用于评估多模态大语言模型在构建成功、跨页导航、视觉保真度、可维护性和效率方面的表现。对六个前沿多模态大语言模型的实验表明,当前模型能够编译并到达目标页面,但在交互式导航和视觉质量方面仍存在困难。