gui-grounding

标签

Cards List
#gui-grounding

GUI-Primitives:诊断视觉-语言GUI定位中的空间推理失败

arXiv cs.CL · 17小时前 缓存

本文介绍了GUI-Primitives,这是一个包含994个对比指令对的基准,用于诊断视觉-语言模型在GUI定位中的空间推理失败,揭示了大多数失败源于候选定位而非关系理解。

0 人收藏 0 人点赞
#gui-grounding

GUI元素定位中的词汇耦合:句子嵌入跨移动端与Web的标签追踪

arXiv cs.CL · 17小时前 缓存

本文审查了GUI定位评估,揭示高指令-元素嵌入相似性常反映可见标签恢复而非语义定位,并倡导报告词汇基线和诊断信息。

0 人收藏 0 人点赞
#gui-grounding

一次前向胜过两次:InnerZoom实现精准高效的GUI定位

Hugging Face Daily Papers · 2026-06-29 缓存

InnerZoom提出了一种单前向框架,用于GUI定位中的跨层证据桥接,在多个基准测试上实现了最先进的性能,同时将延迟降低高达31.8%。

0 人收藏 0 人点赞
#gui-grounding

信任正确的教师:面向GUI定位的质量感知自蒸馏

Hugging Face Daily Papers · 2026-06-16 缓存

提出面向GUI定位的质量感知自蒸馏方法,通过正确性感知门控和概率缩放改进坐标-标记教师信号,以提升视觉语言模型性能。

0 人收藏 0 人点赞
#gui-grounding

VISTA: 视图一致的自验证训练用于GUI定位

Hugging Face Daily Papers · 2026-06-12 缓存

VISTA提出了一种用于GUI定位的视图一致自验证训练方法,通过使用多个保留目标的视图改进了基于GRPO的坐标预测,在多个基准测试上实现了持续的精度提升。

0 人收藏 0 人点赞
#gui-grounding

DRS-GUI: 动态区域搜索实现免训练GUI定位

arXiv cs.AI · 2026-05-18 缓存

DRS-GUI提出了一种免训练的动态区域搜索框架用于GUI定位,通过轻量级UI感知器模拟人类感知行为,并结合蒙特卡洛树搜索逐步定位与指令相关的元素。实验表明,在ScreenSpot-Pro上,通用和GUI专用多模态大语言模型的定位性能提升了14%。

0 人收藏 0 人点赞
#gui-grounding

@HuggingPapers: Microsoft 刚刚在 Hugging Face 发布了 Phi-Ground-Any,这是一个拥有 40 亿参数的视觉模型,用于 GUI 定位,并取得了 SOTA……

X AI KOLs Following · 2026-05-09 缓存

Microsoft 在 Hugging Face 上发布了 Phi-Ground-Any,这是一个用于 GUI 定位的 40 亿参数视觉模型,取得了最先进的结果,使 AI 智能体能够与屏幕元素进行精确交互。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈