vision-language-model

标签

Cards List
#vision-language-model

通过强化学习检测UI原则违规

arXiv cs.CL · 2026-07-24 缓存

本文提出了一种通过强化学习训练轻量级视觉-语言模型的方法,用于检测生成网页中19种UI质量原则的违规行为,实现了84%的微平均F1分数。该模型作为评论家,用于审计生成的界面并提供设计感知反馈。

0 人收藏 0 人点赞
#vision-language-model

SceneActBench: 智能体能否在其看到的3D场景中执行操作?

Hugging Face Daily Papers · 2026-07-24 缓存

SceneActBench是一个基准测试,用于评估VLM智能体在完整的多对象3D场景中执行操作的能力,通过五个任务中的任务特定几何指标进行评估。

0 人收藏 0 人点赞
#vision-language-model

SeededGrasp:复杂场景中多形态语言引导的抓取

Hugging Face Daily Papers · 2026-07-22 缓存

SeededGrasp 提出了一种数据高效的框架,利用视觉语言模型预测种子点,用于轻量级抓取生成器的条件输入,从而在复杂场景中实现多机器人形态的语言引导抓取。该方法在仿真中达到72%的成功率,在实际中达到78%,优于基线方法,并包含一个全新的大规模多形态抓取数据集。

0 人收藏 0 人点赞
#vision-language-model

Robostral Navigate

Hugging Face Daily Papers · 2026-07-22 缓存

Robostral Navigate 是一个仅使用单目 RGB 图像进行机器人导航的 80 亿参数视觉语言模型,在 R2R-CE 和 RxR-CE 基准测试中分别以 77.4% 和 75.1% 的成功率达到了最先进水平。

0 人收藏 0 人点赞
#vision-language-model

介绍 Cosmos 3 Edge

Hugging Face Blog · 2026-07-20 缓存

NVIDIA 发布了 Cosmos 3 Edge,一个40亿参数的开源世界模型,专为边缘设备设计,帮助机器人和视觉AI代理理解周围环境、实时推理并生成动作。它在同类模型中实现了领先的吞吐量和准确度。

0 人收藏 0 人点赞
#vision-language-model

超越玩笑:多角度推理用于检测和解释模因中的有害幽默

arXiv cs.AI · 2026-07-20 缓存

本文介绍了MAR-12,一个利用视觉语言模型和多角度推理来检测和解释模因中有害幽默的框架,在PrideMM和Memotion数据集上达到了最先进的准确率。

0 人收藏 0 人点赞
#vision-language-model

小规模语言与视觉语言模型网络代理中GRPO的学习率门控失败:受控零结果及其机制

arXiv cs.AI · 2026-07-15 缓存

本文研究了GRPO后训练是否能提升小规模(4B-8B)语言与视觉语言模型网络代理的性能。结果发现了一个受控的零结果:没有任何配置能在已掌握任务上带来可信的提升,且中高学习率会导致性能退化或崩溃,揭示了退化与崩溃状态之间的双重分离。

0 人收藏 0 人点赞
#vision-language-model

我训练了一个视觉语言模型来玩贪吃蛇,你也可以。[P]

Reddit r/MachineLearning · 2026-07-14

展示如何使用FeynRL框架训练一个视觉语言模型来玩贪吃蛇,以易于理解的方式说明完整的训练流程。

0 人收藏 0 人点赞
#vision-language-model

提示驱动探索

arXiv cs.LG · 2026-07-13 缓存

本文介绍了提示驱动探索(PDE),一种利用视觉语言模型迭代优化强化学习策略的自然语言提示的方法,即使在零奖励起点也能实现全局探索和成功的策略学习。

0 人收藏 0 人点赞
#vision-language-model

moondream3.1-9B-A2B

Reddit r/LocalLLaMA · 2026-07-12 缓存

Moondream 3.1 是一款采用混合专家架构的视觉语言模型(总参数量9B,激活参数量2B),提供最先进的视觉推理、检测、指点和描述功能,可通过 Photon 推理引擎本地部署,或通过 Moondream Cloud API 使用。

0 人收藏 0 人点赞
#vision-language-model

OmniFood-Bench:评估视觉语言模型在营养推理与个性化健康建议方面的能力

arXiv cs.AI · 2026-07-10 缓存

介绍OmniFood-Bench,这是一个评估视觉语言模型在营养推理和个性化健康建议方面的基准。实验表明,视觉语言模型在质量估计和安全关键建议方面存在困难。

0 人收藏 0 人点赞
#vision-language-model

HunyuanOCR-1.5:让轻量级OCR视觉语言模型更快更优

Hugging Face Daily Papers · 2026-07-06 缓存

HunyuanOCR-1.5 是一款轻量级端到端OCR视觉语言模型,通过DFlash(推理速度提升6.37倍)提高效率,通过Agentic Data Flow增强能力,在文档解析、OCR和多语言任务上达到顶级性能。

0 人收藏 0 人点赞
#vision-language-model

InternVLA-A1.5: 统一理解、潜在预见与行动以实现组合泛化

Hugging Face Daily Papers · 2026-07-06 缓存

InternVLA-A1.5 将预训练的视觉语言模型与潜在空间中的未来预测相结合,以实现具有组合泛化和长视界执行能力的高效机器人操作,在模拟基准测试中取得了最先进的结果。

0 人收藏 0 人点赞
#vision-language-model

SINA:一种使用人工智能的全自动电路原理图图像到网表生成器

arXiv cs.LG · 2026-07-03 缓存

本文介绍了SINA,一个开源AI流水线,能够自动将电路原理图图像转换为网表,准确率达96.67%,通过集成深度学习、OCR和视觉语言模型,显著优于以往方法。

0 人收藏 0 人点赞
#vision-language-model

Rank-Then-Act: 基于帧序进度的无奖励控制

Hugging Face Daily Papers · 2026-07-02 缓存

Rank-Then-Act (RTA) 是一个从专家视频演示中学习控制策略的框架,无需环境奖励。它使用视觉语言模型作为基于进度的序数评分器,并结合基于相关性的奖励。该方法实现了稳定的跨任务迁移,并在离散和连续控制基准上优于以往方法。

0 人收藏 0 人点赞
#vision-language-model

Agentic RAG-VLM: 基于功能感知的检索增强生成与自反思规划用于机器人抓取

arXiv cs.AI · 2026-07-01 缓存

本文介绍了Agentic RAG-VLM,一个统一的框架,将检索增强生成与视觉语言模型及自反思规划相结合,实现在杂乱环境中的泛化机器人抓取,成功率达到78.3%。

0 人收藏 0 人点赞
#vision-language-model

EVLA:用于物理基础驾驶推理与控制的电感知多模态助手

arXiv cs.CL · 2026-06-30 缓存

介绍了EVLA,这是一个通过实时感知电动动力总成状态来增强视觉-语言驾驶助手,从而实现能量最优和物理基础决策的框架。

0 人收藏 0 人点赞
#vision-language-model

3D HAMSTER:通过三维轨迹引导连接分层视觉-语言-动作模型中的规划与控制

Hugging Face Daily Papers · 2026-06-30 缓存

3D HAMSTER利用带深度编码的视觉-语言模型生成用于点云控制的三维轨迹,从而增强机器人操作能力,其表现优于二维引导的基线方法。

0 人收藏 0 人点赞
#vision-language-model

InstanceControl:无需实例标注的可控复杂图像生成

Hugging Face Daily Papers · 2026-06-30 缓存

InstanceControl利用视觉语言模型在文本提示与视觉条件之间建立实例级对应,无需人工实例标注即可实现多实例可控图像生成,并通过自适应掩码优化提高准确性。

0 人收藏 0 人点赞
#vision-language-model

Xiaomi-GUI-0 技术报告

Hugging Face Daily Papers · 2026-06-30 缓存

本技术报告介绍了Xiaomi-GUI-0,一个原生多模态GUI智能体,在真实设备环境中使用混合基础设施和渐进式训练管道进行训练和评估,在真实移动任务上实现了高成功率和改进的稳定性。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈