vision-language

标签

Cards List
#vision-language

展示而非讲述:在生成像素而非LLM文本中评估空间认知

Hugging Face Daily Papers · 2026-07-23 缓存

提出了ProVisE,一个与基准无关的框架,用于利用像素空间输出评估图像生成模型的空间认知,并引入了SpatialGen-Bench,用于跨14个空间子任务的统一评估。

0 人收藏 0 人点赞
#vision-language

Fusion Embedding:文本、图像、视频与音频的统一嵌入空间

arXiv cs.CL · 2026-07-22 缓存

Fusion Embedding 引入了一个模型系列,将音频添加至冻结的视觉-语言嵌入主干网络,从而实现文本、图像、视频和音频检索的统一嵌入空间。该系列模型仅训练轻量级适配器,无需配对音视频数据即可实现音频-图像检索。

0 人收藏 0 人点赞
#vision-language

Mage (GitHub 仓库)

TLDR AI · 2026-07-22 缓存

微软发布了Mage,这是一系列轻量级拥有40亿参数的多模态模型,用于视觉理解和生成。包括用于图像/视频理解的Mage-VL和用于文生图及图像编辑的Mage-Flow,专为在常规硬件上进行研究和部署而设计。

0 人收藏 0 人点赞
#vision-language

baseten/GLM-5.2-Vision-NVFP4

Hugging Face Models Trending · 2026-07-20 缓存

Baseten 发布了 GLM-5.2-Vision,这是一个视觉语言模型,通过训练好的 PatchMerger 投影器将 MoonViT 视觉编码器添加到 GLM-5.2,同时保持文本主干和视觉塔冻结。该模型被量化到 NVFP4,以在 Blackwell 硬件上进行高效推理。

0 人收藏 0 人点赞
#vision-language

通过影响力匹配进行数据集浓缩

Hugging Face Daily Papers · 2026-07-18 缓存

本文提出了影响力匹配(Inf-Match)方法,这是一种数据集浓缩技术,通过学习一个紧凑的合成集,使其对收敛参数的影响与完整数据集相匹配,从而对齐最终训练结果。该方法在分类基准测试上达到了最先进的准确率,并在视觉-语言浓缩任务中优于强基线方法。

0 人收藏 0 人点赞
#vision-language

OpenMOSS-Team/MOSS-VL-Realtime

Hugging Face Models Trending · 2026-07-14 缓存

MOSS-VL-Realtime 是一个实时流式视觉语言模型,能够处理连续视频帧,支持可中断交互、主动静默和动态修正,具备时间戳感知编码和256K上下文窗口。

0 人收藏 0 人点赞
#vision-language

SVR-R1:在强化学习中通过自验证引导多模态推理

Hugging Face Daily Papers · 2026-07-13 缓存

提出SVR-R1,一种多轮强化学习框架,该框架利用模型自身的验证作为多模态推理的学习信号,在视觉-语言推理基准上相较于标准GRPO基线取得了显著的准确率提升。

0 人收藏 0 人点赞
#vision-language

将交错多模态推理桥接为统一决策过程

arXiv cs.AI · 2026-07-07 缓存

BRAID是一个框架,它将交错文本-图像-文本推理形式化为统一的马尔可夫决策过程,通过强化学习实现文本和视觉生成的联合优化,并由VLM裁判提供密集的轮次级反馈。

0 人收藏 0 人点赞
#vision-language

iFLYTEK-Embodied-Omni Technical Report

arXiv cs.AI · 2026-07-07 缓存

本技术报告介绍了 iFLYTEK-Embodied-Omni,这是一个统一的多模态基础模型,采用脑-小脑协作架构和四阶段训练策略,联合建模视觉、语言和动作,用于具身智能体。

0 人收藏 0 人点赞
#vision-language

@Prince_Canuma: mlx-vlm v0.6.4 来了!今天开始使用:> uv pip install -U mlx-vlm 5个新模型系列 — MiniMax M3、Kimi K2.5、Un…

X AI KOLs Timeline · 2026-07-06 缓存

mlx-vlm v0.6.4 已发布,支持5个新模型系列、TTS/STT端点,以及包括 TurboQuant 和连续批处理在内的重大性能改进。

0 人收藏 0 人点赞
#vision-language

检索前思考:通过战略规划与自我批评实现鲁棒的零样本组合图像检索

arXiv cs.AI · 2026-07-01 缓存

介绍了一种无需训练的零样本组合图像检索框架PEC-CIR,该框架采用Planner-Executor-Critic架构,通过将查询构建组织为多阶段推理流程来提高检索精度。

0 人收藏 0 人点赞
#vision-language

IMCBench:面向图像基础医疗对话的多模态大语言模型基准

arXiv cs.AI · 2026-06-30 缓存

IMCBench是一个新的基准,用于评估多模态大语言模型在图像基础医疗对话中的表现,它将临床图像与合成患者档案配对。在安全性、准确性和不确定性方面的评估表明,即使是像Claude Opus 4.6这样强大的模型也存在安全问题,凸显了多维度评估的必要性。

0 人收藏 0 人点赞
#vision-language

解锁材料科学的视觉记录:来自科学文献的大规模多模态数据集

Hugging Face Daily Papers · 2026-06-29 缓存

介绍了MatMMExtract流程,用于将复合科学图形分解为子图并使用LLM进行标注,创建了MatSciFig数据集,包含超过390,000个图像-文本对,用于材料科学中的视觉语言学习。

0 人收藏 0 人点赞
#vision-language

用于视觉-语言数据集蒸馏的Rank-Aware Hyperbolic Alignment

Hugging Face Daily Papers · 2026-06-28 缓存

本文提出Rank-Aware Hyperbolic Alignment (RAHA),一种用于视觉-语言数据集蒸馏的方法,利用双曲几何和对齐容量控制,将大规模图像-文本数据集高效压缩为高质量的合成对。

0 人收藏 0 人点赞
#vision-language

GAVEL:有依据的描述错误验证与定位

arXiv cs.CL · 2026-06-26 缓存

GAVEL 提出了一个新任务,用于验证、解释和定位图像-文本对中的错误,并附带一个数据集和基准。一个监督基线显示出相对于强闭源模型的改进。

0 人收藏 0 人点赞
#vision-language

从结构到协同:多模态大语言模型中视觉-语言感知范式演进的综述

arXiv cs.CL · 2026-06-26 缓存

本综述论文系统回顾了多模态大语言模型(MLLMs)中统一视觉-语言感知的范式演进,提出了五阶段分类法,并指出了通向通用多模态智能的开放挑战。

0 人收藏 0 人点赞
#vision-language

面向纵向胸部X光报告的过渡感知型Best-of-N采样

Hugging Face Daily Papers · 2026-06-23 缓存

本文介绍了一种过渡感知型Best-of-N采样方法,这是一种无需训练的方法,通过使用集合到集合的距离度量来编码既往与当前检查之间的变化,从而生成纵向胸部X光报告。

0 人收藏 0 人点赞
#vision-language

REVEAL++:面向阿尔茨海默病风险视觉-语言视网膜建模的可微分表型分组

arXiv cs.AI · 2026-06-20 缓存

本文介绍了REVEAL++,一种用于视觉-语言对比学习的可微分表型分组方法,应用于视网膜眼底图像和临床风险叙述,以预测阿尔茨海默病风险,其性能优于离散分组基线方法。

0 人收藏 0 人点赞
#vision-language

研究人员推出T-Rex,一个统一视觉、语言和触觉感知的框架,使机器人能够实时响应物理接触,而非仅依赖视觉

Reddit r/singularity · 2026-06-20

研究人员推出了T-Rex,这是一个集成了视觉、语言和触觉感知的框架,使机器人能够实时响应物理接触,而非仅依赖视觉。

0 人收藏 0 人点赞
#vision-language

DeepSeek 推出视觉功能

Hacker News Top · 2026-06-18

DeepSeek 宣布推出新的视觉功能,很可能是一个视觉语言模型,拓展其人工智能服务。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈