标签
提出了ProVisE,一个与基准无关的框架,用于利用像素空间输出评估图像生成模型的空间认知,并引入了SpatialGen-Bench,用于跨14个空间子任务的统一评估。
Fusion Embedding 引入了一个模型系列,将音频添加至冻结的视觉-语言嵌入主干网络,从而实现文本、图像、视频和音频检索的统一嵌入空间。该系列模型仅训练轻量级适配器,无需配对音视频数据即可实现音频-图像检索。
微软发布了Mage,这是一系列轻量级拥有40亿参数的多模态模型,用于视觉理解和生成。包括用于图像/视频理解的Mage-VL和用于文生图及图像编辑的Mage-Flow,专为在常规硬件上进行研究和部署而设计。
Baseten 发布了 GLM-5.2-Vision,这是一个视觉语言模型,通过训练好的 PatchMerger 投影器将 MoonViT 视觉编码器添加到 GLM-5.2,同时保持文本主干和视觉塔冻结。该模型被量化到 NVFP4,以在 Blackwell 硬件上进行高效推理。
本文提出了影响力匹配(Inf-Match)方法,这是一种数据集浓缩技术,通过学习一个紧凑的合成集,使其对收敛参数的影响与完整数据集相匹配,从而对齐最终训练结果。该方法在分类基准测试上达到了最先进的准确率,并在视觉-语言浓缩任务中优于强基线方法。
MOSS-VL-Realtime 是一个实时流式视觉语言模型,能够处理连续视频帧,支持可中断交互、主动静默和动态修正,具备时间戳感知编码和256K上下文窗口。
提出SVR-R1,一种多轮强化学习框架,该框架利用模型自身的验证作为多模态推理的学习信号,在视觉-语言推理基准上相较于标准GRPO基线取得了显著的准确率提升。
BRAID是一个框架,它将交错文本-图像-文本推理形式化为统一的马尔可夫决策过程,通过强化学习实现文本和视觉生成的联合优化,并由VLM裁判提供密集的轮次级反馈。
本技术报告介绍了 iFLYTEK-Embodied-Omni,这是一个统一的多模态基础模型,采用脑-小脑协作架构和四阶段训练策略,联合建模视觉、语言和动作,用于具身智能体。
mlx-vlm v0.6.4 已发布,支持5个新模型系列、TTS/STT端点,以及包括 TurboQuant 和连续批处理在内的重大性能改进。
介绍了一种无需训练的零样本组合图像检索框架PEC-CIR,该框架采用Planner-Executor-Critic架构,通过将查询构建组织为多阶段推理流程来提高检索精度。
IMCBench是一个新的基准,用于评估多模态大语言模型在图像基础医疗对话中的表现,它将临床图像与合成患者档案配对。在安全性、准确性和不确定性方面的评估表明,即使是像Claude Opus 4.6这样强大的模型也存在安全问题,凸显了多维度评估的必要性。
介绍了MatMMExtract流程,用于将复合科学图形分解为子图并使用LLM进行标注,创建了MatSciFig数据集,包含超过390,000个图像-文本对,用于材料科学中的视觉语言学习。
本文提出Rank-Aware Hyperbolic Alignment (RAHA),一种用于视觉-语言数据集蒸馏的方法,利用双曲几何和对齐容量控制,将大规模图像-文本数据集高效压缩为高质量的合成对。
GAVEL 提出了一个新任务,用于验证、解释和定位图像-文本对中的错误,并附带一个数据集和基准。一个监督基线显示出相对于强闭源模型的改进。
本综述论文系统回顾了多模态大语言模型(MLLMs)中统一视觉-语言感知的范式演进,提出了五阶段分类法,并指出了通向通用多模态智能的开放挑战。
本文介绍了一种过渡感知型Best-of-N采样方法,这是一种无需训练的方法,通过使用集合到集合的距离度量来编码既往与当前检查之间的变化,从而生成纵向胸部X光报告。
本文介绍了REVEAL++,一种用于视觉-语言对比学习的可微分表型分组方法,应用于视网膜眼底图像和临床风险叙述,以预测阿尔茨海默病风险,其性能优于离散分组基线方法。
研究人员推出了T-Rex,这是一个集成了视觉、语言和触觉感知的框架,使机器人能够实时响应物理接触,而非仅依赖视觉。