标签
SimLoss利用嵌入空间对比监督,实现单次细粒度图像描述,在降低延迟的同时达到多阶段质量,其中SimLoss FFT等变体实现了高精度。
介绍了一种新型视觉编码器-解码器模型,能够同时处理图像和文本,生成类人回应,适用于图像字幕和视觉问答等任务。
Photoroom 详细介绍了训练 PRX 的数据策略,包括组装多样化数据集、使用 VLM 重新生成描述,以及利用 Mosaic Data Shards 实现高效训练。
介绍了ClaimDiff-RL,一种用于长格式图像描述的强化学习框架,该框架使用类型化、可验证的声明差异作为奖励单元,分别衡量和平衡幻觉与缺失事实,从而提高忠实度和覆盖率。
本文介绍了 BalCapRL,这是一种针对多模态大语言模型(MLLM)的平衡强化学习框架,旨在联合优化图像描述生成中的准确性、覆盖率和语言质量。通过奖励解耦和长度条件屏蔽来解决实用性与流畅性之间的权衡,该方法在性能上优于现有方法。
Florence-2 是微软推出的一款先进的视觉基础模型,它采用基于提示的方法来处理各种视觉和视觉语言任务,如图像描述和目标检测,训练于大规模标注数据集。