image-captioning

标签

Cards List
#image-captioning

一瞥足矣:使用SimLoss的单次细粒度图像描述

Hugging Face Daily Papers ↗ · 2026-09-01 缓存

SimLoss利用嵌入空间对比监督,实现单次细粒度图像描述,在降低延迟的同时达到多阶段质量,其中SimLoss FFT等变体实现了高精度。

0 人收藏 0 人点赞
#image-captioning

@HuggingModels: 想构建一个能看图像并用自然语言描述的AI吗?这个新模型就能做到。它是一个视觉编码器-解码器…

X AI KOLs Following ↗ · 2026-07-14

介绍了一种新型视觉编码器-解码器模型,能够同时处理图像和文本,生成类人回应,适用于图像字幕和视觉问答等任务。

0 人收藏 0 人点赞
#image-captioning

PRX 第4部分:我们的数据策略

Hugging Face Blog ↗ · 2026-07-06 缓存

Photoroom 详细介绍了训练 PRX 的数据策略,包括组装多样化数据集、使用 VLM 重新生成描述,以及利用 Mosaic Data Shards 实现高效训练。

0 人收藏 0 人点赞
#image-captioning

ClaimDiff-RL:通过视觉声明比较进行细粒度描述强化学习

arXiv cs.LG ↗ · 2026-05-21 缓存

介绍了ClaimDiff-RL,一种用于长格式图像描述的强化学习框架,该框架使用类型化、可验证的声明差异作为奖励单元,分别衡量和平衡幻觉与缺失事实,从而提高忠实度和覆盖率。

0 人收藏 0 人点赞
#image-captioning

BalCapRL:一种用于基于强化学习的 MLLM 图像描述生成的平衡框架

Hugging Face Daily Papers ↗ · 2026-05-08 缓存

本文介绍了 BalCapRL,这是一种针对多模态大语言模型(MLLM)的平衡强化学习框架,旨在联合优化图像描述生成中的准确性、覆盖率和语言质量。通过奖励解耦和长度条件屏蔽来解决实用性与流畅性之间的权衡,该方法在性能上优于现有方法。

0 人收藏 0 人点赞
#image-captioning

lucataco/florence-2-large

Replicate Explore ↗ · 2026-09-09 缓存

Florence-2 是微软推出的一款先进的视觉基础模型,它采用基于提示的方法来处理各种视觉和视觉语言任务,如图像描述和目标检测,训练于大规模标注数据集。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈