visual-encoding

标签

Cards List
#visual-encoding

精细粒度MLLM感知的区域级策略优化

Hugging Face Daily Papers · 4天前 缓存

Vision-RL²是一种方法,通过区域级强化学习压缩视觉令牌,在不进行全模型微调的情况下,提升多模态大型语言模型在多个基准测试中的精细粒度感知性能。

0 人收藏 0 人点赞
#visual-encoding

LLaVA-UHD v4:高效视觉编码在 MLLMs 中的关键要素是什么?

Hugging Face Daily Papers · 2026-05-09 缓存

本文介绍了 LLaVA-UHD v4,该模型通过采用基于切片(slice-based)的编码和 ViT 内部早期压缩,提高了多模态大语言模型中的视觉编码效率。它在保持或提升高分辨率图像任务性能的同时,将计算成本降低了 55% 以上。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈