vision-encoder

标签

Cards List
#vision-encoder

MoE-ViE:高效图像与视频理解的混合专家视觉编码器

Hugging Face Daily Papers · 2026-08-18 缓存

本文介绍了MoE-ViE,一种混合专家视觉编码器,能够高效扩展以支持图像和视频理解,并以更低的推理延迟超越更大的密集模型。

0 人收藏 0 人点赞
#vision-encoder

UltraViT:面向大型视觉语言模型的延迟优化端侧视觉编码器

Hugging Face Daily Papers · 2026-07-25 缓存

UltraViT 是一个面向大型视觉语言模型的延迟优化视觉编码器,专为端侧部署设计,采用金字塔架构和两阶段生成式预训练策略,以1.7倍速度实现最先进的性能。

0 人收藏 0 人点赞
#vision-encoder

ViQ:任意分辨率下的文本对齐视觉量化表示

Hugging Face Daily Papers · 2026-06-25 缓存

ViQ提出了一种视觉量化框架,在离散表示中平衡了语义丰富性和细节保留,通过文本对齐预训练和邻近表示学习,支持原生分辨率输入,实现高效的多模态训练。

0 人收藏 0 人点赞
#vision-encoder

EarlyTom:早期Token压缩实现快速视频理解

Hugging Face Daily Papers · 2026-05-28 缓存

EarlyTom是一个无需训练即可在视觉编码器早期压缩视觉token的框架,可减少首个token生成时间和计算成本,同时保持准确性,实现高达2.65倍的TTFT降低。

0 人收藏 0 人点赞
#vision-encoder

LiteFrame 扩展视频大语言模型效率(6分钟阅读)

TLDR AI · 2026-05-21 缓存

LiteFrame 为视频大语言模型引入了一种高效的视频编码器,采用压缩令牌蒸馏技术,在保持准确率的同时,能够处理多达8倍的帧数并降低35%的延迟,为长视频理解开创了新的帕累托前沿。

0 人收藏 0 人点赞
#vision-encoder

LiteFrame: 高效视觉编码器解锁视频大语言模型的帧缩放

Hugging Face Daily Papers · 2026-05-17 缓存

LiteFrame提出了一种轻量级视频编码器,采用压缩令牌蒸馏(Compressed Token Distillation)训练,可降低延迟,并使视频大语言模型能够处理8倍以上的帧数以实现长视频理解,在降低计算量的同时提高准确性。

0 人收藏 0 人点赞
#vision-encoder

Delta-Adapter:通过单对监督实现可扩展的基于示例的图像编辑

Hugging Face Daily Papers · 2026-05-08 缓存

Delta-Adapter 通过从预训练视觉编码器中提取语义 delta 并通过基于 Perceiver 的适配器注入它们,实现了使用单对监督的基于示例的图像编辑,提高了准确性和泛化能力。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈