visual-tokens

标签

Cards List
#visual-tokens

RenderRank: 使用压缩视觉令牌学习文本重排序

Hugging Face Daily Papers ↗ · 2天前 缓存

RenderRank 介绍了一种重排序方法,该方法使用压缩的视觉文档表示来减少令牌使用并提高效率,同时在多个数据集上保持准确性。

0 人收藏 0 人点赞
#visual-tokens

仅使用MLP:用于多模态语言模型的高效视觉状态重建

Hugging Face Daily Papers ↗ · 2天前 缓存

本文提出了δ-Vision,一种通过使用轻量级低秩适配器高效重建视觉状态而不丢弃视觉令牌,从而降低多模态语言模型计算开销的方法。

0 人收藏 0 人点赞
#visual-tokens

VideoMM:用于高效视频MLLMs的自适应宏微观推理

arXiv cs.AI ↗ · 2026-09-16 缓存

VideoMM 引入了一种自适应宏微观推理框架,可减少视频MLLMs中的视觉token开销,实现6.13倍的速度提升和7.4%的准确率增益,从而高效地理解长视频。

0 人收藏 0 人点赞
#visual-tokens

CoVeR:用于视觉语言模型多视角3D推理的基于覆盖的令牌剪枝技术

Hugging Face Daily Papers ↗ · 2026-09-08 缓存

CoVeR 是一种无需训练的空间令牌选择器,通过强制执行精确的令牌预算和全面的场景覆盖,提高视觉语言模型中的3D推理能力,超越了先前的最先进方法。

0 人收藏 0 人点赞
#visual-tokens

仅用64个视觉token,460M VLM在iPhone上首token延迟降至0.3秒

Reddit r/LocalLLaMA ↗ · 2026-08-05

VisionPsy-Nano-460M-Flash 是一款全新的460M视觉语言模型,每张图像仅使用64个视觉token,在iPhone上首token延迟降至0.3秒,同时保留了完整模型约99%的基准分数。这种优化牺牲了部分OCR和精细细节质量。

0 人收藏 0 人点赞
#visual-tokens

基于查询的跨模态投影器增强 Mamba 多模态大语言模型

arXiv cs.CL ↗ · 2026-06-04 缓存

本文提出了一种基于查询的跨模态投影器,通过交叉注意力机制对视觉标记进行压缩,以提升基于 Mamba 的多模态大语言模型的性能。该方法在视觉语言基准测试中同时提高了模型性能和吞吐量,并消除了手动设计二维扫描顺序的需求。

0 人收藏 0 人点赞
#visual-tokens

AdaCodec:面向视频多模态大模型的预测性视觉编码

Hugging Face Daily Papers ↗ · 2026-06-01 缓存

AdaCodec 通过仅在场景预测失败时传输完整视觉标记,否则使用紧凑的帧间变化描述,从而减少多模态大模型中的视频编码冗余。在匹配的标记预算下,它优于逐帧 RGB 基线,并且在使用显著更少标记的情况下取得更好或相当的结果,将首令牌延迟从 9.26 秒降至 1.62 秒。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈