标签
VisCo是一个高效训练的自压缩框架,它重用预训练的视觉-语言模型作为视觉令牌压缩的内在编码器,在所有压缩比率下均实现优越性能,且无需外部模块。
PARCEL提出了一种新颖的视觉语言模型架构,利用池锚重采样和条件弹性查询来提高不同视觉令牌预算下的效率和性能,优于现有的matryoshka基线。
AQuaUI是一种无需训练、推理时即用的GUI代理模型令牌减少方法,利用自适应四叉树降低截图中的空间冗余,实现了高达13.22%的加速和29.52%的视觉令牌减少,同时保留了99.06%的性能。