token-pruning

标签

Cards List
#token-pruning

SCOPD:用于高效视觉语言模型的稀疏上下文在策略自蒸馏

Hugging Face Daily Papers ↗ · 3天前 缓存

SCOPD引入了一个稀疏上下文在策略自蒸馏框架,通过改进对剪枝后视觉token的利用来提升视觉语言模型的效率,在无额外推理成本的情况下实现了更高的性能保留。

0 人收藏 0 人点赞
#token-pruning

CoVeR:用于视觉语言模型多视角3D推理的基于覆盖的令牌剪枝技术

Hugging Face Daily Papers ↗ · 2026-09-08 缓存

CoVeR 是一种无需训练的空间令牌选择器,通过强制执行精确的令牌预算和全面的场景覆盖,提高视觉语言模型中的3D推理能力,超越了先前的最先进方法。

0 人收藏 0 人点赞
#token-pruning

高效Transformer中的稀疏令牌路由

arXiv cs.CL ↗ · 2026-08-24 缓存

本文使用SEWN(一种带有学习门控的双流模型用于令牌路由)评估了Transformer中的自适应计算,表明SEWN-sparse在准确性略有损失的情况下,相比BERT-base和DistilBERT实现了显著的吞吐量提升,并提供了可解释的令牌重要性信号。

0 人收藏 0 人点赞
#token-pruning

TRINE:一种面向多模态AI的令牌感知、运行时自适应FPGA推理引擎

arXiv cs.AI ↗ · 2026-06-01 缓存

TRINE是一款单比特流FPGA加速器与编译器,用于端到端多模态推理,统一了多种层类型,并集成了运行时自适应计算模式、令牌剪枝和依赖感知的卸载功能,在20-21W功耗下相比RTX 4090实现最高22.57倍的延迟降低。

0 人收藏 0 人点赞
#token-pruning

通过令牌剪枝优化韩语中心的大语言模型

arXiv cs.CL ↗ · 2026-04-20 缓存

本文系统地评估了令牌剪枝这一压缩技术在韩语中心的LLM任务上的应用,该技术通过移除与无关语言对应的令牌和嵌入参数来压缩模型。研究评估了流行的多语言模型(Qwen3、Gemma-3、Llama-3、Aya)在不同词汇配置下的表现,发现令牌剪枝能显著改进生成稳定性并降低特定领域部署的内存占用。

0 人收藏 0 人点赞
#token-pruning

及时止损!学习早期剪枝路径以实现高效并行推理

Hugging Face Daily Papers ↗ · 2026-04-17 缓存

本文介绍了STOP(用于剪枝的超令牌),一种轻量级方法,通过在并行解码中附加可学习令牌并读取KV缓存状态,学会早期剪枝不优的推理路径,在AIME和GPQA基准测试中实现70%的令牌减少,同时提高性能。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈