标签
本文提出了SATS(面向稀疏性的敏感性感知阈值化)及令牌路由框架,通过动态稀疏化MLP激活,提升LLM推理效率。与基于百分位数的基线方法相比,这些方法实现了更优的质量-吞吐量权衡。
本文提出 DPVR-LF,一种面向多模态大语言模型(MLLM)的模态不对称路由框架,该框架在视觉令牌饱和点将其路由到轻量级侧分支,并执行晚期融合,从而在减少视觉计算量的同时保持具有竞争力的性能。
本文提出了Token-Selective Attention (TSA),一种可微的token路由机制,它学习在每个token上跳过Transformer层中不必要的计算,从而在语言建模任务中将token层操作减少14-23%,且质量损失极小。