标签
作者描述了一种Token路由系统,用于优化大语言模型的使用,通过基于成本的路由、提示缓存和输出规范等技术,将API成本降低了高达70%。
本文介绍了一种基于角色条件的子令牌路由(RoleSub)方法,该方法通过路由子令牌组来高效压缩视觉-语言-动作模型,在降低计算成本的同时,保持在机器人任务上的强大性能。
本文提出了SATS(面向稀疏性的敏感性感知阈值化)及令牌路由框架,通过动态稀疏化MLP激活,提升LLM推理效率。与基于百分位数的基线方法相比,这些方法实现了更优的质量-吞吐量权衡。
本文提出 DPVR-LF,一种面向多模态大语言模型(MLLM)的模态不对称路由框架,该框架在视觉令牌饱和点将其路由到轻量级侧分支,并执行晚期融合,从而在减少视觉计算量的同时保持具有竞争力的性能。
本文提出了Token-Selective Attention (TSA),一种可微的token路由机制,它学习在每个token上跳过Transformer层中不必要的计算,从而在语言建模任务中将token层操作减少14-23%,且质量损失极小。