标签
本文提出了TSS,一个针对特定领域大型语言模型推测解码的目标端稀疏化框架,通过跳过选定的目标层来提升推理效率和性能。
AgentRouter 是一个轻量级分类器,用于在代理工作流中将步骤路由到不同的模型层级,与仅使用前沿模型相比,实现了72%的成本降低且质量退化最小。
StepKV是一种面向LLM代理的步骤感知KV缓存压缩方法,通过保留推理步骤,在低内存预算下保持准确性,解决了多步推理中推理连续性中断的问题。
Reviser是一种新颖的仅解码器Transformer模型,通过自回归光标动作实现可修订的文本生成,与基线模型相比,在保持有竞争力性能的同时,降低了推理计算成本。
该论文提出了OBC-Prune,一种用于剪枝大推理模型的校准方法,它识别因果上重要的推理电路,以提高准确性并减少在MATH500和LiveCodeBench等基准测试中的推理开销。
本文回顾了基于Kashin分解的大型语言模型权重量化方法,并提出一种使用结构化正交变换的改进算法,相比OPTQ和QuIP等方法,降低了计算成本并确保了数值稳定性。
FlexComp 是一个与方法无关的框架,它将压缩比率与训练和部署解耦,使得单一模型能够使用 Matryoshka 风格训练和基于每个输入的预算选择,在任何比率下压缩 LLM 上下文,以实现高效推理。
KVMem 通过在 GPU 内存和存储之间分页 KV 状态,虚拟化长时代理工作区,从而在消费级硬件上提高推理效率和任务成功率,最高可达 1M 令牌。
本综述研究了视频大语言模型的推理效率技术,分析了在帧采样、编码、令牌压缩和语言模型阶段的成本降低,同时识别了评估缺口。
BeaconKV 是一种无需训练的方法,它使用信标查询来压缩键值缓存,以实现大型推理模型的高效推理,从而减少内存使用并提高吞吐量,且不牺牲准确性。
本巨型帖子汇总了专注于优化推理、效率和可访问性的最新开源项目、研究论文及硬件创新,针对开源LLM及相关技术。
本文提出LAC(LightActor,deepCritic),一种离线强化学习方法,通过将模型容量分配给critic以提高推理效率,在匹配复杂生成Actor性能的同时实现更低延迟。
Z.ai揭示了其背后是广受欢迎的Ox Alpha模型,并发布了GLM-5.3-Flash,这是一个为极致效率和低成本推理而设计的多模态模型,性能与领先模型相当,但成本仅为一小部分。
OpenAI 已发布了其定制 ASIC Jalapeño 的实验室结果,显示其性能超越 NVIDIA 的 GB200 和 GB300 芯片,并在推理效率上与 Vera Rubin 相匹敌。
本文提出了注意力感知变换编码(AATC)用于压缩大语言模型中的KV缓存,通过注意力机制最小化失真,在约5.8倍压缩下实现了近乎无损的准确率。
本文介绍了内化视觉思维(IVT),一个后训练框架,该框架训练多模态模型预测未来帧嵌入,从而无需合成中间图像即可直接生成答案,将主动视频推理的延迟降低5倍以上。
本文介绍了双流Transformer,一种通过添加辅助流进行续写预测、同时共享权重和主KV缓存来解耦预填充和解码计算的架构,从而实现分阶段计算分配并提高效率。
本文介绍了LorExperts和BTExperts,这两种面向混合专家大语言模型的保留路由器压缩方法,通过聚类专家并将非主导成员表示为低秩修正,相较于D2-MoE等先前方法提升了压缩质量。
本文提出ReCo,一种奖励协调的压缩框架,利用过程奖励估计器自适应压缩KV缓存、控制反思Token并启用早停,在保持准确率的同时,将推理模型的生成Token减少37%–65%,延迟降低约2倍。
ResKV提出了一种KV缓存压缩方法,将固定预算分为精确的主缓存和紧凑的残差缓存,以重构被省略的注意力贡献,从而在多个骨干网络上提升LongBench和RULER上的性能。