inference-efficiency

标签

Cards List
#inference-efficiency

TSS:目标端稀疏化在特定领域大型语言模型推测解码中的应用

arXiv cs.CL ↗ · 2天前 缓存

本文提出了TSS,一个针对特定领域大型语言模型推测解码的目标端稀疏化框架,通过跳过选定的目标层来提升推理效率和性能。

0 人收藏 0 人点赞
#inference-efficiency

AgentRouter:用于成本最优多步骤代理工作流的异构模型路由

arXiv cs.AI ↗ · 2天前 缓存

AgentRouter 是一个轻量级分类器,用于在代理工作流中将步骤路由到不同的模型层级,与仅使用前沿模型相比,实现了72%的成本降低且质量退化最小。

0 人收藏 0 人点赞
#inference-efficiency

StepKV:面向LLM代理的步骤感知KV缓存压缩方法

arXiv cs.LG ↗ · 3天前 缓存

StepKV是一种面向LLM代理的步骤感知KV缓存压缩方法,通过保留推理步骤,在低内存预算下保持准确性,解决了多步推理中推理连续性中断的问题。

0 人收藏 0 人点赞
#inference-efficiency

Reviser:通过自回归光标动作实现可修订的文本生成

arXiv cs.CL ↗ · 4天前 缓存

Reviser是一种新颖的仅解码器Transformer模型,通过自回归光标动作实现可修订的文本生成,与基线模型相比,在保持有竞争力性能的同时,降低了推理计算成本。

0 人收藏 0 人点赞
#inference-efficiency

OBC-Prune:基于结果的大推理模型剪枝校准方法

arXiv cs.AI ↗ · 2026-09-17 缓存

该论文提出了OBC-Prune,一种用于剪枝大推理模型的校准方法,它识别因果上重要的推理电路,以提高准确性并减少在MATH500和LiveCodeBench等基准测试中的推理开销。

0 人收藏 0 人点赞
#inference-efficiency

语言模型低开销量化的结构化变换

arXiv cs.CL ↗ · 2026-09-11 缓存

本文回顾了基于Kashin分解的大型语言模型权重量化方法,并提出一种使用结构化正交变换的改进算法,相比OPTQ和QuIP等方法,降低了计算成本并确保了数值稳定性。

0 人收藏 0 人点赞
#inference-efficiency

FlexComp: 用于上下文中每种压缩比率的单一模型

arXiv cs.CL ↗ · 2026-09-11 缓存

FlexComp 是一个与方法无关的框架,它将压缩比率与训练和部署解耦,使得单一模型能够使用 Matryoshka 风格训练和基于每个输入的预算选择,在任何比率下压缩 LLM 上下文,以实现高效推理。

0 人收藏 0 人点赞
#inference-efficiency

@omarsar0: 一篇不错的论文,旨在提高推理效率。效率方面的工作已经很久没有出色成果了。这就是为什么它...

X AI KOLs Following ↗ · 2026-09-09 缓存

KVMem 通过在 GPU 内存和存储之间分页 KV 状态,虚拟化长时代理工作区,从而在消费级硬件上提高推理效率和任务成功率,最高可达 1M 令牌。

0 人收藏 0 人点赞
#inference-efficiency

为什么视频处理仍然如此昂贵?视频和视听大语言模型推理效率机制综述

Hugging Face Daily Papers ↗ · 2026-09-09 缓存

本综述研究了视频大语言模型的推理效率技术,分析了在帧采样、编码、令牌压缩和语言模型阶段的成本降低,同时识别了评估缺口。

0 人收藏 0 人点赞
#inference-efficiency

BeaconKV:基于信标查询的键值缓存压缩技术,用于高效大型推理模型推理

Hugging Face Daily Papers ↗ · 2026-09-04 缓存

BeaconKV 是一种无需训练的方法,它使用信标查询来压缩键值缓存,以实现大型推理模型的高效推理,从而减少内存使用并提高吞吐量,且不牺牲准确性。

0 人收藏 0 人点赞
#inference-efficiency

汇总最新开源项目、研究论文,助力开源LLM及相关硬件、软件的优化、效率与可访问性?

Reddit r/LocalLLaMA ↗ · 2026-09-03

本巨型帖子汇总了专注于优化推理、效率和可访问性的最新开源项目、研究论文及硬件创新,针对开源LLM及相关技术。

0 人收藏 0 人点赞
#inference-efficiency

面向可扩展强化学习的简单Actor与深度Critic

arXiv cs.LG ↗ · 2026-08-28 缓存

本文提出LAC(LightActor,deepCritic),一种离线强化学习方法,通过将模型容量分配给critic以提高推理效率,在匹配复杂生成Actor性能的同时实现更低延迟。

0 人收藏 0 人点赞
#inference-efficiency

Z.ai的Ox Alpha揭示AI经济的哪些秘密(3分钟阅读)

TLDR AI ↗ · 2026-08-27 缓存

Z.ai揭示了其背后是广受欢迎的Ox Alpha模型,并发布了GLM-5.3-Flash,这是一个为极致效率和低成本推理而设计的多模态模型,性能与领先模型相当,但成本仅为一小部分。

0 人收藏 0 人点赞
#inference-efficiency

@ai_for_success:OpenAI 发布了 Jalapeño 的实验室结果,显示其定制 ASIC 超越 NVIDIA 的 GB200 和 GB300,并在推理效率上与 Vera Rubin 相媲美……

X AI KOLs Timeline ↗ · 2026-08-25 缓存

OpenAI 已发布了其定制 ASIC Jalapeño 的实验室结果,显示其性能超越 NVIDIA 的 GB200 和 GB300 芯片,并在推理效率上与 Vera Rubin 相匹敌。

0 人收藏 0 人点赞
#inference-efficiency

通过变换编码视角的KV缓存压缩

arXiv cs.LG ↗ · 2026-08-17 缓存

本文提出了注意力感知变换编码(AATC)用于压缩大语言模型中的KV缓存,通过注意力机制最小化失真,在约5.8倍压缩下实现了近乎无损的准确率。

0 人收藏 0 人点赞
#inference-efficiency

超越视觉思维链:内化视觉思维的主动视频推理

Hugging Face Daily Papers ↗ · 2026-08-16 缓存

本文介绍了内化视觉思维(IVT),一个后训练框架,该框架训练多模态模型预测未来帧嵌入,从而无需合成中间图像即可直接生成答案,将主动视频推理的延迟降低5倍以上。

0 人收藏 0 人点赞
#inference-efficiency

双流Transformer:将主预填充路径与额外解码计算解耦

arXiv cs.AI ↗ · 2026-08-14 缓存

本文介绍了双流Transformer,一种通过添加辅助流进行续写预测、同时共享权重和主KV缓存来解耦预填充和解码计算的架构,从而实现分阶段计算分配并提高效率。

0 人收藏 0 人点赞
#inference-efficiency

形状变换专家压缩:LorExperts与BTExperts

arXiv cs.LG ↗ · 2026-08-11 缓存

本文介绍了LorExperts和BTExperts,这两种面向混合专家大语言模型的保留路由器压缩方法,通过聚类专家并将非主导成员表示为低秩修正,相较于D2-MoE等先前方法提升了压缩质量。

0 人收藏 0 人点赞
#inference-efficiency

更少Token,更小缓存:奖励协调的高效推理

arXiv cs.AI ↗ · 2026-08-06 缓存

本文提出ReCo,一种奖励协调的压缩框架,利用过程奖励估计器自适应压缩KV缓存、控制反思Token并启用早停,在保持准确率的同时,将推理模型的生成Token减少37%–65%,延迟降低约2倍。

0 人收藏 0 人点赞
#inference-efficiency

ResKV:重构被省略的注意力贡献以实现固定预算的KV缓存压缩

arXiv cs.CL ↗ · 2026-08-03 缓存

ResKV提出了一种KV缓存压缩方法,将固定预算分为精确的主缓存和紧凑的残差缓存,以重构被省略的注意力贡献,从而在多个骨干网络上提升LongBench和RULER上的性能。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈