efficient-inference

标签

Cards List
#efficient-inference

基于稳定几何与发散任务证据的高效长期智能体压缩

arXiv cs.AI ↗ · 2天前 缓存

本文介绍了几何引导的证据保留记忆(GEM),这是一种用于长期智能体的无需训练压缩器,它优先优化任务证据的保留而非几何覆盖,从而在维持性能的前提下降低令牌使用量。

0 人收藏 0 人点赞
#efficient-inference

基于状态空间模型的长上下文示范选择

arXiv cs.LG ↗ · 2026-09-17 缓存

本文提出使用状态空间模型来高效选择用于长上下文语言模型提示的示范,从而降低计算成本并提升性能。

0 人收藏 0 人点赞
#efficient-inference

超越静态RAG:一种用于商品GPU上高效长上下文推理的自适应三元度量路由框架

arXiv cs.LG ↗ · 2026-09-17 缓存

本文提出一种三元度量路由器,这是一种确定性框架,用于推理管道之间的自适应路由,以解决商品GPU上长上下文RAG中的压缩悖论,实现零OOM故障并提升性能。

0 人收藏 0 人点赞
#efficient-inference

DeepSeek-V4.1-Flash:推动KV缓存压缩的极限

Hugging Face Daily Papers ↗ · 2026-09-17 缓存

介绍了DeepSeek-V4.1-Flash,一个多模态混合专家(MoE)模型,拥有552B参数,采用先进的KV缓存压缩技术,以降低部署成本并提升长上下文代理工作负载的效率。

0 人收藏 0 人点赞
#efficient-inference

KV缓存应驻留在何处?面向长期会话的GPU、CPU和SSD放置策略

arXiv cs.AI ↗ · 2026-09-16 缓存

本文研究了跨GPU、CPU和SSD层级的KV缓存放置策略,以优化长期会话的LLM服务。评估了如最近性和重用频率等策略,并针对工作负载给出了迁移和预取的具体建议。

0 人收藏 0 人点赞
#efficient-inference

Edge0/Edge0-35B-A3B-preview

Hugging Face Models Trending ↗ · 2026-09-08 缓存

Edge0-35B-A3B-preview 是一个稀疏的MoE模型,通过流式专家卸载和量化技术,实现移动设备上的高效AI推理,以低于3 GiB的内存达到15 tok/s的性能。

0 人收藏 0 人点赞
#efficient-inference

Random Attention(GitHub 仓库)

TLDR AI ↗ · 2026-09-07 缓存

Random Attention 提出了一种无信号的 KV 缓存驱逐策略,适用于推理模型,在 MATH-500 和 LiveCodeBench 等基准测试中,其性能匹配或超越了学习方法,同时推理速度更快。

0 人收藏 0 人点赞
#efficient-inference

Implementing Embedding Gemma from scratch in PyTorch

Reddit r/ArtificialInteligence ↗ · 2026-09-04 缓存

本文基于YouTube视频,详细介绍了在PyTorch中从零实现Google DeepMind发布的Embedding Gemma高效嵌入模型的方法,涵盖其架构、训练流程及多尺度表示学习。

0 人收藏 0 人点赞
#efficient-inference

三进制语言模型中的能力分层性能退化

arXiv cs.AI ↗ · 2026-09-01 缓存

本文研究分析了三元量化语言模型中的能力分层退化现象。研究表明,尽管事实知识出现显著衰退,但常识推理能力和下游任务适应性仍得以保持,这使得该类模型在高效边缘部署中具有实用价值。

0 人收藏 0 人点赞
#efficient-inference

高效LLM推理的周期步进层跳过严格对照审计:ConfLayers与SWIFT及训练路由替代方案补充分析

arXiv cs.CL ↗ · 2026-09-01 缓存

本文呈现了一项严格对照的审计,比较了用于高效LLM推理的周期步进层跳过方法,如ConfLayers和SWIFT,并分析了训练的路由替代方案,发现SWIFT在准确性和真实推理速度上更优。

0 人收藏 0 人点赞
#efficient-inference

激活离群值重要性:量化多模态LLMs的鲁棒恢复

arXiv cs.LG ↗ · 2026-08-28 缓存

本文将激活量化识别为超低比特量化多模态LLMs中的主要瓶颈,并提出残差回退量化(RFQ)以最小开销恢复性能。

0 人收藏 0 人点赞
#efficient-inference

生存引导的长度控制以实现高效扩散语言模型

arXiv cs.CL ↗ · 2026-08-28 缓存

该论文提出了一种针对扩散语言模型的生存引导长度预测器,在推理和代码生成基准测试中,将推理速度提升高达7倍,而不牺牲准确性。

0 人收藏 0 人点赞
#efficient-inference

GRIP:粒度奖励引导参数插值用于高效推理

arXiv cs.CL ↗ · 2026-08-27 缓存

GRIP提出了一种奖励引导的参数插值框架,通过融合推理与指令模型,在不重新训练的情况下改善大语言模型推理的准确率与效率权衡。

0 人收藏 0 人点赞
#efficient-inference

bitsandbytes 创造者预告新量化方法:单块 DGX Spark 上运行 GLM 5.3,速度 7 tokens/s

Reddit r/LocalLLaMA ↗ · 2026-08-14

bitsandbytes 的创造者 Tim Dettmers 正在预告一种新的量化方法,据报道该方法可以在单块 DGX Spark 上以 7 tokens/s 的速度运行 GLM 5.3,社区对此持谨慎乐观态度。

0 人收藏 0 人点赞
#efficient-inference

FlashDrive:面向自动驾驶的快速视觉-语言-动作推理

arXiv cs.AI ↗ · 2026-08-14 缓存

FlashDrive是一种算法-系统协同设计框架,通过流式KV缓存复用、非自回归扩散草稿和自适应步长缓存,将自动驾驶视觉-语言-动作模型的推理延迟降低4.7倍(在单块GPU上从717毫秒降至151毫秒),且精度损失可忽略不计。

0 人收藏 0 人点赞
#efficient-inference

未见先觉:世界行动模型的潜在未来

arXiv cs.AI ↗ · 2026-08-13 缓存

提出了ForeWAM,一种直接策略世界行动模型,通过隐藏的未来槽KV状态为动作生成提供预测上下文,避免显式未来视频解码,同时在LIBERO基准上实现了高成功率。

0 人收藏 0 人点赞
#efficient-inference

新模型发布:Ling-3.0-tiny:总参数7.9B,每个token仅激活1.3B——免费一周

Reddit r/LocalLLaMA ↗ · 2026-08-06

Ling-3.0-tiny发布:一款混合推理模型,总参数7.9B,每个token仅激活1.3B,免费一周。

0 人收藏 0 人点赞
#efficient-inference

PLAN:面向柔性作业车间调度高效表示学习的并行类液体近似网络

arXiv cs.LG ↗ · 2026-08-05 缓存

本文提出PLAN,一种轻量级并行类液体近似网络,用于柔性作业车间调度中的高效表示学习,与最先进的基线相比,以更少的参数实现了更优的完工时间和更低的推理延迟。

0 人收藏 0 人点赞
#efficient-inference

deepgrove/maple-preview

Hugging Face Models Trending ↗ · 2026-08-04 缓存

DeepGrove 发布了 Maple-Preview,这是一款开源的 20B-A1B 三值权重推理大语言模型,在同类权重规模中推理能力达到最先进水平,在 Mac mini M4 上每秒可生成 200+ tokens,并与更大模型相比具有竞争力。

0 人收藏 0 人点赞
#efficient-inference

nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4

Hugging Face Models Trending ↗ · 2026-08-04 缓存

NVIDIA released Nemotron 3.5 Lightning 30B-A3B-NVFP4, a hybrid MoE LLM with 3B active parameters, up to 1M context, and speculative decoding support for efficient single-GPU inference.

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈