efficient-inference

标签

Cards List
#efficient-inference

分层稀疏注意力机制的正确实现:迈向无限上下文建模

arXiv cs.CL · 2026-07-07 缓存

提出HiLS注意力机制,一种基于块的稀疏注意力方法,通过语言模型损失端到端学习块选择,性能可与全注意力媲美,同时支持超长上下文外推和更快的推理速度。

0 人收藏 0 人点赞
#efficient-inference

prism-ml/Bonsai-27B-gguf

Hugging Face Models Trending · 2026-07-04 缓存

Prism ML 发布了 Bonsai-27B-gguf,这是一个拥有 270 亿参数的语言模型,采用二进制(1.125 位)权重,实现了约 14 倍的尺寸缩减,同时保留了约 90% 的 FP16 推理性能。它可以在消费级硬件上运行,并具有高吞吐量。

0 人收藏 0 人点赞
#efficient-inference

残差上下文扩散语言模型(2分钟阅读)

TLDR AI · 2026-07-03 缓存

本文介绍了残差上下文扩散(RCD)模块,该模块通过回收扩散语言模型中丢弃的令牌表示来提高效率和准确性,在具有挑战性的推理任务上实现了5–10%的准确性提升,并将去噪步骤减少了多达4–5倍。

0 人收藏 0 人点赞
#efficient-inference

MosaicKV:使用动态二维KV缓存压缩服务长上下文LLM

arXiv cs.LG · 2026-07-02 缓存

MosaicKV引入了用于长上下文LLM服务的动态二维KV缓存压缩,实现了高达16倍的注意力加速和3倍的内存减少,且精度损失极小。

0 人收藏 0 人点赞
#efficient-inference

OrbitQuant:面向图像与视频扩散Transformer的数据无关量化方法

Hugging Face Daily Papers · 2026-07-02 缓存

OrbitQuant提出了一种数据无关的扩散Transformer量化方法,消除了跨时间步和模态进行重新校准的需求,在FLUX.1和CogVideoX等模型的低位宽设置下实现了最先进的后训练量化水平。

0 人收藏 0 人点赞
#efficient-inference

Nemotron-3-Super-120B-A12B(混合Mamba+MoE)在4×3090上实现504K token的完美针检索

Reddit r/LocalLLaMA · 2026-06-26

英伟达的Nemotron-3-Super-120B-A12B,一种混合Mamba和混合专家模型,仅使用四块RTX 3090 GPU就实现了在504K token下的完美大海捞针检索。

0 人收藏 0 人点赞
#efficient-inference

通过Gist Tokens的简化稀疏注意力

Hugging Face Daily Papers · 2026-06-26 缓存

本文介绍了简化稀疏注意力(SSA),一种在持续预训练中使用Gist令牌的方法,能够在推理时无需架构更改即可实现高效的分块选择,取得了高压缩比,并在LongBench和检索增强生成等长上下文任务上优于基线。

0 人收藏 0 人点赞
#efficient-inference

Liquid AI 发布 Liquid Foundation Models 2.5 230M(3分钟阅读)

TLDR AI · 2026-06-26 缓存

Liquid AI 发布 LFM2.5-230M,这是一款轻量级基础模型,可在从云端 GPU 到 CPU 乃至 Raspberry Pi 的设备上运行,在工具使用和数据提取任务上表现出色。

0 人收藏 0 人点赞
#efficient-inference

BitNet 文本嵌入

arXiv cs.CL · 2026-06-25 缓存

本文介绍了 BitEmbed,一个用于基于 LLM 的文本嵌入的极低位宽框架,它将预训练的 LLM 骨干转换为具有三值权重和量化激活的 BitNet 风格编码器。该框架在显著降低编码和存储成本的同时,实现了与全精度模型相当的性能。

0 人收藏 0 人点赞
#efficient-inference

nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4

Hugging Face Models Trending · 2026-06-24 缓存

NVIDIA 发布了 Nemotron-Labs-3-Puzzle-75B-A9B,它是 Nemotron-3-Super 的压缩版本,推理效率更高,基准测试性能强劲。

0 人收藏 0 人点赞
#efficient-inference

我绘制了Qwen3.6-35B-A3B和Gemma4-E2B QAT模型的KV缓存量化的KL散度图

Reddit r/LocalLLaMA · 2026-06-23

作者绘制了Qwen3.6-35B-A3B和Gemma4-E2B QAT模型的KV缓存量化的KL散度图。

0 人收藏 0 人点赞
#efficient-inference

@onchainmilady: ANTHROPIC试图封禁他的GITHUB 中国开发者发布70B参数大语言模型,在Github上获得2万颗星,并面临大型AI公司的诉讼

X AI KOLs Timeline · 2026-06-19 缓存

一位中国开发者发布了一个70B参数的大语言模型,该模型通过扁平内存和逐层加载,能够在极低硬件(4GB GPU)上本地运行,可能替代昂贵的订阅服务。

0 人收藏 0 人点赞
#efficient-inference

PerceptionDLM: 基于多模态扩散语言模型的并行区域感知

Hugging Face Daily Papers · 2026-06-17 缓存

PerceptionDLM 提出了一种多模态扩散语言模型,通过结构化注意力掩码和高效提示实现并行区域感知,在不牺牲字幕质量的情况下实现更快的推理。实验表明,在多区域感知任务中,性能具有竞争力且速度大幅提升。

0 人收藏 0 人点赞
#efficient-inference

ImageWAM:世界动作模型真的需要视频生成,还是只需要图像编辑?

Hugging Face Daily Papers · 2026-06-17 缓存

ImageWAM 提出在世界动作模型中用预训练图像编辑模型替代视频生成用于机器人控制,在将计算量降至视频方法的 1/6、延迟降至 1/4 的同时实现了更优性能。

0 人收藏 0 人点赞
#efficient-inference

@AdinaYakup: GLM 5.2 来了 753B (比你想象的要小?) 1M上下文 MIT许可证 GLM IndexShare: 跨层复用索引器…

X AI KOLs Following · 2026-06-16 缓存

GLM 5.2 作为一款753B参数的开源模型发布,拥有1M上下文长度,MIT许可证,在AIME 2026上达到99.2分,超越了GPT-5.5、Gemini 3.1 Pro和Claude Opus 4.8。

0 人收藏 0 人点赞
#efficient-inference

强制延迟:在多模态LLM级联中操纵路由决策

arXiv cs.AI · 2026-06-16 缓存

本文介绍了强制延迟攻击(FDA),一种对抗性图像攻击,通过操纵多模态LLM级联中的置信度分数,导致查询不必要地路由到更强(更昂贵)的模型,从而在不降低答案正确性的情况下将计算成本转移给提供商。

0 人收藏 0 人点赞
#efficient-inference

利用移动NPU的高效端侧扩散大语言模型推理

arXiv cs.LG · 2026-06-15 缓存

本文提出了llada.cpp,一种NPU感知推理框架,用于在智能手机上加速扩散大语言模型(dLLM)。它引入了三种技术——Multi-Block Speculative Decoding、Dual-Path Progressive Revision和Swap-Optimized Memory Runtime——以使dLLM推理与移动NPU特性对齐,实现了相比CPU基线17-42倍的延迟降低。

0 人收藏 0 人点赞
#efficient-inference

SP^3: 用于即插即用恢复的球面先验

Hugging Face Daily Papers · 2026-06-15 缓存

本文介绍SP³,一种使用球面编码器先验的即插即用图像恢复方法,在各项任务中实现与零样本扩散先验相当的感知质量,同时速度快3-630倍。

0 人收藏 0 人点赞
#efficient-inference

@Tono_Ken3: 我注意到可能有另一个人也意识到,在实际工作中 gemma-4-12b 能够与 qwen3.6-35b 相媲美。是的……

X AI KOLs Timeline · 2026-06-14 缓存

一条推文指出,经过 abliterated 处理、NVFP4 量化的 Gemma-4-12B 模型(7.7 GB)在实际任务中能够与 Qwen 3.6-35B 相媲美,同时在 Blackwell GPU 上运行快速,展现了显著的效率提升。

0 人收藏 0 人点赞
#efficient-inference

@TeksEdge: 随着MiniMax M3开源发布,以下是关于量化版本和模型大小的预期,包括所需VRAM:MiniMax M3 (428…

X AI KOLs Following · 2026-06-12 缓存

MiniMax M3是一款428B参数的MoE模型,活跃参数约23B,现已开源。它支持超长上下文(最高达1M)并提升了效率,提供了多种量化尺寸以及本地部署所需的VRAM要求。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈