efficient-inference

标签

Cards List
#efficient-inference

新模型发布:Ling-3.0-tiny:总参数7.9B,每个token仅激活1.3B——免费一周

Reddit r/LocalLLaMA · 3天前

Ling-3.0-tiny发布:一款混合推理模型,总参数7.9B,每个token仅激活1.3B,免费一周。

0 人收藏 0 人点赞
#efficient-inference

PLAN:面向柔性作业车间调度高效表示学习的并行类液体近似网络

arXiv cs.LG · 5天前 缓存

本文提出PLAN,一种轻量级并行类液体近似网络,用于柔性作业车间调度中的高效表示学习,与最先进的基线相比,以更少的参数实现了更优的完工时间和更低的推理延迟。

0 人收藏 0 人点赞
#efficient-inference

deepgrove/maple-preview

Hugging Face Models Trending · 5天前 缓存

DeepGrove 发布了 Maple-Preview,这是一款开源的 20B-A1B 三值权重推理大语言模型,在同类权重规模中推理能力达到最先进水平,在 Mac mini M4 上每秒可生成 200+ tokens,并与更大模型相比具有竞争力。

0 人收藏 0 人点赞
#efficient-inference

inclusionAI/Ling-3.0-flash · Hugging Face

Reddit r/LocalLLaMA · 6天前 缓存

inclusionAI 发布了 Ling-3.0-flash,一款原生混合推理模型,总参数量124B,激活参数量5.1B,采用混合线性注意力架构(KDA+MLA)与稀疏MoE。其性能与上一代1T级模型 Ring-2.6-1T 相当或更优,同时计算效率大幅提升,并内置智能体与长上下文优化。

0 人收藏 0 人点赞
#efficient-inference

SeDeM:面向长上下文问答的隐状态记忆选择性解压缩

arXiv cs.CL · 6天前 缓存

SeDeM 是一种选择性解压缩框架,它将长上下文的隐状态存储在紧凑的记忆库中,并且仅解压缩与查询相关的块以用于解码器条件化,从而在压缩基线之上提高了问答准确率和效率。

0 人收藏 0 人点赞
#efficient-inference

AFM3 20B 的特殊架构:指令跟随剪枝

Reddit r/LocalLLaMA · 6天前

讨论了苹果的 AFM3 20B 模型架构,该架构使用指令跟随剪枝(Instruction-Following Pruning),每个提示仅激活约 20% 的 MLP 层,并将模型存储在闪存中,以实现高效的设备端推理。

0 人收藏 0 人点赞
#efficient-inference

更优、更强、更快、更广:面向基于MLLM分割的结构化全掩码预测

Hugging Face Daily Papers · 2026-08-03 缓存

本文介绍了结构化全掩码预测(Structured All-Mask Prediction)及STAMPlus方法,这是一种基于MLLM的分割方法,通过一次非自回归过程联合预测所有目标掩码,解决了高分割性能、保持对话能力与快速推理之间的三难问题。

0 人收藏 0 人点赞
#efficient-inference

[论文] EdgeRazor:一种基于混合精度量化感知蒸馏的大语言模型轻量级框架

Reddit r/LocalLLaMA · 2026-08-02

EdgeRazor 是一个轻量级框架,用于通过熵引导的混合精度量化感知蒸馏来压缩大语言模型,实现每参数 1.88 比特,同时保持教师模型的能力,且无需更改 llama.cpp 等推理实现。该方法在 MobileLLM 和 Qwen 变体等小型模型上进行了演示。

0 人收藏 0 人点赞
#efficient-inference

理解在早期完成:大型语言模型中的深度分工及其用于无界上下文记忆

arXiv cs.CL · 2026-07-31 缓存

本文介绍了CoMem,一种利用LLM中深度方向分工的方法,它缓存中间残差张量,并且仅重新计算上层以进行检索,从而实现有界的读取计算和内存,与存储的上下文长度无关。在Qwen3-8B上评估,CoMem在长上下文任务上取得了强劲性能,同时显著节省内存并加速预填充。

0 人收藏 0 人点赞
#efficient-inference

先召回再排序:基于相似性引导的 Top-$K$ 复用于高效长上下文注意力

arXiv cs.CL · 2026-07-31 缓存

ReTopK 是一种无需训练的方法,通过复用历史查询-支持对来加速长上下文大语言模型中的动态 Top-K 稀疏注意力,从而避免全上下文评分和全局 Top-K 选择。在 128K 上下文下,相比精确 Top-K,它实现了最高 3.07 倍的加速,且困惑度仅增加 0.50%。

0 人收藏 0 人点赞
#efficient-inference

面向AI智能体的长上下文窗口可寻址召回压缩

arXiv cs.AI · 2026-07-29 缓存

ARC通过将仅追加存储与有界引用视图分离,提高了长上下文AI智能体的检索效率和准确率,实现了近乎完美的召回率,同时降低了延迟和带宽消耗。

0 人收藏 0 人点赞
#efficient-inference

GLIDE: 引导的逐层混合注意力实现高效LLM推理

arXiv cs.AI · 2026-07-29 缓存

GLIDE 引入一种逐层自适应机制,策略性地整合滑动窗口 softmax 注意力和线性循环聚合,实现高效 LLM 推理,在处理长上下文时减少 KV 缓存 I/O 和延迟,同时不牺牲质量。

0 人收藏 0 人点赞
#efficient-inference

SpecPrefetch:面向稀疏MoE基础模型的参数高效专家预取

arXiv cs.AI · 2026-07-29 缓存

SpecPrefetch提出了一种面向稀疏MoE模型的参数高效专家预取框架,使用轻量级适配器预测下一层专家以进行异步传输,同时保留原生路由语义。在Snapdragon 8 Elite设备上,它实现了高达20%的解码吞吐量提升,展示了在内存受限部署中的实用优势。

0 人收藏 0 人点赞
#efficient-inference

TurboVLA:在RTX 4090上以32 Hz运行且显存占用小于1 GB的实时视觉-语言-动作模型

Hugging Face Daily Papers · 2026-07-29 缓存

TurboVLA提出了一种新的视觉-语言-动作范式,直接将视觉和语言映射到动作,在LIBERO上仅用0.2B参数就达到了97.7%的成功率,并在消费级GPU上以32 Hz实现实时推理,显著降低了计算成本。

0 人收藏 0 人点赞
#efficient-inference

LiquidAI/LFM2.5-2.6B

Hugging Face Models Trending · 2026-07-28 缓存

Liquid AI released LFM2.5-2.6B, a 2.6B-parameter hybrid model optimized for on-device deployment with 128K context, agentic post-training, and fast inference (220 tok/s on Apple M5 Max) under 2.5GB memory.

0 人收藏 0 人点赞
#efficient-inference

Neutrino-1 8B

Hacker News Top · 2026-07-28 缓存

Neutrino-1 8B是一个拥有8.19B参数、采用专有三值权重格式的Transformer模型,使其能够部署在8GB显存的GPU上,并从一个仅3.88GB的模型文件中以高解码速度服务多个平台。

0 人收藏 0 人点赞
#efficient-inference

Show HN:单个46GB GPU上的600万token可移动窗口

Hacker News Top · 2026-07-28 缓存

本文介绍了一个冻结的12B模型,该模型利用已验证解决方案的持久内存,在已解决问题族上以零生成token实现100%准确率,并在单个46GB GPU上展示了600万token的可移动窗口。

0 人收藏 0 人点赞
#efficient-inference

通过SFT和DPO学习Text-to-SQL的推理时机

arXiv cs.CL · 2026-07-28 缓存

提出了AutoThinkSQL,一个将自动思考机制集成到Text-to-SQL的SFT和DPO中的框架,使模型能够动态跳过简单查询的推理,并对复杂查询调用深度CoT,在Spider和BIRD基准测试上取得提升,同时将输出token减少24.6%,延迟减少17.1%。

0 人收藏 0 人点赞
#efficient-inference

CausalGate: 因果重要性蒸馏用于Transformer模块剪枝

arXiv cs.LG · 2026-07-28 缓存

CausalGate引入了一种方法,通过因果干预测量Transformer子层的重要性,并将其蒸馏为静态标量门控,实现高效推理且无运行时开销,优于现有的剪枝和路由方法。

0 人收藏 0 人点赞
#efficient-inference

冻结的12B模型在已验证任务上超越前沿模型:100%准确率、零Token、精确比特、永久有效

Hugging Face Daily Papers · 2026-07-26 缓存

一个冻结的120亿参数模型,结合了已验证解决方案的持久记忆,在九个问题家族超过180个实例上实现了100%准确率,使用零生成token,精确比特的确定性输出,在已解决任务上超越前沿模型,且计算消耗可忽略不计。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈