efficient-inference

标签

Cards List
#efficient-inference

@Chinazhidx:蚂蚁集团刚刚发布了Ling-3.0-flash • 124B MoE • 5.1B 活跃参数/令牌 • 256K 上下文,可扩展至1M,仅八分之一……

X AI KOLs Timeline · 2026-07-24 缓存

蚂蚁集团发布了Ling-3.0-flash,这是一个124B MoE模型,每个令牌5.1B活跃参数,256K上下文可扩展至1M,在大多数基准测试中匹配或超越其1T旗舰模型。

0 人收藏 0 人点赞
#efficient-inference

@rohanpaul_ai: 该论文提出利用编码代理自身的内部表示来去除无关的工具输出行,无需...

X AI KOLs Following · 2026-07-22 缓存

该论文提出了SWE-Pruner Pro,它利用编码代理自身的内部表示来剪枝无关的工具输出行,无需单独的剪枝模型即可将令牌使用量减少高达39%。

0 人收藏 0 人点赞
#efficient-inference

当困惑度误导时:面向生成的混合序列模型蒸馏

arXiv cs.CL · 2026-07-20 缓存

本文研究了蒸馏混合序列模型中对数似然与基于生成的评估之间的差异,表明仅凭困惑度可能具有误导性。本文介绍了GenDistill,一个将Transformer蒸馏为Hybrid-KDA模型的流水线,实现了高达75%的KV缓存减少和2-4倍的首次令牌生成时间加速,同时保留了教师模型86-90%的准确率。

0 人收藏 0 人点赞
#efficient-inference

Looped Latent Attention: Cross-Loop KV Compression for Looped Transformers

arXiv cs.LG · 2026-07-20 缓存

提出循环隐注意力(LLA),一种训练后编解码器,通过利用递归步骤间的低秩结构压缩循环变压器中的KV缓存,在保持性能的同时实现显著压缩比。

0 人收藏 0 人点赞
#efficient-inference

openbmb/MiniCPM-RobotManip

Hugging Face Models Trending · 2026-07-18 缓存

OpenBMB发布了MiniCPM-RobotManip,这是一个1.5B参数的视觉-语言-动作模型,用于设备端机器人操控,通过高效的流式推理和长时视觉记忆,性能超越较大模型。

0 人收藏 0 人点赞
#efficient-inference

我构建了一种新的注意力机制(Wave Field)——可在标准注意力机制内存溢出的128K上下文环境下运行,笔记本CPU上实现80+ tok/s

Reddit r/LocalLLaMA · 2026-07-15

一位独立研究员引入了Wave Field注意力机制,用FFT波卷积替代了标准O(N²)点积注意力,实现了O(N log N)的训练效率和每token O(1)的推理效率。声称在128K上下文的CPU上达到80+ tok/s,并且在零样本性能上优于GPT-2 124M。

0 人收藏 0 人点赞
#efficient-inference

LiteTopK:利用维度灾难实现长上下文稀疏注意力中的融合索引器-TopK核

arXiv cs.LG · 2026-07-15 缓存

LiteTopK是一种用于长上下文稀疏注意力的融合索引器-top-k核,它利用维度灾难来减少内存流量并提高效率,在预填充阶段将GLM 5.2加速1.2倍。

0 人收藏 0 人点赞
#efficient-inference

GigaWorld-Policy-0.5:由AutoResearch赋能的更快更强的WAM

Hugging Face Daily Papers · 2026-07-15 缓存

GigaWorld-Policy-0.5 是一个用于机器人控制的增强版世界动作模型(WAM),通过混合动作条件世界建模(AC-WM)策略和混合变换器(Mixture-of-Transformers)架构提升训练与推理效率,在本地 RTX 4090 上实现 85 毫秒延迟。

0 人收藏 0 人点赞
#efficient-inference

Bonsai 27B(1位LLM):首个能在手机上运行的27B级别模型

Hacker News Top · 2026-07-14 缓存

PrismML宣布推出Bonsai 27B,这是Qwen3.6 27B的1位与三元量化版本,可在手机和笔记本电脑上运行,保留基线性能的90-95%,占用3.9GB空间,支持自主智能体与多模态的端侧AI。

0 人收藏 0 人点赞
#efficient-inference

Prism-ML Bonsai Qwen 3.6 27B

Reddit r/LocalLLaMA · 2026-07-14 缓存

Prism ML 发布了 Ternary-Bonsai-27B,这是 Qwen3.6-27B 的三元量化版本,在约 7.2 GB 的占用下保留了 FP16 智能的 95%,能够在笔记本电脑和单 GPU 上实现完整的 27B 级推理,在 Apple M5 Pro 上速度可达 26 tok/s。

0 人收藏 0 人点赞
#efficient-inference

@0x0SojalSec: 最终观点:腾讯最近发布了一个295B参数的模型,每个token仅激活21B参数。而大多数实验室仍在……

X AI KOLs Timeline · 2026-07-13 缓存

腾讯发布了Hy3,一个295B参数的MoE模型,每个token激活21B参数,在代理编程和工具使用任务上与更大的模型相竞争,并提供了Apache 2.0权重。

0 人收藏 0 人点赞
#efficient-inference

利用适度非结构化稀疏权重矩阵加速大语言模型的GPU推理

arXiv cs.LG · 2026-07-13 缓存

本文提出了一种针对具有适度非结构化稀疏性的大语言模型的高效GPU推理方法。引入了一种三层矩阵存储格式和一个联合利用稀疏张量核心与CUDA核心的SpMM内核,实现了相比SpInfer最高1.64倍的内核级加速,以及相比FlashLLM最高1.41倍的端到端加速。

0 人收藏 0 人点赞
#efficient-inference

@danveloper: 现在大家都这么做

X AI KOLs Timeline · 2026-07-12 缓存

Zane Chen 演示了 Colibri,它使用纯 C 语言和仅 CPU 推理,通过从磁盘流式传输专家,在配备 25GB 内存的笔记本电脑上运行 GLM-5.2 (744B MoE)。

0 人收藏 0 人点赞
#efficient-inference

@VukRosic99: 长上下文Transformer面临两大瓶颈:二次注意力计算和KV缓存(在1M tokens时可达数百GB)…

X AI KOLs Timeline · 2026-07-11 缓存

MiniCPM-SALA是一款9B参数的混合注意力模型,通过在稀疏注意力和线性注意力之间交替插入(每3个线性层插入1个稀疏层)来克服长上下文Transformer的二次计算和KV缓存瓶颈。在256K tokens下,其推理速度比Qwen3-8B快3.5倍,并能在消费级GPU上支持高达1M tokens。该模型采用经济高效的持续训练方法,训练成本降低约75%。

0 人收藏 0 人点赞
#efficient-inference

tencent/HiLS-Attention-7B · Hugging Face

Reddit r/LocalLLaMA · 2026-07-10 缓存

腾讯发布了HiLS-Attention-7B,一个70亿参数的模型,采用新颖的块状稀疏注意力机制,端到端地学习块选择,从而实现高效的长上下文建模,并能在超过4倍训练长度的场景下进行强大的外推。

0 人收藏 0 人点赞
#efficient-inference

保留什么,遗忘什么:大语言模型与智能体中内存压缩的率失真视角

arXiv cs.LG · 2026-07-10 缓存

本文在率失真框架下统一了大语言模型和智能体中的内存压缩技术,提出了一个用于评估不同层压缩的分类法和基准。

0 人收藏 0 人点赞
#efficient-inference

SQuaD-SQL: 利用LLM引导的知识蒸馏实现小型语言模型的高效文本到SQL

arXiv cs.CL · 2026-07-10 缓存

SQuaD-SQL使用LLM引导的知识蒸馏训练小型语言模型进行Text-to-SQL,在WikiSQL上达到86.9%的执行准确率,同时提供更快的推理速度和更低的内存占用。

0 人收藏 0 人点赞
#efficient-inference

Dynamic-in-Few-Step: 统一动态计算与少步蒸馏的高效视频生成

arXiv cs.AI · 2026-07-09 缓存

本文提出了一种针对视频扩散模型的后训练加速框架,将动态结构稀疏化与少步蒸馏相结合,在保持生成质量的同时实现了显著加速。

0 人收藏 0 人点赞
#efficient-inference

Jet-Long: 高效长上下文扩展与动态双焦点RoPE

Hugging Face Daily Papers · 2026-07-08 缓存

介绍了Jet-Long,一种用于长上下文扩展的零样本方法,该方法动态调整重缩放因子并使用双焦点注意力机制,无需重新训练即可在不同序列长度上实现高效高性能处理。

0 人收藏 0 人点赞
#efficient-inference

可变位宽量化:为“更大但更小”的语言模型学习每组的精度

arXiv cs.LG · 2026-07-07 缓存

介绍了可变位宽量化(VBQ),一种训练时的方法,其中每组64个权重通过Gumbel-Softmax松弛学习自己的位宽(1、2、4、8)。VBQ发现了一种异构分配,实现了“更大但更小”的机制,例如,平均位宽1.82的1.31亿参数模型在TinyStories上的困惑度为4.2,击败了5500万FP16模型(困惑度4.4),同时存储减少3.8倍;而1.46B模型在FineWeb-Edu上与593M FP16控制模型表现相当,存储减少约3.7倍。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈