标签
本文介绍了几何引导的证据保留记忆(GEM),这是一种用于长期智能体的无需训练压缩器,它优先优化任务证据的保留而非几何覆盖,从而在维持性能的前提下降低令牌使用量。
本文提出一种三元度量路由器,这是一种确定性框架,用于推理管道之间的自适应路由,以解决商品GPU上长上下文RAG中的压缩悖论,实现零OOM故障并提升性能。
介绍了DeepSeek-V4.1-Flash,一个多模态混合专家(MoE)模型,拥有552B参数,采用先进的KV缓存压缩技术,以降低部署成本并提升长上下文代理工作负载的效率。
本文研究了跨GPU、CPU和SSD层级的KV缓存放置策略,以优化长期会话的LLM服务。评估了如最近性和重用频率等策略,并针对工作负载给出了迁移和预取的具体建议。
Edge0-35B-A3B-preview 是一个稀疏的MoE模型,通过流式专家卸载和量化技术,实现移动设备上的高效AI推理,以低于3 GiB的内存达到15 tok/s的性能。
Random Attention 提出了一种无信号的 KV 缓存驱逐策略,适用于推理模型,在 MATH-500 和 LiveCodeBench 等基准测试中,其性能匹配或超越了学习方法,同时推理速度更快。
本文基于YouTube视频,详细介绍了在PyTorch中从零实现Google DeepMind发布的Embedding Gemma高效嵌入模型的方法,涵盖其架构、训练流程及多尺度表示学习。
本文研究分析了三元量化语言模型中的能力分层退化现象。研究表明,尽管事实知识出现显著衰退,但常识推理能力和下游任务适应性仍得以保持,这使得该类模型在高效边缘部署中具有实用价值。
本文呈现了一项严格对照的审计,比较了用于高效LLM推理的周期步进层跳过方法,如ConfLayers和SWIFT,并分析了训练的路由替代方案,发现SWIFT在准确性和真实推理速度上更优。
本文将激活量化识别为超低比特量化多模态LLMs中的主要瓶颈,并提出残差回退量化(RFQ)以最小开销恢复性能。
该论文提出了一种针对扩散语言模型的生存引导长度预测器,在推理和代码生成基准测试中,将推理速度提升高达7倍,而不牺牲准确性。
GRIP提出了一种奖励引导的参数插值框架,通过融合推理与指令模型,在不重新训练的情况下改善大语言模型推理的准确率与效率权衡。
bitsandbytes 的创造者 Tim Dettmers 正在预告一种新的量化方法,据报道该方法可以在单块 DGX Spark 上以 7 tokens/s 的速度运行 GLM 5.3,社区对此持谨慎乐观态度。
FlashDrive是一种算法-系统协同设计框架,通过流式KV缓存复用、非自回归扩散草稿和自适应步长缓存,将自动驾驶视觉-语言-动作模型的推理延迟降低4.7倍(在单块GPU上从717毫秒降至151毫秒),且精度损失可忽略不计。
提出了ForeWAM,一种直接策略世界行动模型,通过隐藏的未来槽KV状态为动作生成提供预测上下文,避免显式未来视频解码,同时在LIBERO基准上实现了高成功率。
Ling-3.0-tiny发布:一款混合推理模型,总参数7.9B,每个token仅激活1.3B,免费一周。
本文提出PLAN,一种轻量级并行类液体近似网络,用于柔性作业车间调度中的高效表示学习,与最先进的基线相比,以更少的参数实现了更优的完工时间和更低的推理延迟。
DeepGrove 发布了 Maple-Preview,这是一款开源的 20B-A1B 三值权重推理大语言模型,在同类权重规模中推理能力达到最先进水平,在 Mac mini M4 上每秒可生成 200+ tokens,并与更大模型相比具有竞争力。
NVIDIA released Nemotron 3.5 Lightning 30B-A3B-NVFP4, a hybrid MoE LLM with 3B active parameters, up to 1M context, and speculative decoding support for efficient single-GPU inference.