mixed-precision

标签

Cards List
#mixed-precision

MixQuant:大语言模型的自适应混合精度量化

arXiv cs.LG · 4天前 缓存

MixQuant提出了一种针对大语言模型的自适应混合精度量化框架,通过边缘化随机上游配置下的层失真来处理可变内存预算,在多个模型和预算下均优于现有方法。

0 人收藏 0 人点赞
#mixed-precision

面向张量核的算子感知混合精度容差校准

arXiv cs.LG · 2026-07-21 缓存

本文提出了一种算子感知的校准方法,用于张量核正确性测试中的绝对容差校准,利用误差分布数据设定更严格的阈值。该方法在缺陷检测中将召回率绝对提升了9.3%,且误报极少,在gpuemu语料库上得到了验证。

0 人收藏 0 人点赞
#mixed-precision

LaCache: 扩散大语言模型的精确缓存与精度自适应推理

arXiv cs.AI · 2026-07-21 缓存

LaCache 提出了一种针对扩散式LLM的无训练加速框架,利用无损缓存和精度自适应推理消除去噪步骤中的冗余计算,在保持任务精度的同时实现了高达40.2倍的端到端加速。

0 人收藏 0 人点赞
#mixed-precision

饱和使量化误差可加:一种带证书的覆盖模型

arXiv cs.LG · 2026-07-15 缓存

本文分析了混合精度神经网络中量化损失的结构,表明饱和使每层损失可加,并提出了一种覆盖模型,该模型用少量参数预测配置损失,在大规模模型上得到验证。

0 人收藏 0 人点赞
#mixed-precision

KronQ: 基于Kronecker分解Hessian矩阵的大语言模型量化方法

arXiv cs.LG · 2026-07-10 缓存

KronQ是一种后训练量化框架,通过Kronecker分解的海森矩阵近似引入梯度协方差,实现了双向非相干处理和改进的混合精度分配灵敏度度量。即使在LLaMA-3-70B等大模型上进行2比特权重量化,也能实现低困惑度。

0 人收藏 0 人点赞
#mixed-precision

@0xSero:我们找到了一种在 vLLM 中以完整上下文运行 GLM-5.2 且无需剪枝的方法。 - 前 32 个专家使用 NVFP4 - 其余使用 fp3 - intel auto…

X AI KOLs Following · 2026-07-06 缓存

一位社区研究员通过混合量化(NVFP4、NF3、MXFP8),在无需剪枝的情况下,在 vLLM 中运行了 GLM-5.2(753B 参数,全部 256 个专家),可在 4×96GB GPU 上运行,拥有约 307k KV 缓存,精度接近 FP8。

0 人收藏 0 人点赞
#mixed-precision

MODE: 面向MoE多模态大语言模型的模态分解专家级混合精度量化框架

arXiv cs.LG · 2026-06-17 缓存

本文介绍MODE,一种用于MoE多模态大语言模型的模态分解专家级混合精度量化框架,通过按模态分解选择频率并过滤冗余视觉标记来解决专家重要性估计中的偏差,在激进量化下实现极小的性能损失。

0 人收藏 0 人点赞
#mixed-precision

@SpaceTimeViking: 我有一个版本保持BF16注意力层,另一个混合精度量化使用NVFP4权重和FP8 At…

X AI KOLs Following · 2026-06-06 缓存

对Google的Gemma-4-12B-it模型进行混合精度量化,使用NVFP4用于MLP权重,FP8用于注意力层,实现了25%更小的存储占用和更快的吞吐量,同时保持质量。

0 人收藏 0 人点赞
#mixed-precision

dMX: 面向低精度浮点格式的可微分混合精度分配

arXiv cs.LG · 2026-06-04 缓存

dMX 是一个可微分混合精度量化框架,能够为大型语言模型逐层学习最优的浮点位宽分配,目标是由 OCP 标准定义的 MXFP 系列格式。它采用基于温度的退火策略和预算感知的正则化项进行连续优化,在 Llama、Qwen3 和 SmolLM2 模型上始终优于基于 KL 散度的启发式方法。

0 人收藏 0 人点赞
#mixed-precision

通过联合优化架构与量化策略实现 LLM 压缩

arXiv cs.LG · 2026-06-04 缓存

来自 UiT 和奥斯陆大学的研究人员提出了一种可微分 NAS 框架,能够联合优化 LLM 压缩中的架构配置与混合精度量化策略。与先 NAS 后量化的顺序基线方法相比,该框架在七项推理任务中可实现最高 1.4 倍的推理加速,或最高 6% 的精度提升。

0 人收藏 0 人点赞
#mixed-precision

BitsMoE: 基于谱能引导的MoE大语言模型高效量化比特分配

arXiv cs.LG · 2026-06-02 缓存

BitsMoE提出了一种基于谱能引导的比特分配框架,用于量化混合专家大语言模型,在超低位宽量化下实现了显著的精度提升和加速。

0 人收藏 0 人点赞
#mixed-precision

ThriftAttention: 长上下文FP4注意力的选择性混合精度

arXiv cs.LG · 2026-05-25 缓存

ThriftAttention提出了一种选择性混合精度注意力方法,该方法仅对一小部分查询-键块使用FP16计算,其余使用FP4,从而在长上下文推理中实现接近FP16的质量和FP4的效率。

0 人收藏 0 人点赞
#mixed-precision

GEMQ:面向MoE大语言模型的全局专家级混合精度量化方法

arXiv cs.LG · 2026-05-25 缓存

提出GEMQ,一种面向MoE大语言模型的全局专家级混合精度量化方法,利用线性规划和路由器微调来减少内存占用并加速推理,同时将精度损失降至最低。

0 人收藏 0 人点赞
#mixed-precision

CONF-KV: 置信度感知的KV缓存淘汰与混合精度存储用于长视界大语言模型

Hugging Face Daily Papers · 2026-05-24 缓存

CONF-KV 是一种KV缓存管理系统,利用模型不确定性动态调整缓存保留策略,从而提升长上下文大语言模型推理的内存效率,同时将困惑度控制在1.5-2.1个点以内。

0 人收藏 0 人点赞
#mixed-precision

RateQuant:基于率失真理论的优化混合精度KV Cache量化

arXiv cs.LG · 2026-05-11 缓存

本文介绍了 RateQuant,一种用于优化混合精度 KV Cache 量化的方法。该方法利用率失真理论解决失真模型不匹配问题,与 KIVI 和 QuaRot 等现有方法相比,在极低的校准开销下显著降低了困惑度。

0 人收藏 0 人点赞
#mixed-precision

Qwen3.6-27B 各量化格式 KLD 对比:INT 与 NVFP

Reddit r/LocalLLaMA · 2026-04-22

Reddit 帖子对比了 Qwen3.6-27B 的多种量化版本(INT4、NVFP4、BF16-INT4),展示不同场景下内存占用与精度的权衡。

0 人收藏 0 人点赞
#mixed-precision

Bitnet.cpp:面向三值大语言模型的高效边缘推理

Papers with Code Trending · 2025-02-17 缓存

Bitnet.cpp 提出了一个混合精度矩阵乘法库,用于高效边缘推理三值大语言模型(如 BitNet b1.58),相比全精度基线实现了高达 6.25 倍的加速。该系统已在 GitHub 上开源。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈