kl-divergence

标签

Cards List
#kl-divergence

ByteShape Qwen 3.8 27B:是否进行KL散度量化,第二部分:指标狂想曲

Reddit r/LocalLLaMA · 18小时前

ByteShape发布了针对Qwen 3.8 27B的ShapeLearn GGUF模型,在基准测试中实现了高精度,并讨论了KLD在量化中的作用,相关论文已被EMNLP 2026接受。

0 人收藏 0 人点赞
#kl-divergence

何时沟通:基于KL散度与信念分布的多智能体强化学习门控机制

arXiv cs.AI · 2026-08-18 缓存

本文提出了一种基于智能体间信念分布KL散度的多智能体强化学习通信门控机制,在捕食者-猎物和MPE等基准测试中展示了性能提升和可解释性。

0 人收藏 0 人点赞
#kl-divergence

Fisher8: Stabilizing Neural Heteroscedastic Regression via Output-Layer Fisher Geometry

arXiv cs.LG · 2026-08-12 缓存

This paper introduces Fisher8, an output-layer gradient correction that uses Fisher geometry instead of Euclidean geometry to stabilize neural heteroscedastic regression, improving uncertainty calibration and likelihood-error tradeoffs.

0 人收藏 0 人点赞
#kl-divergence

我将 Qwen3.6 27B 的 GGUF 量化与 NVFP4、AWQ、AutoRound 和 FP8 进行了对比

Reddit r/LocalLLaMA · 2026-08-10

一项详细基准测试,比较了 Qwen3.6 27B 在 GGUF、NVFP4、AWQ、AutoRound 和 FP8 格式下的 16 种量化,测量与未量化参考的 KL 散度。纯权重的 GGUF 量化通常在质量-大小权衡上表现最佳,而 vLLM 量化则差异显著。

0 人收藏 0 人点赞
#kl-divergence

KLQ: Training-free measured rotation quantization. Beats all training-free rotation-based quantization methods on W4A4KV4-bits. Llama 3.2 1B KLQ-quantized beats SpinQuant and gets close to ReSpinQuant without GPTQ/LDLQ rounding.

Reddit r/LocalLLaMA · 2026-08-09 缓存

KLQ is a training-free LLM quantization method that allocates bits per direction based on measured KL divergence, outperforming existing training-free rotation-based methods on W4A4KV4-bit settings for models like Llama 3.2 1B and Qwen 2.5.

0 人收藏 0 人点赞
#kl-divergence

@rohanpaul_ai:atomic[.]chat 刚刚发布了 DeepSeek V4 Flash 0731 的 14 个压缩量化构建版本。从无损 BF16 到 1 位,GGUF……

X AI KOLs Timeline · 2026-08-04 缓存

atomic.chat 发布了 DeepSeek V4 Flash 0731 的 14 个量化 GGUF 构建版本,从无损 BF16 到 1 位。他们推荐在 128GB 硬件上使用 AD-IQ2_M,该版本在 83.6% 的情况下与原始模型的 token 选择一致。

0 人收藏 0 人点赞
#kl-divergence

我构建了一个工具,在量化前实际测试哪些权重重要,而不是靠猜测(Qwen3.6-27B,三个版本:Bedrock/Tightrope/Gambit)

Reddit r/LocalLLaMA · 2026-07-28

一位开发者构建了一个测试框架,在量化过程中测量每个权重组的 KL 散度,从而生成了 Qwen3.6-27B 的三个定制量化版本(Bedrock、Tightrope、Gambit),实现了优化的压缩。工具调用被确定为量化下最早退化的能力。

0 人收藏 0 人点赞
#kl-divergence

从得分近似到基于得分的扩散模型中的分布近似

arXiv cs.LG · 2026-07-27 缓存

本文建立了神经网络得分函数近似与基于得分的扩散模型中分布近似之间的严格定量联系,证明了准确的得分近似可以导致KL散度下紧密的分布近似,并给出了显式界。

0 人收藏 0 人点赞
#kl-divergence

KL散度:用还是不用?量化分析师的两难之选

Reddit r/LocalLLaMA · 2026-07-16

讨论了在量化分析中使用KL散度的权衡,将其描述为量化分析师面临的哈姆雷特式两难困境。

0 人收藏 0 人点赞
#kl-divergence

@TensorTonic: 7个机器学习工程师每天使用但几乎没人真正推导的数学概念:1. 为什么梯度下降沿着……移动

X AI KOLs Timeline · 2026-07-11 缓存

这条推文列出了机器学习工程师每天使用的7个基础数学概念,并简要强调了这些概念背后的推导过程,例如为什么梯度下降沿着最陡方向移动,以及为什么softmax加交叉熵会产生一个干净的梯度。

0 人收藏 0 人点赞
#kl-divergence

@neural_avb: 这篇文章实际上解释了On Policy Distillation损失函数的所有组成部分(前向与反向KL),等等…

X AI KOLs Timeline · 2026-07-10 缓存

本文解释了On Policy Distillation损失函数的组成部分,包括前向与反向KL散度、监督粒度、特权类型以及特权优势估计。还提供了来自Thinking Machines、Hugging Face等的其他资源。

0 人收藏 0 人点赞
#kl-divergence

$\mathbf{\lambda}$-VAE:后验坍塌的方差均衡

arXiv cs.LG · 2026-07-08 缓存

识别了VAEs中后验坍塌的两个耦合原因,并引入了λ-VAE,这是一种对重新参数化步骤的修改,通过均衡各潜变量维度的方差来减少坍塌并提高信息容量。

0 人收藏 0 人点赞
#kl-divergence

通过非对称互变分学习的多模态连续推理

Hugging Face Daily Papers · 2026-07-01 缓存

提出非对称互变分学习(AMVL),通过双向校准防止答案泄露并提升潜在空间稳定性,解决多模态连续推理中的训练-推理不匹配问题,在BLINK基准测试上取得了显著的性能提升。

0 人收藏 0 人点赞
#kl-divergence

KLip-PPO: 从逐样本KL角度解读PPO-Clip

arXiv cs.LG · 2026-06-24 缓存

本文表明,近端策略优化(PPO)中裁剪替代目标的梯度可以被一个具有可变系数的逐样本KL散度惩罚项精确重现,揭示了裁剪替代目标的结构特性,并提出了新的设计方向。

0 人收藏 0 人点赞
#kl-divergence

量化推理模型自以为需要更长的思考,实则不然

arXiv cs.LG · 2026-06-02 缓存

本文揭示,对推理模型进行激进的训练后量化会导致过度思考错误增加,即模型在中间步骤得出正确答案却未能作为最终答案输出。对过度思考标记施加简单的logit惩罚,可将思维链长度减少12-23%,同时提升准确率,尤其对量化模型效果显著。

0 人收藏 0 人点赞
#kl-divergence

KL Zero: KL散度直觉游戏

Hacker News Top · 2026-05-30 缓存

KL Zero是一款交互式浏览器游戏,玩家在其中绘制概率分布以匹配目标KL散度值,帮助用户直观理解机器学习中KL散度的概念。

0 人收藏 0 人点赞
#kl-divergence

基于熵-KL散度的令牌掩码:一种用于大型语言模型选择性微调的新方法

arXiv cs.AI · 2026-05-29 缓存

提出了 EKSFT,一种面向大型语言模型的选择性微调方法,该方法掩码具有高熵或与参考模型高KL散度的令牌,在注入任务知识的同时保留预训练分布。在数学推理基准上的实验表明,它优于标准SFT,并改进了后续的RL微调。

0 人收藏 0 人点赞
#kl-divergence

信任区域Q伴随匹配

Hugging Face Daily Papers · 2026-05-26 缓存

信任区域Q伴随匹配(TRQAM)通过投影对偶下降自适应控制路径空间KL散度,解决了离线策略强化学习中的不稳定性问题,从而实现对预训练流策略的稳定微调。该方法在50个OGBench任务上持续优于先前方法,在离线强化学习中达到68%的成功率,而最强基线仅为46%。

0 人收藏 0 人点赞
#kl-divergence

同策略蒸馏(5分钟阅读)

TLDR AI · 2026-05-26

本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。

0 人收藏 0 人点赞
#kl-divergence

@maximelabonne: 这真是太棒了!动态微调(DFT)根据模型自身的 token 概率重新加权 SFT 损失,这产生了一个……

X AI KOLs Following · 2026-05-20 缓存

动态微调(DFT)被介绍为一种方法,它利用模型自身的 token 概率重新加权 SFT 损失,形成一个反馈循环,并添加前向KL散度来惩罚那些基础模型认为很可能但策略已将其推向零概率的 token。这条推文对实际应用中的SFT论文表示怀疑,但赞赏这一尝试。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈