熵作为结构先验:DiT置信空间上的对数障碍如何驱动音乐多样性与发展

Hugging Face Daily Papers 论文

摘要

本文介绍了Eisbach对数障碍,这是一个从DiT输出空间能量分布的熵中导出的无参数权重,将其应用于Stable Audio 3的LoRA微调时,能够提升音乐多样性与主题发展,而不会导致模式坍缩。

在生成模型中,基于置信度的损失加权通常被避免,因为当模型自信地犯错时它会加速误差,但这种直觉在监督扩散训练中不成立。我们引入了Eisbach对数障碍,这是一个从DiT输出空间能量分布的熵中导出的无参数权重:高熵会抑制梯度,而低熵则保留梯度。将其应用于MusicCaps上Stable Audio 3 Medium的LoRA微调,结果出乎意料地比无加权训练产生了更强的主题发展、更清晰的声学区分和更高的纹理多样性,这与模式坍缩相反。这是因为在监督扩散中,梯度方向被锁定为真实值,因此置信度仅缩放步长;同时,时间上的熵会降低平坦样本的权重,同时保留高对比度的样本。结果是一种在线、自参照的数据课程,它完全从前向传递中涌现出来,并带有分析后的噪声级动态和可测试的预测。
查看原文
查看缓存全文

缓存时间: 2026/06/08 11:15

论文页面 - 熵作为结构先验:DiT置信空间上的对数障碍如何驱动音乐多样性与发展

来源:https://huggingface.co/papers/2606.07207

摘要

通过熵导出的对数障碍实现基于置信度的损失加权,在监督扩散训练中借助自适应梯度缩放改进了音频生成。

在生成模型中通常避免使用基于置信度的损失加权(https://huggingface.co/papers?q=Confidence-based%20loss%20weighting),因为当模型自信地犯错时会加速错误,但这种直觉在监督扩散训练(https://huggingface.co/papers?q=supervised%20diffusion%20training)中并不成立。我们引入了Eisbach对数障碍(https://huggingface.co/papers?q=Eisbach%20log-barrier),这是一种从DiT输出(https://huggingface.co/papers?q=DiT%20output)的空间能量分布(https://huggingface.co/papers?q=spatial%20energy%20distribution)的熵(https://huggingface.co/papers?q=entropy)中导出的无参数权重:高熵抑制梯度,低熵保留梯度。将该方法应用于Stable Audio 3(https://huggingface.co/papers?q=Stable%20Audio%203)Medium在MusicCaps(https://huggingface.co/papers?q=MusicCaps)上的LoRA微调(https://huggingface.co/papers?q=LoRA%20fine-tuning),意外地产生了比未加权训练更强的主题发展、更清晰的声学区分和更高的纹理多样性,这与模式坍缩相反。这是因为在监督扩散中,梯度方向被锁定到真实值,因此置信度仅缩放步长大小;同时,时间熵(https://huggingface.co/papers?q=temporal%20entropy)会降低平坦样本的权重,同时保留高对比度样本。结果是一种在线、自指的数据课程(https://huggingface.co/papers?q=data%20curriculum),纯粹从前向传播(https://huggingface.co/papers?q=forward%20pass)中涌现,并附有经过分析的噪声级动态(https://huggingface.co/papers?q=noise-level%20dynamics)和可检验的预测。

查看arXiv页面(https://arxiv.org/abs/2606.07207) 查看PDF(https://arxiv.org/pdf/2606.07207) 项目页面(https://huggingface.co/ReasoningKingdom/Eisbach-Medium) 添加到收藏集(https://huggingface.co/login?next=%2Fpapers%2F2606.07207)

引用本文的模型0

没有模型链接此论文

在模型README.md中引用arxiv.org/abs/2606.07207以从本页面建立链接。

引用本文的数据集0

没有数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2606.07207以从本页面建立链接。

引用本文的Space0

没有Space链接此论文

在Space README.md中引用arxiv.org/abs/2606.07207以从本页面建立链接。

包含本文的收藏集0

没有包含此论文的收藏集

将本文添加到一个收藏集(https://huggingface.co/new-collection)中以从本页面建立链接。

相似文章

大语言模型何时进行推理?基于熵相变的动力系统视角

arXiv cs.LG

本文探讨了思维链推理在何时对大语言模型有益,表明早期熵动力学能够可靠地指示推理效用,并介绍了EDRM,这是一个轻量级、无需训练的框架,可自适应选择推理策略,在保持或提升准确率的同时显著节省token。

重新审视LLM推理中的均匀信息密度假设

arXiv cs.CL

本文重新审视了LLM推理背景下的均匀信息密度(UID)假设,引入了一个基于熵的框架来量化信息流的均匀性。在七个推理基准上的实验发现,高质量的推理在步骤过渡上表现出局部均匀性,但在轨迹结构上呈现全局非均匀性,这表明LLM推理与人类交流模式存在根本性差异。