熵作为结构先验:DiT置信空间上的对数障碍如何驱动音乐多样性与发展
摘要
本文介绍了Eisbach对数障碍,这是一个从DiT输出空间能量分布的熵中导出的无参数权重,将其应用于Stable Audio 3的LoRA微调时,能够提升音乐多样性与主题发展,而不会导致模式坍缩。
查看缓存全文
缓存时间: 2026/06/08 11:15
论文页面 - 熵作为结构先验:DiT置信空间上的对数障碍如何驱动音乐多样性与发展
来源:https://huggingface.co/papers/2606.07207
摘要
通过熵导出的对数障碍实现基于置信度的损失加权,在监督扩散训练中借助自适应梯度缩放改进了音频生成。
在生成模型中通常避免使用基于置信度的损失加权(https://huggingface.co/papers?q=Confidence-based%20loss%20weighting),因为当模型自信地犯错时会加速错误,但这种直觉在监督扩散训练(https://huggingface.co/papers?q=supervised%20diffusion%20training)中并不成立。我们引入了Eisbach对数障碍(https://huggingface.co/papers?q=Eisbach%20log-barrier),这是一种从DiT输出(https://huggingface.co/papers?q=DiT%20output)的空间能量分布(https://huggingface.co/papers?q=spatial%20energy%20distribution)的熵(https://huggingface.co/papers?q=entropy)中导出的无参数权重:高熵抑制梯度,低熵保留梯度。将该方法应用于Stable Audio 3(https://huggingface.co/papers?q=Stable%20Audio%203)Medium在MusicCaps(https://huggingface.co/papers?q=MusicCaps)上的LoRA微调(https://huggingface.co/papers?q=LoRA%20fine-tuning),意外地产生了比未加权训练更强的主题发展、更清晰的声学区分和更高的纹理多样性,这与模式坍缩相反。这是因为在监督扩散中,梯度方向被锁定到真实值,因此置信度仅缩放步长大小;同时,时间熵(https://huggingface.co/papers?q=temporal%20entropy)会降低平坦样本的权重,同时保留高对比度样本。结果是一种在线、自指的数据课程(https://huggingface.co/papers?q=data%20curriculum),纯粹从前向传播(https://huggingface.co/papers?q=forward%20pass)中涌现,并附有经过分析的噪声级动态(https://huggingface.co/papers?q=noise-level%20dynamics)和可检验的预测。
查看arXiv页面(https://arxiv.org/abs/2606.07207) 查看PDF(https://arxiv.org/pdf/2606.07207) 项目页面(https://huggingface.co/ReasoningKingdom/Eisbach-Medium) 添加到收藏集(https://huggingface.co/login?next=%2Fpapers%2F2606.07207)
引用本文的模型0
没有模型链接此论文
在模型README.md中引用arxiv.org/abs/2606.07207以从本页面建立链接。
引用本文的数据集0
没有数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2606.07207以从本页面建立链接。
引用本文的Space0
没有Space链接此论文
在Space README.md中引用arxiv.org/abs/2606.07207以从本页面建立链接。
包含本文的收藏集0
没有包含此论文的收藏集
将本文添加到一个收藏集(https://huggingface.co/new-collection)中以从本页面建立链接。
相似文章
思维链熵作为可靠性信号:一项预注册复现研究
本预注册复现研究验证了思维链熵轨迹的形状能够预测大语言模型的答案正确性,而总熵下降在不同设置下不一致,并探索了最终步骤熵作为改进指标。
驾驭思考者:用于自适应LLM推理的条件熵塑造
本文介绍了条件熵塑造(CES)框架,该框架动态控制LLM中令牌级别的响应熵,以平衡推理深度和简洁性,在数学基准测试上实现更高的准确率同时缩短响应长度。
大语言模型何时进行推理?基于熵相变的动力系统视角
本文探讨了思维链推理在何时对大语言模型有益,表明早期熵动力学能够可靠地指示推理效用,并介绍了EDRM,这是一个轻量级、无需训练的框架,可自适应选择推理策略,在保持或提升准确率的同时显著节省token。
打破自回归诅咒:动态认知熵编排的可擦除强化学习用于LLMs
本文提出E³RL,一种使用动态认知熵阈值的强化学习方法,使LLMs能够在生成过程中切除局部逻辑缺陷,克服长程推理中的自回归诅咒,并在AIME等数学推理基准上取得最先进的结果。
重新审视LLM推理中的均匀信息密度假设
本文重新审视了LLM推理背景下的均匀信息密度(UID)假设,引入了一个基于熵的框架来量化信息流的均匀性。在七个推理基准上的实验发现,高质量的推理在步骤过渡上表现出局部均匀性,但在轨迹结构上呈现全局非均匀性,这表明LLM推理与人类交流模式存在根本性差异。