噪声标签下神经网络鲁棒训练的损失函数对称化
摘要
本文研究了标签噪声下鲁棒训练的损失函数对称化,提出了SGCE和alpha-MAE两种损失函数,它们在多类无铰链损失和平均绝对误差之间插值,具有理论保证和有竞争力的实证表现。
arXiv:2605.20347v1 公告类型:新
摘要:标注训练集通常成本高昂且容易出错,因此针对标签噪声设计鲁棒的损失函数成为一个重要问题。对称性条件为应对此类噪声提供了理论上的鲁棒性保证。在这项工作中,我们研究了一种对称化方法,该方法源于任何多类损失函数唯一分解为对称分量和类不敏感项。具体而言,对称化交叉熵损失会导致无铰链损失的线性多类扩展。与二分类情况不同,多类版本必须具有特定系数才能满足对称性条件。在适当假设下,我们证明这种多类无铰链损失是唯一的凸多类对称损失函数。我们还证明了它有一个基本的局部作用:任何对称损失在具有相等分量得分向量周围的线性近似等价于多类无铰链损失。然后,我们引入了SGCE和alpha-MAE两种损失函数,它们在多类无铰链损失和平均绝对误差之间插值,同时允许控制损失的β-平滑度。在标准噪声标签基准上的实验表明,与现有鲁棒损失函数相比,这些损失函数具有有竞争力的性能。
查看缓存全文
缓存时间: 2026/05/21 06:23
# 损失函数对称化:面向含噪标签的神经网络鲁棒训练 来源:https://arxiv.org/abs/2605.20347 查看 PDF:https://arxiv.org/pdf/2605.20347 > 摘要:标注训练集往往成本高昂且易出错,因此针对标签噪声设计鲁棒的损失函数成为一个重要问题。对称性条件为此类噪声提供了理论上的鲁棒性保障。本文研究了一种由任意多类损失函数唯一分解为对称分量与类别不敏感项所衍生的对称化方法。特别地,对交叉熵损失进行对称化处理,可得到无铰损失(unhinged loss)的线性多类扩展形式。与二分类情况不同,多类版本需具备特定系数才能满足对称性条件。在适当假设下,我们证明该多类无铰损失是唯一凸的多类对称损失。我们还发现它具有基本的局部作用:在分量相等的得分向量附近,任意对称损失的线性近似均等价于多类无铰损失。随后,我们提出 SGCE 和 alpha-MAE 两种损失函数,它们在多类无铰损失与平均绝对误差(Mean Absolute Error)之间进行插值,同时允许控制损失的 β-光滑性。在标准含噪标签基准上的实验表明,与现有鲁棒损失函数相比,其性能具有竞争力。 ## 提交历史 来自:Alexandre Lemire Paquin \[查看邮箱(https://arxiv.org/show-email/95b3122a/2605.20347)\] **\[v1\]** 2026年5月19日星期二 18:03:40 UTC(90 KB)
相似文章
当标签稀缺时优化如何发挥作用 [R]
Gnosys Labs 推出了一种自主模型工程方法,在标签稀缺的情况下改进分类器,在 ToxicChat 基准测试中优于 GEPA 等标准优化器。
分布偏移下稳定自适应的损失平滑
损失平滑在自适应过程中在源目标和目标目标之间进行插值,在保留有用特征的同时实现专门化。在监督偏移、强化学习和语言模型微调中的实验显示一致的改进。
理解与改进指令微调中的噪声嵌入技术
本文分析了指令微调中的噪声嵌入技术,解释了为何均匀噪声优于高斯噪声,并引入了SymNoise,一种对称噪声方法,在AlpacaEval上将LLaMA-2-7B的性能显著提升至超过NEFTune。
正交梯度约束塑造噪声标签记忆动力学
本文介绍了 OrthoGrad,这是一种几何干预,在优化过程中去除权重梯度的径向分量,并表明它在小数据场景下减少了对噪声标签的记忆,但无法防止最终的记忆。
从几乎一无所有中学习:神经网络如何在重度输入损坏中存活
本文研究了神经网络在超过90%的输入特征被损坏时仍能保持高准确率的现象,并利用平均场方法在高噪声极限下推导出基于质心的决策规则。