LiST:用于鲁棒且校准神经网络的利普希茨缩放训练
摘要
介绍LiST,一种利用利普希茨约束实现鲁棒且校准神经网络的训练范式,在准确率-鲁棒性帕累托前沿上选择最优工作点。在CIFAR和Tiny-ImageNet上展示了具有竞争力的性能。
arXiv:2607.07745v1 公告类型:新
摘要:尽管准确性、鲁棒性和校准性对于可靠的神经网络都至关重要,但它们通常被单独研究;开发同时满足这三者的模型仍然是一个核心挑战。利普希茨约束模型通过设计保证了鲁棒性,然而利普希茨约束L的手动选择决定了最终的准确性-鲁棒性权衡,并且它们的校准特性在很大程度上尚未被探索。在这项工作中,我们强调了施加的利普希茨约束与最先进的校准方法Temperature Scaling之间的理论和经验联系。具体来说,我们发现对于给定的训练方案,存在一个非平凡值L*,使得网络开箱即用即可校准,并且校准可作为在准确性-鲁棒性帕累托前沿上选择明确定义的工作点的原则性标准。利用这些见解,我们引入了利普希茨缩放训练(LiST),这是一种新颖的训练范式,通过迭代调整全局利普希茨常数来达到该工作点。通过训练损失中的边际参数,LiST进一步能够构建完全校准的帕累托前沿,使用户能够在保持校准的同时导航准确性-鲁棒性权衡。在收敛时,LiST还能够将校准数据重新整合到训练中,提高样本效率而不牺牲校准。我们在CIFAR-10/100和Tiny-ImageNet上验证了LiST,展示了针对有约束和无约束基线的具有竞争力的准确性和鲁棒性,同时保持开箱即用的校准。代码可在GitHub上获取。
查看缓存全文
缓存时间: 2026/07/10 06:14
# LiST: 面向稳健且校准神经网络的李普希茨缩放训练 来源:https://arxiv.org/abs/2607.07745 查看 PDF (https://arxiv.org/pdf/2607.07745) > 摘要:虽然准确率、稳健性和校准度对于可靠的神经网络都至关重要,但它们通常被分开研究;开发能够同时满足这三点的模型仍然是一个核心挑战。受李普希茨约束的模型从设计上保证了稳健性,然而,对李普希茨约束 L 的手动选择决定了随之产生的准确率-稳健性权衡,而且这些模型的校准特性在很大程度上尚未被探索。在这项工作中,我们强调了强制施加的李普希茨约束与最先进的校准方法——温度缩放之间在理论和经验上的联系。具体来说,我们发现对于给定的训练方案,存在一个非平凡的值 L*,它能产生一个开箱即用的校准网络,并且校准度可作为在准确率-稳健性帕累托前沿上选择明确定义的操作点的一个原则性标准。利用这些见解,我们引入了李普希茨缩放训练(LiST),这是一种新颖的训练范式,它通过迭代调整全局李普希茨常数来达到这个操作点。通过在训练损失中引入一个间隔参数,LiST 进一步能够构建一个完全校准的帕累托前沿,允许用户在准确率-稳健性之间进行权衡,同时在整个过程中保持校准状态。在收敛时,LiST 还允许将校准数据重新集成到训练中,从而在不牺牲校准度的前提下提升样本效率。我们在 CIFAR-10/100 和 Tiny-ImageNet 上验证了 LiST,结果表明与受约束和不受约束的基线相比,它在保持开箱即用校准状态的同时,具有有竞争力的准确率和稳健性。代码可在 GitHub 上获取。 ## 提交历史 来自:Arthur Chiron [查看邮件 (https://arxiv.org/show-email/7645c942/2607.07745)] [via CCSD proxy] **[v1]** 2026年7月8日星期三 08:34:01 UTC (223 KB)
相似文章
LipSSD:面向对抗鲁棒目标检测的Lipschitz约束单次检测器
介绍LipSSD,一种Lipschitz约束的Single Shot MultiBox Detector(SSD)变体,能够在不依赖特定攻击且与对抗训练互补的情况下提升目标检测的对抗鲁棒性。在Pascal VOC、LARD和KITTI数据集上进行了评估。
自信扩展:针对自适应测试时间缩放的LLM置信度校准
本文提出了C3RL,一种在保持准确性的同时校准LLM置信度的强化学习算法,以及CAS,一种基于置信度的自适应测试时缩放策略,可将推理成本降低多达12.33倍。
超越表面统计:通过内部表示实现LLM鲁棒共形预测
本论文提出了一个利用内部表示而非输出层统计的LLM共形预测框架,引入层级信息(LI)评分作为非一致性度量,在分布偏移下改进有效性-效率权衡。该方法在QA基准上相比文本级基线展现出更强的对校准-部署不匹配的鲁棒性。
神经语言模型的缩放规律
基础性实证研究,展示了语言模型性能与模型规模、数据集大小和计算预算之间的幂律缩放关系,对最优训练资源分配和样本效率有重要启示。
利用LLM扩展闭环特征通道配置
本文将基于LLM的闭环通道配置搜索扩展到每周期250个候选,在CIFAR-100上展示了正向的准确率趋势和参数效率提升,并揭示了LLM生成的通道先验中的架构规律性。