标签
本文提出将公平性视为机器学习分类器中的对称操作,通过基于损失的规范化来实现在固定能力特征的同时,交换敏感属性时的不变性。该框架实现了超过90%的偏见减少,且准确率损失极小,无需因果图知识。
本文介绍了后验混合贝叶斯信念(PhyB),这是一个将贝叶斯强化学习中的期望重新表述为动力学模型的凸组合的框架,从而能够实现具有有界目标差异和最新性能的高效正则化离线策略优化。
介绍了TASER,一种从Langevin Stein算子导出的训练时正则化框架,它鼓励预测器与数据密度之间的几何兼容性,提高了CIFAR-10上的对抗鲁棒性和稳定性,而不会显著降低干净准确率。
本文研究了大型语言模型中序列知识编辑的底层机制,表明许多正则化策略是不必要的,并且稳定性源于正确考虑累积的编辑约束而自然产生。
Fern 宣布了一种新的正则化技术,解决了 SolidGoldMagikarp 稳定性问题,详情将在后续帖子中说明。
GPLD为DreamerV3引入了梯度惩罚潜在动力学正则化器,强制转换学习中的局部平滑性,提高了连续控制任务(尤其是复杂运动)的样本效率。
OmniISR提出了一种统一框架,通过在隐藏层引入中间监督与正则化,将集中式学习和联邦学习相结合,提供了理论收敛保证,并将CL-FL差距缩小了22.60%。
这篇博客文章探讨了LoRA与权重衰减的相互作用如何导致与全参微调不同的优化目标,其中权重被正则化到初始模型而不是零。它解释了对实践者的影响。
Sub-JEPA通过在冻结的随机正交子空间中应用高斯正则化来改进LeWorldModel,在基准测试中一致优于原始版本,改进幅度高达+10.7个百分点。
介绍了ChainzRule,一种使用多项式引擎和微分正则化的神经架构,用于平衡准确性、硬件效率和功能稳定性,以15.5倍的参数减少和更平滑的梯度优于标准模型。
本文对联合嵌入预测架构(JEPA)在自然语言到正则表达式任务上的LLM微调进行了审计,测试了二十二个辅助目标。结果表明,隐藏状态表征的改进与解码任务准确率之间仅存在弱耦合,没有辅助目标通过族系校正。
本文通过有限理性决策理论的视角研究学习中的泛化问题,其中学习者的响应规律在训练损失和样本依赖性之间产生权衡。作者表明这种权衡由 f-散度正则化器控制,并且泛化可以从学习者的对冲行为中得到验证。
提出R2R2,一种用于强化学习中自预测学习的正则化方法,以缓解高更新-数据比下的过拟合,在连续控制任务上取得了显著改进。
本文介绍了保持旋转的有监督微调(RPSFT),这是一种通过在微调过程中保持预训练奇异子空间中的投影旋转来提高域外泛化能力的方法。
本文介绍了 FragileFlow,这是一种插件式正则化器,通过频谱分析和 PAC-Bayes 界来控制“正确但脆弱”的预测,从而提高 LLM 和 VLM 的鲁棒性。
本文介绍了 DOSER,这是一种利用扩散模型进行分布外(OOD)检测和选择性正则化的框架,旨在离线强化学习中通过区分有益和有害的 OOD 动作来提升在静态数据集上的表现。
作者提出了 Sub-JEPA,这是一种利用子空间高斯正则化来提高 LeWM 等端到端世界模型稳定性的方法,在连续控制基准测试中表现出一致的性能提升。
本文提出即插即用正则项 OrthoReg,通过在微调阶段强制权重正交,无需额外计算即可提升任务算术与模型融合效果。
本文提出了针对文本分类的对抗训练和虚拟对抗训练方法,通过在RNN中对词嵌入而非原始输入施加扰动来实现。该方法在半监督和监督文本分类基准上取得了最先进的结果,同时降低了过拟合。