标签
本文提出QQWorld,一种分位数-分位数匹配目标,替代LeWorldModel中的Epps-Pulley目标,以更好地正则化潜在分布,提升控制环境中的规划成功率。
提出无偏开放世界正则化(UOWReg),一种仅编码器框架,通过强制条件分布匹配来实现学习表示与敏感属性之间的统计独立性,在降低偏差的同时保持准确率。
解释了SIGReg,一种针对JEPA的新型正则化器,通过迫使嵌入遵循各向同性高斯分布来防止表征坍缩,具有理论保证和简洁的训练循环。
本文引入了一种用于直接对齐算法(DAAs)的正则化技术,该技术保持归一化的响应概率,从而缓解过度优化和似然偏移。该方法提升了生成质量和基准性能,在AlpacaEval2上实现了超过20%的相对提升,并在Llama-3.1-8B-Instruct的通用基准上获得9%的性能增益。
本文介绍了 OrthoGrad,这是一种几何干预,在优化过程中去除权重梯度的径向分量,并表明它在小数据场景下减少了对噪声标签的记忆,但无法防止最终的记忆。
本文发现,在有向图流势恢复中,标准脊正则化由于规范依赖性会导致估计排序崩溃和逆转。我们提出一种规范不变的狄利克雷能量惩罚,可得到参数不敏感的解,并在真实点击流数据上展示了稳健的动态范围保持,对防止图神经网络中的过平滑具有启示意义。
Google Research 表明,扩散模型的创造力是神经网络正则化导致得分平滑和插值的数学结果,揭开了它们能够生成新数据而不仅仅是记忆的能力的神秘面纱。
本文介绍了一种算法无关的方法——反馈操控正则化(FMR),它利用评估性反馈改善模仿学习中的对齐效果,在Safety Gymnasium环境中实现了高达98%的对齐错误减少。
本文提出FedFMX,一种基于Fisher路由的专家混合框架,用于联邦类增量学习,通过自适应专家特化解决容量冲突、灾难性遗忘和数据异质性。
推导了损失Hessian特征谱的Wolkowicz-Styan上界的闭式梯度,以引导神经网络训练朝向平坦极小值,并提出了Hessian谱范围(HSR)正则化。数值实验表明,HSR收窄了Hessian特征值范围,避免了尖锐极小值和鞍点,并实现了与Sharpness-Aware Minimization(SAM)相当的解。
介绍了VISReg,一种用于JEPA(联合嵌入预测架构)训练的正则化方法,它结合了方差(variance)、不变性(invariance)和Sketching约束。
一条推特串,列出了面试官期望候选人了解的13个核心机器学习概念,涵盖从偏差-方差权衡到维度灾难等主题。
本文介绍了LISA,一种正则化方法,它将侧网络的中间特征与近似的似然分数对齐,以提高基于分数的生成模型中视觉条件可控生成的训练效率和质量。
EMAgnet针对大型两人零和游戏中的策略梯度自我博弈引入了参数空间指数移动平均正则化,与均匀正则化目标相比,实现了更低的可利用性。
本文对导数正则化(DREG)惩罚进行了大规模实证研究,表明其在高精度和噪声鲁棒性方面表现优异,特别是使用GELU激活函数和数据稀缺场景,将其定位为神经网络的一种通用即插即用正则化器。
一篇研究论文,将少量人类演示作为正则化目标与自对弈强化学习相结合,从而使用极少的人类数据(30分钟对比数千小时)并在单个消费级GPU上训练15小时,实现与人类兼容的驾驶策略。
本文提出层级语言模型(TLMs),允许单套开源权重模型参数通过密钥控制支持多种能力级别。该方法能在保持公共模型行为并抵御提取的同时,选择性暴露私有能力。
作者发现,对ColBERT模型进行正则化可以修复高效的ANN方法MUVERA和SMVE(这些方法在现代ColBERT模型上出现了问题),并以一种意想不到的方式简化了多向量检索基础设施。
本文为指导在深度学习中合理使用不同的 Schatten-p 范数提供了指南,分析了它们在模型正则化和优化方面的理论特性和实际意义。
本文研究数据受限的语言模型预训练,提出了掩码输入正则化(MIR)以改进验证损失和下游性能,以及SoftQ,一种更好地捕捉重复数据下模型与数据交互的缩放定律。