标签
SkillEvoReg引入了一个正则化框架,以防止语言模型代理的技能演化中的过拟合,结合了dropout、局部正则化和因果验证,以在控制技能增长的同时保持性能。
FuseReg是一种用于表示自编码器的正则化方法,通过在训练过程中使用随机层子集采样来缓解重建-生成差距,从而提高生成性能并增强解码器在不同层输入下的鲁棒性。
本文提出一种谱连通性正则化的图学习框架(SCoGL),该框架融入拉普拉斯谱先验,以在数据稀缺时提高图恢复和图信号去噪等下游任务的性能。
SPAR 是一种预训练目标,采用门控KL散度损失来稳定语言模型预测,对抗无关前缀文本,从而提升在长上下文场景中的鲁棒性,并在多个基准测试中得到验证。
本文介绍了针对AI智能体框架的正则化递归自我改进(RRSI),该方法在递归进化过程中应用正则化以防止过拟合,在多个基准测试中展示了性能提升。
本文探讨了神经网络中的“Grokking”(延迟泛化)现象,并引入了几何维度正则化(GeomDR)方法来控制表征几何结构,从而将“Grokking”现象的出现速度最高提升52倍。
本文介绍了正则化强调时序差分学习(RETD),该方法通过归一化强调TD信号,确保在常数步长下的稳定性,并提供了收敛性证明和实验验证。
本文研究了多类别学习中适当学习与正则化的极限,通过证明学习并不总能归约为适当学习,且正则化存在结构约束,解决了开放性问题。
本文提出了一种用于多语言仇恨言论检测的训练时可解释性框架,通过将模型推理与人类理据对齐,以提高分类性能和可解释性,并在英语和Hinglish数据集上进行了评估。
本文介绍了ERPO,一种通过控制查询分布将正则化从动作侧转移到输入侧的方法,解决了LLM策略优化中的稳定性-探索困境,并在数学推理基准测试中展示了改进。
本文提出了概率电路中曲率的组合理论,证明了每个求和节点的黑塞矩阵迹可分解为电路流量和局部锐度,并引入了一种自适应的锐度感知正则化器,在保持闭式EM更新的同时改善泛化性能。
一篇论文介绍了 TC-LeWM,将 SIGReg 和 VISReg 等正则化损失应用于时间潜在残差,使 LeWM 能够进行多任务学习,显著提高了 LIBERO 机械臂基准上的成功率。
本文发现了时间序列基础模型在强化学习后训练中的“次优坍缩”现象,并提出了地面真值邻域正则化(GTN-R),使输出分布保持在真实值附近,从而提升预测性能。
本文提出了BRACE,一种通过编码有序推理链来检测不断变化的恶意聊天对话的方法,在编码器和解码器骨干网络上均取得了较高的危害类型F1分数。
PhysAttNet 是一种物理信息注意力框架,通过领域引导的正则化增强轻量级 CNN 预测器,以提高工业与天体物理时间序列预测的准确性和泛化能力。
本文提出了一种基于神经ODE的正则化方法,该方法强制强化学习智能体中的潜在嵌入遵循一致的ODE流,使表示学习与环境动态对齐,并在Atari和网格世界基准上取得了性能提升。
本文提出了SCORE,一种受自和谐启发的拟牛顿方法,用于训练物理信息神经网络(PINNs)。它使用递减耦合的移位割线几何,在不需要计算Hessian矩阵的情况下,提高了非线性PDE基准测试的最终精度。
This paper introduces a novel measure called relative parameter importance for task-agnostic, replay-free continual learning, enabling better balance between stability and plasticity by regularizing only parameters critical for past tasks while allowing others to update for backward knowledge transfer. The method is evaluated on class-incremental and domain-incremental text classification tasks.
This paper introduces Omega-S, a lightweight, data-free regularization penalty for low-rank fine-tuning that improves retention of original model capabilities by penalizing variance in weight-matrix node degrees. Experiments on Llama-3-8B with LoRA show it retains more original capability than no regularization or tuned baselines.
This paper introduces Modality Contribution Drift (MCD) in multimodal continual learning and proposes CMCDR, a regularization method with replay-based and replay-free variants to preserve modality contribution structures across incremental tasks.