标签
本文讨论了一篇研究论文,该论文表明,使用不同随机种子训练的两个深度网络之间的分歧率可以仅使用未标记数据准确估计泛化误差,揭示了一个名为泛化分歧等式的惊人联系。
提出一种无标签数据的元学习方法,通过将预训练模型的软标签分配给未标注数据来生成任务,避免了计算昂贵的模型逆推。与最先进的DFML方法相比,实现了高达104倍的加速和8.4%-36.4%的准确率提升。
介绍了测试时强化学习(TTRL),一种利用未标注数据上的多数投票创建伪标签以进行强化学习训练的方法,使LLM能够在不依赖真实答案的情况下自我改进。在AIME 2024上取得了显著提升(例如,Qwen-2.5-Math-7B提升159-211%)。
本文研究了增量决策树集成中的分歧漂移检测方法,发现在神经网络中有效的方法在树集成中表现不如基于损失的检测器,原因是模型塑性有限。