标签
本文介绍了赫克曼校正的认知不确定性,以解决机器学习中不可观测变量的选择问题,展示了当选择依赖于与结果相关的不可观测变量时,重要性加权会失效。该方法在受控实验和真实数据上恢复了校准性能,优于标准的不确定性量化基线。
本文研究了在线蒸馏中的位置偏差现象,发现早期token提供更有用的监督信号,并提出重要性加权IW-OPD方法来改善OPD训练。
本文提出DRIFT框架,该框架结合离线轨迹与重要性加权监督微调,高效实现与强化学习相当的多轮交互学习性能。
TILT提出了一种新颖的目标函数,用于在协变量偏移下进行无监督域适应,该函数对未标记目标数据上的辅助组件施加惩罚,隐式实现了具有有界估计量的自定位重要性加权。理论保证和在偏移CIFAR-100上的实验表明,目标域性能优于基线方法。