标签
OrDA 是一个利用正交正则化和因果干预,在首页营销区块推荐中将用户访问习惯与真实内容兴趣解耦的框架,在芝麻信用首页上实现了 5.64% 的 UCTR 提升。
本文介绍了Retroactive Advantage Correction (RAC),这是一种用于延迟感知RLHF的闭合形式偏差校正方法,通过将延迟奖励排队并使用V-trace风格的裁剪残差更新重新注入,来处理异步奖励信号。
本文介绍了 SLC(状态空间逻辑校正),该方法通过卡尔曼平滑器进行经验贝叶斯收缩,纠正知识追踪模型中的逐项逻辑偏差,从而在 AUC 指标上优于全局校准技术。
本文介绍了PRECISE,它是预测驱动推理(Prediction-Powered Inference)的一种扩展,将少量人工标注与大量LLM判断结合,以生成无偏且方差减小的排名评估指标(如Precision@K)估计。该方法在ESCI基准测试和实际生产环境的A/B测试中进行了验证,仅使用100个人工标注就正确识别出了最佳系统变体,并通过+407 bps的销售改进得到了确认。
本文指出,在分块自回归视频扩散的KV缓存压缩中,对键进行量化会导致注意力权重出现偏差,并提出了一种每注意力分数校正方法,该方法以可忽略的开销消除偏差,在INT2量化下恢复接近BF16的视频质量。
本文提出了PushCen-ADFL,一种通信高效的异步去中心化联邦学习框架,它使用基于质心的消息传递和偏差纠正,在异构条件下提高准确性并降低通信开销。