标签
本文提出了一种在延迟反馈上下文老虎机中选择奖励与策略的诊断协议,认为标准离线评估可能产生误导,并在基准测试和已部署的推送系统上验证了该方法。
本文介绍了用于推荐评估的个性化LLM评判器的行为对齐框架,解决了双向合理化问题——即现成的LLM对同一项目既能论证用户参与的正向结果,也能论证负向结果。通过微调和偏好优化,该方法相比零样本基线在Macro-F1上提升了32.19%,并达到了生产环境中基于特征工程的基线水平。
论文认为,检测到所获取的LLM派生信号的平均效果并不等同于学习逐实例的采集策略,并确立了一个奖励-信噪比下限(ρ* ≈ 2.8/√N),低于该下限时离线路由不可行。论文引入了结构化假设嵌入(SHE),并在三个数据集上表明,学习到的逐示例采集在此下限之下崩溃,因此建议改用设计时的机制门控。