标签
这项模拟研究量化了零售通胀估计中的选择偏差,并比较了校正方法,发现在存在严重正值违反的长尾情境中,分层通常优于逆概率加权。
详细讨论评估集在代理循环中用于选择时如何退化,以及三种防御措施:通过压缩评分统计试验次数、逐步揭示评估数据、将评分器置于无法调用的工具边界之后。
这项预注册的重复研究测试了NLI中单调性对标签一致性的影响是否从选定的低一致性项推广到未选择的群体,结果发现效应反转且很小,表明早期的发现依赖于选择。
本文介绍了赫克曼校正的认知不确定性,以解决机器学习中不可观测变量的选择问题,展示了当选择依赖于与结果相关的不可观测变量时,重要性加权会失效。该方法在受控实验和真实数据上恢复了校准性能,优于标准的不确定性量化基线。
本文系统评估了信用评分中的拒绝推断方法,并发现了一种结构性失效模式:在自然的再训练周期中,模型的准确率提升但召回率骤降,造成了改进的幻象,而实际拒绝质量却在恶化。本文提出了一种受控探索策略,无需统计假设即可打破反馈循环,并证明即使最低的探索率也足以诊断该问题。