标签
本文诊断了 attribution patching 中的系统性误差——这是一种用于语言模型因果定位的基于梯度的近似方法——并提出了一种使用 Hessian-vector product 的二阶修正,该修正以极小的额外计算成本提高了可靠性。
本文针对恒定步长Q学习,开发了一种符号分离的有限时间误差分析,将误差分解为负部和正部,并提供了揭示与过估计相关的不对称性的界。
本文分析了基于模型的强化学习中的“想象训练”范式,推导了最优样本分配策略,并描述了动态模型和奖励模型的误差如何影响策略回报。