标签
该论文研究了在策略变更后,工具使用代理中的历史行动信用何时需要更新,引入了决策充分信用门(DSC-Gate)以高效重用数据并减少新的工具交互。
本文表明,在强化学习中,工具结果缓存即使只是略有正确,也可能逆转预期的组归一化策略更新,这一点通过数学分析和两个动作模型的实验得到了证实。