标签
本文提出 FAER,这是一个面向语言模型后训练的可审计全轨迹重放框架。该框架形式化了缓存级选择反馈与下游学习者效用之间的差距,并表明一个学习者感知的选择器(FAER-UTILITY)在 GSM8K 上配合 Qwen2.5-1.5B-Instruct 时,表现优于基于格式反馈和均匀采样的基线方法。