标签
约翰·舒尔曼的一条推文强调了论文《分块后训练》(Chunky Post-Training),该论文认为多样化的后训练数据集会导致模型学习到虚假相关性,从而引发非预期行为,例如拒绝以特定格式呈现的真实事实。论文引入了SURF和TURF来揭示并追踪前沿模型中的这些泛化失败。