标签
MILES是一个通过动态扩展逐步记忆并使用可学习选择头来提升LLM推理能力的框架,实现了更好的准确性-效率权衡。
本文识别了推理模型测试时缩放中的“模态上限”和“相关上限”,表明在数十个样本之后,额外采样不会提高选择准确性,甚至可能有害,突显了生成正确回答与识别正确回答之间的可识别性差距。