MILES:用于自我提升大型语言模型推理的可学习选择模块化指令记忆

arXiv cs.CL 论文

摘要

MILES是一个通过动态扩展逐步记忆并使用可学习选择头来提升LLM推理能力的框架,实现了更好的准确性-效率权衡。

arXiv:2607.06974v1 公告类型:新 摘要:大型语言模型(LLMs)在测试时通过额外计算不断提升推理能力,然而现有大多数工作都是孤立地处理每个问题。当问题按顺序出现时,跨问题积累可复用的经验可以进一步提高性能。现有的基于记忆的方法要么存储整体解决方案模板,这类模板对新颖问题的泛化能力较差,要么使用启发式的步骤级选择,并未针对最终答案的正确性进行优化。学习选择策略需要大规模训练数据和固定的动作空间,这使得此类方法不适用于测试时设置——在这种设置下记忆逐步扩展且仅提供有限的监督信息。我们提出MILES(用于自我提升LLM推理的可学习选择模块化指令记忆),这是一个在现实测试时约束下动态扩展逐步记忆并应用正确性优化记忆组合的框架。MILES维护由子目标嵌入和子指令的非对称对组成的模块化记忆单元,每个单元关联一个可学习选择头。这种记忆结构支持从粗到细的检索机制:粗粒度层支持记忆扩展并从置信样本中收集训练选择头的监督信息,而细粒度层则应用已学习的选择头对粗粒度候选进行重排序,并指导不确定样本的推理。MILES持续达到或超越先前方法的性能,同时实现更优的准确性-效率权衡。大量实验证明了其有效性、鲁棒性和可迁移性。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:49

# MILES:面向自改进LLM推理的模块化指令记忆与可学习选择机制
来源:https://arxiv.org/abs/2607.06974
查看PDF (https://arxiv.org/pdf/2607.06974)

> 摘要:大型语言模型(LLMs)通过在测试时增加计算量来不断提升其推理能力,但现有工作大多将每个问题独立处理。当问题按序到达时,跨问题积累可复用经验可进一步提升性能。现有的基于记忆的方法要么存储完整解题模板,导致难以泛化至新问题;要么使用基于启发式的步骤级选择,但未针对最终答案正确性进行优化。学习选择策略需要大规模训练数据和固定动作空间,这使得此类方法不适用于测试时场景——在此场景下,记忆以增量方式扩展且仅能获得有限的监督信号。我们提出 MILES(面向自改进LLM推理的模块化指令记忆与可学习选择机制),该框架在现实测试时约束下动态扩展步骤级记忆,并应用经过正确性优化的记忆组合。MILES 维护由非对称的子目标嵌入与子指令对组成的模块化记忆单元,每个单元附带一个可学习的分类头。这种记忆结构支持粗到细的检索机制:粗粒度阶段实现记忆扩展,并从置信样本中收集用于训练分类头的监督信号;细粒度阶段则应用已学习的分类头对粗粒度候选进行重排序,并引导不确定样本的推理过程。MILES 持续匹配或超越先前方法,同时实现更优的精度-效率权衡。大量实验证明了该方法的有效性、鲁棒性和可迁移性。

## 提交历史

来自:Ruilin Tong [查看邮件 (https://arxiv.org/show-email/c2323e39/2607.06974)] **\[v1\]** 2026年7月8日星期三 03:51:37 UTC (1,089 KB)

相似文章