MILES:用于自我提升大型语言模型推理的可学习选择模块化指令记忆
摘要
MILES是一个通过动态扩展逐步记忆并使用可学习选择头来提升LLM推理能力的框架,实现了更好的准确性-效率权衡。
arXiv:2607.06974v1 公告类型:新
摘要:大型语言模型(LLMs)在测试时通过额外计算不断提升推理能力,然而现有大多数工作都是孤立地处理每个问题。当问题按顺序出现时,跨问题积累可复用的经验可以进一步提高性能。现有的基于记忆的方法要么存储整体解决方案模板,这类模板对新颖问题的泛化能力较差,要么使用启发式的步骤级选择,并未针对最终答案的正确性进行优化。学习选择策略需要大规模训练数据和固定的动作空间,这使得此类方法不适用于测试时设置——在这种设置下记忆逐步扩展且仅提供有限的监督信息。我们提出MILES(用于自我提升LLM推理的可学习选择模块化指令记忆),这是一个在现实测试时约束下动态扩展逐步记忆并应用正确性优化记忆组合的框架。MILES维护由子目标嵌入和子指令的非对称对组成的模块化记忆单元,每个单元关联一个可学习选择头。这种记忆结构支持从粗到细的检索机制:粗粒度层支持记忆扩展并从置信样本中收集训练选择头的监督信息,而细粒度层则应用已学习的选择头对粗粒度候选进行重排序,并指导不确定样本的推理。MILES持续达到或超越先前方法的性能,同时实现更优的准确性-效率权衡。大量实验证明了其有效性、鲁棒性和可迁移性。
查看缓存全文
缓存时间: 2026/07/09 07:49
# MILES:面向自改进LLM推理的模块化指令记忆与可学习选择机制 来源:https://arxiv.org/abs/2607.06974 查看PDF (https://arxiv.org/pdf/2607.06974) > 摘要:大型语言模型(LLMs)通过在测试时增加计算量来不断提升其推理能力,但现有工作大多将每个问题独立处理。当问题按序到达时,跨问题积累可复用经验可进一步提升性能。现有的基于记忆的方法要么存储完整解题模板,导致难以泛化至新问题;要么使用基于启发式的步骤级选择,但未针对最终答案正确性进行优化。学习选择策略需要大规模训练数据和固定动作空间,这使得此类方法不适用于测试时场景——在此场景下,记忆以增量方式扩展且仅能获得有限的监督信号。我们提出 MILES(面向自改进LLM推理的模块化指令记忆与可学习选择机制),该框架在现实测试时约束下动态扩展步骤级记忆,并应用经过正确性优化的记忆组合。MILES 维护由非对称的子目标嵌入与子指令对组成的模块化记忆单元,每个单元附带一个可学习的分类头。这种记忆结构支持粗到细的检索机制:粗粒度阶段实现记忆扩展,并从置信样本中收集用于训练分类头的监督信号;细粒度阶段则应用已学习的分类头对粗粒度候选进行重排序,并引导不确定样本的推理过程。MILES 持续匹配或超越先前方法,同时实现更优的精度-效率权衡。大量实验证明了该方法的有效性、鲁棒性和可迁移性。 ## 提交历史 来自:Ruilin Tong [查看邮件 (https://arxiv.org/show-email/c2323e39/2607.06974)] **\[v1\]** 2026年7月8日星期三 03:51:37 UTC (1,089 KB)
相似文章
STRIDE:面向LLM推理的可学习逐步语言反馈
STRIDE提出了一种训练框架,使用可学习的逐步语言反馈而非标量奖励来提升LLM推理能力,在多种基准测试上取得了最先进的结果。
ISM:用于连续数学推理的自我改进策略记忆
ISM引入了一个自进化记忆系统,该系统存储并优化策略模式,以在连续学习场景下提升冻结LLM的数学推理能力,在MATH-Hard和OlympiadBench基准上优于基线方法。
EvolveMem: 通过AutoResearch实现LLM智能体的自演化记忆架构
EvolveMem为LLM智能体引入了一种自演化记忆架构,通过LLM驱动的诊断和迭代研究周期来优化检索配置,在LoCoMo和MemBench等基准测试上取得了显著的性能提升。
REAL: 一种用于LLMs长期记忆管理的推理增强图框架
REAL是一种用于LLMs长期记忆管理的推理增强图框架,它利用时间与置信度感知的有向属性图,采用非破坏性时间更新和混合波束搜索检索,平均性能提升22.72%。
元认知作为奖励:通过知识与调控信号强化大语言模型推理
介绍了元认知即奖励(MaR),一个基于元认知知识与调控信号指导大语言模型推理的强化学习框架,在推理基准上相比基准方法最高提升11%。