CORE:对比反思实现推理能力的快速提升
摘要
对比反思(CORE)是一种非参数算法,通过比较成功与不成功的推理轨迹,生成简洁、可解释的洞见,从而以比现有方法更少的样本和 rollout 次数,实现语言模型更快、更高效的自我改进。
查看缓存全文
缓存时间: 2026/06/08 19:17
论文页面 - CORE: 对比反思实现推理能力的快速提升
来源: https://huggingface.co/papers/2605.28742
摘要
对比反思 (CORE) 通过分析成功与不成功尝试之间的差异,生成简洁、可解释的见解,从而提升语言模型的推理能力。与传统的参数化和非参数化方法相比,这种方法能够实现更快、更高效的自我改进。
语言模型可以利用可验证奖励(https://huggingface.co/papers?q=verifiable%20rewards)在多种推理任务(https://huggingface.co/papers?q=reasoning%20tasks)上实现改进。然而,无论是参数化方法(如 RLVR)还是非参数化方法(如提示优化),通常都需要数百个训练样本(https://huggingface.co/papers?q=training%20samples)和数千次模型 rollout(https://huggingface.co/papers?q=model%20rollouts),这在最佳情况下成本高昂,在最坏情况下甚至难以实现。为了应对这一挑战,我们引入了对比反思(https://huggingface.co/papers?q=Contrastive%20Reflection)(CORE),这是一种非参数化学习算法,通过比较过去的推理轨迹(https://huggingface.co/papers?q=reasoning%20traces)来生成见解:即简短的、用自然语言描述的推理策略(https://huggingface.co/papers?q=reasoning%20strategies)和约束条件(https://huggingface.co/papers?q=constraints),这些见解捕捉了成功与不成功问题尝试之间的差异。在四项推理任务(https://huggingface.co/papers?q=reasoning%20tasks)上,我们证明了 CORE 能够比参数化方法(GRPO(https://huggingface.co/papers?q=GRPO))和非参数化方法(GEPA(https://huggingface.co/papers?q=GEPA)、情景式 RAG(https://huggingface.co/papers?q=episodic%20RAG)以及 MemRL(https://huggingface.co/papers?q=MemRL))实现更快速的改进,同时使用的 rollout 次数更少。在固定 rollout 预算(https://huggingface.co/papers?q=rollout%20budgets)下,仅使用少至五个训练样本(https://huggingface.co/papers?q=training%20samples),我们进一步展示了 CORE 能达到与各基线相当甚至更大的性能提升。最后,我们还强调了 CORE 在上下文效率方面显著优于非参数化基线,所需提示词 token(https://huggingface.co/papers?q=prompt%20tokens)更少,同时将学到的知识以紧凑、可解释的自然语言见解形式存储。因此,我们的结果表明,将成功与不成功的推理轨迹(https://huggingface.co/papers?q=reasoning%20traces)之间的对比提炼为抽象而有用的见解,能够为模型自我改进(https://huggingface.co/papers?q=self-improvement)提供一条比权重更新、提示优化或直接复用存储的推理轨迹(https://huggingface.co/papers?q=reasoning%20traces)更高效且更具可解释性的路径。
查看 arXiv 页面(https://arxiv.org/abs/2605.28742)
查看 PDF(https://arxiv.org/pdf/2605.28742)
项目页面(https://linasnasvytis.com/core-reasoning/)
GitHub(https://github.com/LinasNas/core-reasoning)
添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.28742)
在你的智能体中获取这篇论文:
hf papers read 2605\.28742
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型 0
没有模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2605.28742 即可从本页面关联。
引用该论文的数据集 0
没有数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.28742 即可从本页面关联。
引用该论文的 Spaces 0
没有 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2605.28742 即可从本页面关联。
包含该论文的合集 0
没有合集包含此论文
将本论文添加到一个合集(https://huggingface.co/new-collection)即可从本页面关联。
相似文章
对比反思用于迭代提示优化
提出了一种对比反思(Contrastive Reflection)迭代提示优化框架,用于智能体信息检索工作流。该框架利用结构化轨迹识别错误锚定的行为切片,并通过教师LLM进行对比修复,在HotpotQA上实现了显著改进。
CoRA: 面向可靠思维链推理的置信度-理由对齐
本文介绍了CoRA,一种基于GRPO的强化学习框架,旨在将LLM的置信度与生成的理由对齐,以提高思维链推理的可靠性,在多个基准测试中将不对齐误差降低了高达26.51%。
ReflectRL:通过反思到直接推理从黄金负轨迹中学习
ReflectRL是一种通过反思“黄金负轨迹”(专家模型失败的推理尝试)来学习的框架,随后将这种反思性推理迁移回直接推理,从而在多个基准上提升大语言模型的性能。
ReflectFact:用于提升多跳事实核查理解与推理能力的自反思智能体框架
ReflectFact是一个用于多跳事实核查的自反思智能体框架,通过推理路径规划、证据漂移核查和推理反思来解决客观性冲突与知识冲突,在HOVER和EX-FEVER上取得了最先进的结果。
CORE: 通过重排序器蒸馏改进MLLM嵌入中的组合推理
CORE引入一种蒸馏方法,通过Rank-KL目标将组合排序判断从重排序器传输到嵌入模型,从而增强跨基准的组合检索性能,同时不损害标准任务。