Chain-of-Experience:持续大语言模型改进

Hugging Face Daily Papers 论文

摘要

本文介绍了Chain-of-Experience,一种通过迭代测试时反馈实现大语言模型持续改进的方法,在各个领域展示了更好的性能和成本效益。

人类从经验中持续学习,而传统的大语言模型(LLM)评估忽略了模型通过推理时交互改进的能力。在本文中,我们研究LLMs如何在测试时从迭代经验中学习,我们将这一设置称为Chain-of-Experience(CoE),其中模型通过与自身或环境反馈的迭代交互积累经验轨迹,形成超越零样本推理的持续改进循环。我们使用多种反馈机制实例化CoE,包括模型自我反馈和环境信号,如正确性或公开编码测试通过率,并在数学、编码和知识领域使用8个LLMs进行评估,包括GPT-5、Gemini-2.5 Pro、Claude-4.5 Sonnet。我们的研究表明,利用迭代体验始终优于无反馈基线,仅通过自我反馈就能获得显著收益,整体改进5.6%,API成本降低19%。我们进一步显示,结合互补的反馈渠道(例如,模型和正确性信号)能带来额外收益,并且CoE比现有测试时策略提供更高的每token准确率。我们观察到LLM基础能力与改进能力之间存在正相关,并显示模型在弱或虚假反馈下仍保持鲁棒性,不同反馈对改进方面有贡献,且大部分收益在迭代早期出现。
查看原文
查看缓存全文

缓存时间: 2026/08/21 08:09

论文页面 - 持续学习经验链:实现大语言模型的持续改进

来源:https://huggingface.co/papers/2608.18027

摘要

大语言模型通过名为“经验链”的迭代式测试时反馈循环持续改进,其性能超越零样本基线,同时成本更低、令牌使用效率更高。

人类通过经验不断学习,而传统的大语言模型评估却忽略了模型通过推理时交互(https://huggingface.co/papers?q=inference-time%20interaction)进行自我提升的能力。本文研究了大语言模型在测试时如何通过迭代经验进行学习——我们将这一设定称为“经验链”(https://huggingface.co/papers?q=Chain-of-Experience)(CoE)。在该框架下,模型通过与自身或环境反馈的迭代交互(https://huggingface.co/papers?q=environmental%20feedback)积累经验轨迹,形成超越零样本推理的持续改进循环(https://huggingface.co/papers?q=continual%20improvement%20loop)。我们采用多样化的反馈机制实例化CoE,包括模型自反馈(https://huggingface.co/papers?q=self-feedback)以及正确性、公开代码测试通过率等环境信号,并使用包括GPT-5、Gemini-2.5 Pro、Claude-4.5 Sonnet在内的8个大语言模型,在数学、编程和知识领域进行评估。研究表明,利用迭代经验始终优于无反馈基线,仅通过自反馈就能实现显著提升,整体任务准确率提高5.6%,API成本降低19%。我们进一步发现,组合互补的反馈渠道(如模型信号与正确性信号)能带来额外增益,且经验链比现有测试时策略(https://huggingface.co/papers?q=test-time%20strategies)具有更高的单令牌准确率。观察显示大语言模型基础能力与改进潜力呈正相关,模型在弱反馈或虚假反馈下仍保持鲁棒性,不同反馈对改进的贡献维度各异,且大部分增益在迭代早期阶段产生。

查看arXiv页面(https://arxiv.org/abs/2608.18027)查看PDF(https://arxiv.org/pdf/2608.18027)添加到收藏集(https://huggingface.co/login?next=%2Fpapers%2F2608.18027)

获取论文至您的代理工具:

hf papers read 2608\.18027

尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

暂无关联模型

在模型README.md中引用 arxiv.org/abs/2608.18027 以建立从本页的链接。

引用本文的数据集0

暂无关联数据集

在数据集README.md中引用 arxiv.org/abs/2608.18027 以建立从本页的链接。

引用本文的Space 0

暂无关联Space

在Space的README.md中引用 arxiv.org/abs/2608.18027 以建立从本页的链接。

包含本文的收藏集0

暂无相关收藏集

将本文添加至收藏集(https://huggingface.co/new-collection)以建立从本页的链接。

相似文章

用于持续LLM改进的经验链

arXiv cs.CL

本文介绍了经验链(CoE),一个通过测试时与自我和环境反馈的迭代交互来持续改进LLM的框架,在多个领域和模型中显示出一致的收益和更低的API成本。

重新思考自进化大语言模型智能体的持续经验内化

arXiv cs.CL

本文研究了大语言模型智能体在多轮迭代经验内化过程中出现能力渐进式崩溃的原因,并提出了一套从经验粒度、注入模式和训练机制三个维度出发的鲁棒解决方案。主要发现包括:原则级经验、逐步注入方式以及离策略上下文蒸馏能够带来更稳定、更可持续的持续学习效果。

持续学习何时需要学习

arXiv cs.LG

本文提出了一个统一的LLM持续学习框架,将变化沿空间(新领域)和时间(数据漂移)两个维度进行解耦。它评估了多种方法,包括提示、监督学习、强化学习和上下文压缩,在现实的顺序设置下。