Chain-of-Experience:持续大语言模型改进
摘要
本文介绍了Chain-of-Experience,一种通过迭代测试时反馈实现大语言模型持续改进的方法,在各个领域展示了更好的性能和成本效益。
查看缓存全文
缓存时间: 2026/08/21 08:09
论文页面 - 持续学习经验链:实现大语言模型的持续改进
来源:https://huggingface.co/papers/2608.18027
摘要
大语言模型通过名为“经验链”的迭代式测试时反馈循环持续改进,其性能超越零样本基线,同时成本更低、令牌使用效率更高。
人类通过经验不断学习,而传统的大语言模型评估却忽略了模型通过推理时交互(https://huggingface.co/papers?q=inference-time%20interaction)进行自我提升的能力。本文研究了大语言模型在测试时如何通过迭代经验进行学习——我们将这一设定称为“经验链”(https://huggingface.co/papers?q=Chain-of-Experience)(CoE)。在该框架下,模型通过与自身或环境反馈的迭代交互(https://huggingface.co/papers?q=environmental%20feedback)积累经验轨迹,形成超越零样本推理的持续改进循环(https://huggingface.co/papers?q=continual%20improvement%20loop)。我们采用多样化的反馈机制实例化CoE,包括模型自反馈(https://huggingface.co/papers?q=self-feedback)以及正确性、公开代码测试通过率等环境信号,并使用包括GPT-5、Gemini-2.5 Pro、Claude-4.5 Sonnet在内的8个大语言模型,在数学、编程和知识领域进行评估。研究表明,利用迭代经验始终优于无反馈基线,仅通过自反馈就能实现显著提升,整体任务准确率提高5.6%,API成本降低19%。我们进一步发现,组合互补的反馈渠道(如模型信号与正确性信号)能带来额外增益,且经验链比现有测试时策略(https://huggingface.co/papers?q=test-time%20strategies)具有更高的单令牌准确率。观察显示大语言模型基础能力与改进潜力呈正相关,模型在弱反馈或虚假反馈下仍保持鲁棒性,不同反馈对改进的贡献维度各异,且大部分增益在迭代早期阶段产生。
查看arXiv页面(https://arxiv.org/abs/2608.18027)查看PDF(https://arxiv.org/pdf/2608.18027)添加到收藏集(https://huggingface.co/login?next=%2Fpapers%2F2608.18027)
获取论文至您的代理工具:
hf papers read 2608\.18027
尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
暂无关联模型
在模型README.md中引用 arxiv.org/abs/2608.18027 以建立从本页的链接。
引用本文的数据集0
暂无关联数据集
在数据集README.md中引用 arxiv.org/abs/2608.18027 以建立从本页的链接。
引用本文的Space 0
暂无关联Space
在Space的README.md中引用 arxiv.org/abs/2608.18027 以建立从本页的链接。
包含本文的收藏集0
暂无相关收藏集
将本文添加至收藏集(https://huggingface.co/new-collection)以建立从本页的链接。
相似文章
用于持续LLM改进的经验链
本文介绍了经验链(CoE),一个通过测试时与自我和环境反馈的迭代交互来持续改进LLM的框架,在多个领域和模型中显示出一致的收益和更低的API成本。
重新思考自进化大语言模型智能体的持续经验内化
本文研究了大语言模型智能体在多轮迭代经验内化过程中出现能力渐进式崩溃的原因,并提出了一套从经验粒度、注入模式和训练机制三个维度出发的鲁棒解决方案。主要发现包括:原则级经验、逐步注入方式以及离策略上下文蒸馏能够带来更稳定、更可持续的持续学习效果。
ContinualSkillBench:LLM智能体能否真正进化其能力?
介绍了ContinualSkillBench,一个用于LLM智能体上下文内持续技能学习的动态评估框架,表明虽然顺序执行能提升性能,但当前方法难以将经验巩固为稳健、可迁移的技能。
持续学习何时需要学习
本文提出了一个统一的LLM持续学习框架,将变化沿空间(新领域)和时间(数据漂移)两个维度进行解耦。它评估了多种方法,包括提示、监督学习、强化学习和上下文压缩,在现实的顺序设置下。
面向即时自适应反馈:通过知识驱动的LLM提升学生学习效果
本文提出一个框架,利用领域专家知识来引导大语言模型,根据学生的书面推理提供即时自适应反馈。在一门大规模大学课程中,该框架使学生成绩提升了超过80%。