@omarsar0:终于有一篇好论文检验自我反思循环是否值得。设置:七种方法,1.5B、3B 的开源模型 ……
摘要
一篇论文发现,Self-Refine 和 Reflexion 等自我反思循环在 1.5B 到 7B 的开源模型上,以相同的 token 成本并未优于重复采样,所有 18 项自我检查比较均为负面结果。
查看缓存全文
缓存时间: 2026/08/05 00:17
终于有一篇好论文检验自我反思循环是否值得。
实验设置:七种方法,开源模型涵盖 1.5B、3B 和 7B 规模,两个数学基准,每个基准 150 道题。
每个生成的 token 都被计入,包括用于批评、反思、辩论轮次和检查的部分。每种方法都在其自身测得的成本下与重复采样进行比较,按问题配对,并采用 bootstrap 置信区间和多重性校正。
全部 36 组比较中,没有任何方法取得可靠的胜出。有十组结果可靠地更差,而且每组对应的方法都是让模型检查自身输出。所有 18 组自我检查比较均为负面结果。
Self-Refine 和强制执行的 Reflexion 在 7B 规模下比基线低 3.6 到 10.1 个百分点。按原论文实现的 Reflexion 在最小的模型上从未触发过自身重试:它每次都认定自己正确,悄悄变成了单条思维链。
在向你的智能体循环中添加又一步批评之前,这一点值得了解。
论文:https://arxiv.org/abs/2607.28576
在我们的学院中追踪更多热门 AI 论文:https://academy.dair.ai
多采样,少反思:在相同 token 成本下,Self-Refine 和 Reflexion 从 1.5B 到 7B 均输给重复采样
来源:https://arxiv.org/abs/2607.28576 参考文献工具
参考文献与引文工具
参考文献浏览器切换
代码、数据与媒体
与本文相关的代码、数据与媒体
演示
演示
相关论文
推荐与搜索工具
关于 arXivLabs
arXivLabs:与社区合作者一起进行的实验项目
arXivLabs 是一个框架,允许合作者直接在我们的网站上开发和分享新的 arXiv 功能。
与 arXivLabs 合作的个人和组织都认同并接受我们关于开放、社区、卓越和用户数据隐私的价值观。arXiv 致力于这些价值观,并且只与遵守这些价值观的伙伴合作。
有一个能为 arXiv 社区带来价值的项目想法?了解更多关于 arXivLabs (https://info.arxiv.org/labs/index.html)。
相似文章
AI中的递归自我改进:从有界自我优化到自主研究循环
对2024–2026年间1,250篇关于AI递归自我改进的论文进行了全面综述,提出了将有界自我优化与开放式递归自我改进相区分的分类体系,并分析了评估器设计空间和失败模式。
@rohanpaul_ai: 自我改进的AI的真实性仅取决于其测试信号的有效性。梳理1250篇论文揭示了……
对1250篇关于AI递归自我改进的论文的分析表明,评估者信号是关键瓶颈。模型只有在强大且可信的信号(如证明检查器)下才能可靠改进,而弱信号则会导致循环崩溃或强化错误。
重采样不如精炼:LLM推理中的测试时自校正
一种新的无验证器广度-深度精炼框架通过采样多个推理轨迹、利用自我批评迭代地精炼每条轨迹,并通过多数投票进行聚合,从而在测试时提升LLM推理能力。在多个数学基准和开放权重模型上,该方法持续优于贪心解码、多数投票和基于验证器的选择。
为什么自反思ReAct循环在长时任务中失败,以及我们为此构建的AgentOS验证架构
解释了自反思ReAct循环在长时任务中失败的原因,并介绍了作为解决方案的AgentOS验证架构。
通过反思增强自蒸馏在稀有成功但反馈丰富的场景中学习
本文介绍了反思增强自蒸馏(RESD)框架,该框架将失败反馈转化为对LLM的纠正性监督,从而实现从稀有成功中高效学习。该框架优于标准自蒸馏基线,并且相比GRPO,使用更少的样本实现了更快的早期改进。