@omarsar0:终于有一篇好论文检验自我反思循环是否值得。设置:七种方法,1.5B、3B 的开源模型 ……

X AI KOLs Timeline 论文

摘要

一篇论文发现,Self-Refine 和 Reflexion 等自我反思循环在 1.5B 到 7B 的开源模型上,以相同的 token 成本并未优于重复采样,所有 18 项自我检查比较均为负面结果。

终于有一篇好的论文检验自我反思循环是否值得。 设置:七种方法,1.5B、3B 和 7B 的开源模型,两个数学基准,每个基准 150 个问题。 每个生成的 token 都被计入,包括用于批评、反思、辩论轮次和检查的 token。每种方法都与自身实测成本下的重复采样进行对比,按问题配对,并使用 bootstrap 置信区间和多重比较校正。 所有 36 项比较均未显示任何方法有可靠的胜出。有十项可靠地更差,而且每一项都是模型检查自身输出的方法。所有 18 项自我检查比较均为负面结果。 Self-Refine 和强制 Reflexion 在 7B 规模下比基线低 3.6 到 10.1 个点。按原论文实现的 Reflexion 在最小的模型上从未触发自身的重试机制。它每次都判定自己正确,悄然变成了一条思维链。 在给你的智能体循环添加另一个批评步骤之前,值得了解这一点。 论文:https://arxiv.org/abs/2607.28576 在我们的学院中追踪更多热门 AI 论文:https://academy.dair.ai
查看原文
查看缓存全文

缓存时间: 2026/08/05 00:17

终于有一篇好论文检验自我反思循环是否值得。

实验设置:七种方法,开源模型涵盖 1.5B、3B 和 7B 规模,两个数学基准,每个基准 150 道题。

每个生成的 token 都被计入,包括用于批评、反思、辩论轮次和检查的部分。每种方法都在其自身测得的成本下与重复采样进行比较,按问题配对,并采用 bootstrap 置信区间和多重性校正。

全部 36 组比较中,没有任何方法取得可靠的胜出。有十组结果可靠地更差,而且每组对应的方法都是让模型检查自身输出。所有 18 组自我检查比较均为负面结果。

Self-Refine 和强制执行的 Reflexion 在 7B 规模下比基线低 3.6 到 10.1 个百分点。按原论文实现的 Reflexion 在最小的模型上从未触发过自身重试:它每次都认定自己正确,悄悄变成了单条思维链。

在向你的智能体循环中添加又一步批评之前,这一点值得了解。

论文:https://arxiv.org/abs/2607.28576

在我们的学院中追踪更多热门 AI 论文:https://academy.dair.ai


多采样,少反思:在相同 token 成本下,Self-Refine 和 Reflexion 从 1.5B 到 7B 均输给重复采样

来源:https://arxiv.org/abs/2607.28576 参考文献工具

参考文献与引文工具

参考文献浏览器切换

代码、数据与媒体

与本文相关的代码、数据与媒体

演示

演示

相关论文

推荐与搜索工具

关于 arXivLabs

arXivLabs:与社区合作者一起进行的实验项目

arXivLabs 是一个框架,允许合作者直接在我们的网站上开发和分享新的 arXiv 功能。

与 arXivLabs 合作的个人和组织都认同并接受我们关于开放、社区、卓越和用户数据隐私的价值观。arXiv 致力于这些价值观,并且只与遵守这些价值观的伙伴合作。

有一个能为 arXiv 社区带来价值的项目想法?了解更多关于 arXivLabs (https://info.arxiv.org/labs/index.html)。

相似文章

重采样不如精炼:LLM推理中的测试时自校正

arXiv cs.AI

一种新的无验证器广度-深度精炼框架通过采样多个推理轨迹、利用自我批评迭代地精炼每条轨迹,并通过多数投票进行聚合,从而在测试时提升LLM推理能力。在多个数学基准和开放权重模型上,该方法持续优于贪心解码、多数投票和基于验证器的选择。