DiagEvo: 基于层级错误记忆的诊断引导自进化

Hugging Face Daily Papers 论文

摘要

DiagEvo通过层级错误原因记忆和双重置信度过滤,从内部失败历史中推导训练方向,从而改善语言模型的自进化,其性能优于依赖外部资源的基线方法。

自我对弈是语言模型自进化的一种有效范式,但如果没有指导,求解器的性能可能会在轮次中停滞或下降。无指导方法通过难度、可学习性或多样性等信号来引导问题生成。这些信号使问题保持挑战性和多样性,但并未指定后续轮次应针对哪些未解决的推理弱点。有指导方法从外部任务资源获取方向,包括人工示例、文档语料库或指定难度目标,因此依赖于自循环外部提供的任务信息。我们表明,所需的方向可以从求解器自身的失败历史中推导出来。我们引入DiagEvo,其诊断器从该历史中提取反复出现的错误原因,并将其存储在层级错误原因记忆中。该记忆将相关原因归类于技能节点下,并根据在目标问题上的自我一致性跟踪每个原因的活跃或掌握状态。挑战者利用这些状态和重复次数来平衡针对原因的生成与自由探索。双重置信度过滤仅当最常见的求解器答案具有明显投票优势时才保留中等难度问题。DiagEvo从自对弈过程中产生的信息中推导其课程,无需外部任务资源。使用默认的4B诊断器,DiagEvo在三个求解器(Qwen3-4B、Qwen3-8B和OctoThinker-8B)的每个上,在所有九个基准测试的平均准确率上均优于所有基线。在Qwen3-8B上,它在五个数学推理基准测试上达到72.3%的平均准确率,比R-Zero高4.5个百分点。它在所有九个基准测试上的平均准确率为57.4%,比DARC高1.1个百分点。消融研究表明,层级错误原因记忆和双重置信度过滤都对这些增益有贡献。
查看原文
查看缓存全文

缓存时间: 2026/09/02 03:43

论文页面 - DiagEvo:基于层级错误记忆的诊断引导式自我进化

来源:https://huggingface.co/papers/2609.00768 发布于 9月1日 ·

由 https://huggingface.co/dingyii 提交 dingyi (https://huggingface.co/dingyii) 于 9月2日

摘要

DiagEvo 通过分层错误原因记忆和双重置信度过滤,从内部失败历史中推导训练方向,从而改进语言模型的自我进化,其性能优于依赖外部资源的基线方法。

自我博弈 (https://huggingface.co/papers?q=Self-play) 是语言模型自我进化的有效范式,但在缺乏引导的情况下,求解器的性能可能在几轮后趋于平稳或下降。无引导的方法利用难度、可学习性或多样性等信号来指导问题生成。这些信号虽然能保持问题的挑战性和多样性,但无法指明后续轮次应针对哪些未解决的推理弱点。有引导的方法从外部任务资源(如人工示例、文档语料库或指定的难度目标)中获取方向,因此依赖于自我博弈 (https://huggingface.co/papers?q=self-play) 循环之外提供的任务信息。我们证明,所需的方向可以从求解器自身的失败历史中推导出来。

我们提出了 DiagEvo,其诊断器 (https://huggingface.co/papers?q=diagnostician) 从该历史中提取反复出现的错误原因,并将它们存储在分层错误原因记忆 (https://huggingface.co/papers?q=error-cause%20memory) 中。该记忆将相关原因归类在技能节点下,并根据针对问题的自我一致性 (https://huggingface.co/papers?q=self-consistency) 将每个原因标记为“活跃”或“已掌握”。挑战器 (https://huggingface.co/papers?q=challenger) 利用这些状态和重现次数来平衡针对特定原因的生成与自由探索。双重置信度过滤 (https://huggingface.co/papers?q=Double-confidence%20filtering) 仅当最常见的求解器答案具有明确的得票优势时,才保留中等难度的问题。

DiagEvo 从自我博弈 (https://huggingface.co/papers?q=self-play) 过程中产生的信息中推导其课程,无需外部任务资源。使用默认的 4B 诊断器 (https://huggingface.co/papers?q=diagnostician),DiagEvo 在三个求解器(Qwen3-4B、Qwen3-8B 和 OctoThinker-8B)的全部九个基准测试的平均准确率上均优于所有基线。在 Qwen3-8B 上,它在五个数学推理基准测试中达到了 72.3% 的平均准确率,比 R-Zero 高出 4.5 个百分点。其在全部九个基准测试上的平均准确率为 57.4%,比 DARC 高出 1.1 个百分点。消融研究表明,分层错误原因记忆 (https://huggingface.co/papers?q=error-cause%20memory) 和双重置信度过滤 (https://huggingface.co/papers?q=double-confidence%20filtering) 对这些提升都有贡献。

查看 arXiv 页面 (https://arxiv.org/abs/2609.00768)
查看 PDF (https://arxiv.org/pdf/2609.00768)
项目页面 (https://arxiv.org/abs/2609.00768)
添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.00768)

在您的代理中获取此论文: hf papers read 2609.00768 没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文 在模型的 README.md 中引用 arxiv.org/abs/2609.00768,可从此页面链接到该模型。

引用此论文的数据集 0

没有数据集链接此论文 在数据集的 README.md 中引用 arxiv.org/abs/2609.00768,可从此页面链接到该数据集。

引用此论文的 Spaces 0

没有 Space 链接此论文 在 Space 的 README.md 中引用 arxiv.org/abs/2609.00768,可从此页面链接到该 Space。

包含此论文的收藏夹 0

没有收藏夹包含此论文 将此论文添加到收藏夹 (https://huggingface.co/new-collection),可从此页面链接。

相似文章

CurateEvo:面向智能体后训练的数据策展进化

arXiv cs.CL

CurateEvo 是一个以失败为驱动的动态进化框架,用于智能体后训练的数据策展。它利用失败轨迹迭代重写策展策略,在 ACEBench-Agent 和 BFCL-V4 等基准上提升了效果和效率。