迈向技能原生的大语言模型:用于长程推理基准测试与训练的技能熵
摘要
本文介绍了技能熵(Skill Entropy),一种衡量跨技能切换难度的指标,以及 Skill^2-Bench,一个覆盖 558 项技能的长程推理任务基准。作者还提出了 Skill-EntropyRL,一个训练框架,将 Qwen3 模型上的推理性能从 34.4% 提升到 68.4%,并从 14.6% 提升到 40.1%。
查看缓存全文
缓存时间: 2026/08/06 05:50
论文页面 - 迈向技能原生LLM:面向长程推理基准测试与训练的技能熵
来源:https://huggingface.co/papers/2608.05139
摘要
近期LLM中的长程推理要求模型在推理链中切换不同技能,例如先进行数学推导,再利用结果规划日程。我们将此类问题称为跨技能长程任务:多步骤任务,其各步骤需要不同的推理技能,并依赖于先前的输出。现有基准通常评估单一技能,缺乏衡量模型在技能间切换能力的原理性方法。我们从评估和训练两方面弥补这一空白。我们引入技能熵(Skill Entropy),一种衡量从一个技能切换到另一个技能难度的指标。随后提出Skill^2-Bench,一个基于558种技能、覆盖9个可验证且开放领域构建的跨技能长程任务基准。每个任务都分配一个任务级技能熵分数,并分为三个难度等级。在Skill^2-Bench上评估8个前沿模型和4个开源模型,揭示了技能切换差距:在更高熵任务上准确率下降。接着我们将技能熵从基准尺度转化为训练信号。我们提出Skill-Entropy RL,一种RL框架,其中模型不仅预测每个步骤的答案,还预测生成该答案所用的技能。奖励结合了步骤级正确性与衡量模型预测技能序列与黄金技能序列之间对齐程度的技能熵奖励。在Qwen3-4B-Instruct和Qwen3-1.7B上,Skill-Entropy RL将Skill^2-Bench分数分别从34.4%提升至68.4%、从14.6%提升至40.1%,优于竞争性基线。同一流程可应用于现成训练数据(如OpenR1-Math),表明技能熵是一种可复用的训练信号。代码见:https://github.com/Gen-Verse/Skill-Entropy-RL
查看arXiv页面 (https://arxiv.org/abs/2608.05139)查看PDF (https://arxiv.org/pdf/2608.05139)项目页面 (https://huggingface.co/datasets/Gen-Verse/Skill2-Bench)GitHub (https://github.com/Gen-Verse/Skill-Entropy-RL)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.05139)
在你的agent中获取此论文:
hf papers read 2608\.05139
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型README.md中引用arxiv.org/abs/2608.05139即可从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2608.05139即可从此页面链接。
引用此论文的Spaces0
没有Space链接此论文
在Space README.md中引用arxiv.org/abs/2608.05139即可从此页面链接。
包含此论文的收藏集1
相似文章
SkillRet:面向 LLM 智能体技能检索的大规模基准
本文提出了 SkillRet,这是一个用于评估 LLM 智能体技能检索的大规模基准,旨在解决从大型技能库中选择相关技能的挑战。该基准提供了包含超过 17,000 项技能的 dataset,并证明针对特定任务的微调能显著提升检索性能。
SkillLearnBench:面向真实任务代理技能生成的持续学习方法基准
SkillLearnBench 推出首个评估 LLM 代理持续技能学习的基准,覆盖 20 项真实任务,结果显示尚无方法全面领先,单纯扩大模型规模也无法保证技能提升。
技能自我对弈(Skill Self-Play):通过协同进化技能推动大语言模型能力前沿
本文介绍了技能自我对弈(Skill-SP),这是一个协同进化框架,利用提议者、求解者和技能控制器来桥接结构化验证与开放式探索,从而提升大语言模型在工具使用和推理基准测试中的性能。
重新思考大语言模型推理中的强化学习:关键在于稀疏策略选择,而非能力学习
本文挑战了强化学习(RL)能为大语言模型(LLM)教授新推理能力的假设,论证其作用实则是在高熵决策点进行稀疏策略选择。本文提出了 ReasonMaxxer,这是一种无需强化学习的方法,以显著更低的训练成本实现了与完整强化学习相当的性能。
大语言模型何时进行推理?基于熵相变的动力系统视角
本文探讨了思维链推理在何时对大语言模型有益,表明早期熵动力学能够可靠地指示推理效用,并介绍了EDRM,这是一个轻量级、无需训练的框架,可自适应选择推理策略,在保持或提升准确率的同时显著节省token。