标签
本文提出DASH-OPD,一种用于多轮LLM智能体训练中同策略蒸馏的差异感知切换方法,它根据漂移和恢复证据自适应地在教师和学生执行器之间切换,以提高效率和性能。
CURV 提出了一种课程学习框架,通过在多模态大语言模型中培养内在的视觉基础推理能力来增强图表问答,在真实世界基准上取得了显著改进。
本文介绍了KGPS,一种卡尔曼引导的提示选择方法,用于大语言模型的自适应强化学习微调。该方法将提示难度建模为动态状态,以提高准确率和采样效率。
DHRCL提出了一种结合密集分层奖励与课程学习的强化学习框架,用于训练代码LLM。该框架在三个阶段的课程中,利用语法验证、执行成功、单元测试通过率和AST结构相似性作为反馈信号。
SCOUT 提出了面向稀疏奖励强化学习的每上下文重置课程,根据每个上下文的学习进度调整辅助移除,在导航和操作任务中优于全局节奏方法。
本文提出了一种用于NLP中课程学习的细粒度分类法,将难度评估与训练调度分离,从而能够系统性地分析和比较CL策略。它识别了先前工作中存在的不可比问题,并提供了一个设计和评估CL方法的框架。
本文提出一种轻量级策略——基于A*的批量选择方法(A*-BS),它将小批量调度视为启发式搜索,以提高CNN训练效率。在MedMNIST任务中,采用A*-BS的简单CNN在准确率和训练速度上均超越了更深的ResNet-18/50基线模型。
本文提出了一种自演化上下文学习框架,用于多用户MISO系统中直接导频到波束成形的设计。该框架集成了Transformer骨干网络、导频编码器-解码器网络和课程学习,无需重新训练即可处理多种信道模型。
EvoCUA-1.5 引入了一种面向多轮计算机使用代理的在线强化学习框架,在 OSWorld-Verified 上实现了 63.2% 的成功率,并通过步骤级策略优化和动态课程学习,性能超越了参数高达 35B 的可比开放权重模型。
本文提出渐进式代码切换(PCS),这是一种结合课程学习的强化学习方法,逐步增加LLM中的代码切换比例,从而实现多语言推理能力的高效迁移。
本文提出了一种基于音调条件的课程学习框架,用于低资源班图语语音识别,结合了混合难度评分、门控适配器和分阶段课程训练。对六种南部班图语的评估显示,W2V-BERT在恩古尼语上优于Whisper,而Whisper在索托-茨瓦纳语上表现更好。
SEAD 提出了一种胜任力感知的在线策略蒸馏方法,利用熵在词元、训练阶段和提示三个层面引导监督,在 OLMo-3 上对六个数学基准测试实现了平均准确率提升 +4.8%。
本文从理论上分析了课程学习通过将复杂问题分解为更简单的子问题并组合解决方案,如何显著降低学习模拟顺序计算(半自动机)的样本复杂度——相较于直接方法,在监督微调中实现次多项式监督需求,并在可验证奖励的强化学习中实现指数级更弱的覆盖条件。
GUICrafter提出了一种弱监督GUI智能体,利用海量未标注截图和两阶段课程学习框架,减少对昂贵人工标注的依赖,仅用UI-TARS系统0.1%的数据即达到了与之竞争的性能。
本文提出了一种迁移感知课程(TAC),这是一种基于多臂老虎机风格的多领域RLVR在线课程,通过梯度几何对齐优先选择其更新能惠及其他领域的领域。与固定课程和仅基于可学习性的课程相比,TAC在Qwen3-1.7B和Llama3.2-3B上提升了宏观平均准确率。
Meta的新论文'Autodata'介绍了一个自主数据科学家,能够生成并元优化合成训练数据,显著优于标准方法,并使一个4B小模型在法律任务中击败了397B的基线模型。
本文介绍了序列学习中基于李括号的迁移顺序预测方法,利用梯度场的交换子确定成对顺序,并可扩展到多个领域。实验表明,该方法在预测微调和指令调优的最优课程顺序方面具有高准确性。
介绍了一种名为 Bayesian Manifold Curriculum (BMC) 的自适应课程学习方法,用于大语言模型,该方法利用模型的潜在几何结构在不同问题类型之间分配训练资源,相比传统基于难度的课程学习提高了效率。
Pythagoras-Prover 是一个计算高效的Lean定理证明器系列,通过课程监督微调和新颖的增强型Lean形式化技术实现了强劲性能。4B模型在MiniF2F-Test上以pass@32超越了DeepSeek-Prover-V2-671B,32B模型则在开源证明器中树立了新的最先进水平。
本文提出Representation Curriculum (RC),一种训练时干预方法,通过分阶段利用特征来减少对曝光混杂历史信号的过度依赖,并改善排序系统中的冷启动泛化能力。该方法经过了理论分析,并在公开基准和大规模eBay搜索实验中得到了验证。