标签
本文提出AdvRole,一种用于训练大型语言模型中角色扮演智能体的对抗性闭环课程框架,该框架通过演化场景池以提升在基准测试上的性能。
本文系统分析了语音标记语言模型中基于长度的训练,表明在批次组成和标记暴露固定的情况下,短到长排序无独立益处,并评估了损失归一化的影响。
Spatial-Interactor是一个框架,通过与物理世界的交互训练视觉语言模型以增强空间推理能力,采用三级课程和两阶段训练策略来改进状态转移建模和长期集成。
本文提出渐进式错误课程训练(PECT),通过逐步适应现实中的音素预测错误,提高视觉语音识别中音素到文本重构的鲁棒性,在LRS2和LRS3基准测试上实现了词错误率的降低。
DeliveryGym是一个用于自适应课程的长期具身智能体规划的3D强化学习环境,通过强化学习展示了性能提升。
论文提出了抽象令牌课程(ATC),一种课程学习框架,能够在无需直接监督的情况下,在大型语言模型(LLMs)中引出有效的连续中间表示,并提供了理论和实验证据。
本文提出了一种分层课程学习方法,用于高效压缩大语言模型,该方法以显著降低GPU内存占用和训练时间,实现了最先进性能。
本文分解了固定状态递归网络中的联想记忆,发现卷积和课程学习对性能至关重要,并提出了针对干扰而非容量限制的干预措施。
本文介绍了一种教师引导的课程学习方法,用于强化学习与可验证奖励(RLVR),以高效训练语言模型处理初始不可解的数学问题,实现显著的数据效率并扩展推理边界。
本文介绍了SEAR系统,用于多语言语音选择题,通过片段证据感知路由、监督微调和强化学习,在MLC-SLM挑战赛中实现了90.92%的准确率。
本文介绍了PATH,一个用于强化学习中主动课程优化的框架,该框架利用课程图结构来提高在不同环境中的鲁棒性和泛化能力。
本文介绍了CAIR,一个在现实缺失条件下用于生理时间序列数据插补的两阶段框架,通过纳入间隔机制和课程感知训练,超越了现有方法。
该论文提出动态上下文调度方法,旨在增强上下文强化学习的泛化能力,实验表明在模拟环境中在分布外和分布内区域均实现性能提升。
本文通过分析不同难度水平间的优化动态,研究大语言模型中的课程学习,并提出一种名为迁移感知动态课程采样(TDCS)的新方法,该方法基于迁移关系动态调整训练数据。
无影-浏览器代理是一个面向真实世界长周期浏览器智能体的统一框架,引入了BrowserBench基准测试,并在网络使用任务上实现了最先进的性能。
本文介绍了LittleLearner,一个用于研究LLM知识获取的受控沙箱,使用K-5课程过滤的数据集,发现诸如规模化和后训练等干预措施能增强范围内的性能,但无法提升范围外的能力。
本文提出在不执行昂贵 Rollout 的情况下预测 LLM 智能体的任务难度,在 17 个智能体基准上研究该问题,并表明 token 级熵是一种有用的预测信号。
本文介绍了MSRT,一个采用资源感知的语音编码器混合体(MoSE)的框架,以克服多对多语音到文本翻译中的多语言诅咒。该4B参数模型在45种语言上取得了最先进的结果,特别是在每种语言仅有10小时配对数据的情况下显著改善了低资源语音翻译。
本文认为简单地扩展多模态环境并不总能改善智能体训练,并提出了能力感知环境选择(AES)和分层难度课程(HDC),以在多样性和难度维度上更好地构建环境分布。
这篇arXiv论文介绍了CVPO,一种针对LLM的强化学习方法,它适应值方差以进行优势估计,并使用动态课程学习来匹配问题难度,在数学任务上取得了比VAPO更好的推理性能。