curriculum-learning

标签

Cards List
#curriculum-learning

用于演化角色扮演智能体的对抗性闭环课程

arXiv cs.AI ↗ · 昨天 缓存

本文提出AdvRole,一种用于训练大型语言模型中角色扮演智能体的对抗性闭环课程框架,该框架通过演化场景池以提升在基准测试上的性能。

0 人收藏 0 人点赞
#curriculum-learning

重新思考基于长度的训练:语音标记语言模型中的批次组成与损失归一化

arXiv cs.CL ↗ · 3天前 缓存

本文系统分析了语音标记语言模型中基于长度的训练,表明在批次组成和标记暴露固定的情况下,短到长排序无独立益处,并评估了损失归一化的影响。

0 人收藏 0 人点赞
#curriculum-learning

Spatial-Interactor: 通过与可观测物理世界的交互学习空间推理

arXiv cs.AI ↗ · 3天前 缓存

Spatial-Interactor是一个框架,通过与物理世界的交互训练视觉语言模型以增强空间推理能力,采用三级课程和两阶段训练策略来改进状态转移建模和长期集成。

0 人收藏 0 人点赞
#curriculum-learning

视觉语音识别中基于课程学习的音素到文本重构噪声适应

arXiv cs.CL ↗ · 5天前 缓存

本文提出渐进式错误课程训练(PECT),通过逐步适应现实中的音素预测错误,提高视觉语音识别中音素到文本重构的鲁棒性,在LRS2和LRS3基准测试上实现了词错误率的降低。

0 人收藏 0 人点赞
#curriculum-learning

DeliveryGym:用于自适应课程的长期具身智能体规划强化学习环境

arXiv cs.LG ↗ · 2026-09-18 缓存

DeliveryGym是一个用于自适应课程的长期具身智能体规划的3D强化学习环境,通过强化学习展示了性能提升。

0 人收藏 0 人点赞
#curriculum-learning

自主思维学习:抽象令牌课程

arXiv cs.LG ↗ · 2026-09-18 缓存

论文提出了抽象令牌课程(ATC),一种课程学习框架,能够在无需直接监督的情况下,在大型语言模型(LLMs)中引出有效的连续中间表示,并提供了理论和实验证据。

0 人收藏 0 人点赞
#curriculum-learning

分层课程学习用于高效大语言模型压缩

arXiv cs.LG ↗ · 2026-09-18 缓存

本文提出了一种分层课程学习方法,用于高效压缩大语言模型,该方法以显著降低GPU内存占用和训练时间,实现了最先进性能。

0 人收藏 0 人点赞
#curriculum-learning

固定状态递归中联想记忆的解剖:匹配状态分解、干扰壁垒与破解它的课程学习

arXiv cs.LG ↗ · 2026-09-16 缓存

本文分解了固定状态递归网络中的联想记忆,发现卷积和课程学习对性能至关重要,并提出了针对干扰而非容量限制的干预措施。

0 人收藏 0 人点赞
#curriculum-learning

解锁不可解难题:教师引导的课程学习实现数据高效RLVR

arXiv cs.CL ↗ · 2026-09-15 缓存

本文介绍了一种教师引导的课程学习方法,用于强化学习与可验证奖励(RLVR),以高效训练语言模型处理初始不可解的数学问题,实现显著的数据效率并扩展推理边界。

0 人收藏 0 人点赞
#curriculum-learning

SEAR:面向弱到强多语言语音选择题的片段证据感知路由

arXiv cs.CL ↗ · 2026-09-11 缓存

本文介绍了SEAR系统,用于多语言语音选择题,通过片段证据感知路由、监督微调和强化学习,在MLC-SLM挑战赛中实现了90.92%的准确率。

0 人收藏 0 人点赞
#curriculum-learning

强化学习中的主动课程优化

arXiv cs.LG ↗ · 2026-08-28 缓存

本文介绍了PATH,一个用于强化学习中主动课程优化的框架,该框架利用课程图结构来提高在不同环境中的鲁棒性和泛化能力。

0 人收藏 0 人点赞
#curriculum-learning

课程感知的插值-然后精炼:在现实缺失条件下的学习生理时间序列插补

arXiv cs.LG ↗ · 2026-08-24 缓存

本文介绍了CAIR,一个在现实缺失条件下用于生理时间序列数据插补的两阶段框架,通过纳入间隔机制和课程感知训练,超越了现有方法。

0 人收藏 0 人点赞
#curriculum-learning

动态上下文调度:超越静态环境的学习

arXiv cs.AI ↗ · 2026-08-24 缓存

该论文提出动态上下文调度方法,旨在增强上下文强化学习的泛化能力,实验表明在模拟环境中在分布外和分布内区域均实现性能提升。

0 人收藏 0 人点赞
#curriculum-learning

基于跨难度优化动态的大语言模型课程学习研究

arXiv cs.LG ↗ · 2026-08-19 缓存

本文通过分析不同难度水平间的优化动态,研究大语言模型中的课程学习,并提出一种名为迁移感知动态课程采样(TDCS)的新方法,该方法基于迁移关系动态调整训练数据。

0 人收藏 0 人点赞
#curriculum-learning

无影-浏览器代理:以真实世界为核心的基础长周期浏览器智能体

arXiv cs.AI ↗ · 2026-08-19 缓存

无影-浏览器代理是一个面向真实世界长周期浏览器智能体的统一框架,引入了BrowserBench基准测试,并在网络使用任务上实现了最先进的性能。

0 人收藏 0 人点赞
#curriculum-learning

当LLM从未接触过五年级以上材料时会怎样?

Hacker News Top ↗ · 2026-08-16 缓存

本文介绍了LittleLearner,一个用于研究LLM知识获取的受控沙箱,使用K-5课程过滤的数据集,发现诸如规模化和后训练等干预措施能增强范围内的性能,但无法提升范围外的能力。

0 人收藏 0 人点赞
#curriculum-learning

无需 Rollout 的任务难度预测

arXiv cs.LG ↗ · 2026-08-07 缓存

本文提出在不执行昂贵 Rollout 的情况下预测 LLM 智能体的任务难度,在 17 个智能体基准上研究该问题,并表明 token 级熵是一种有用的预测信号。

0 人收藏 0 人点赞
#curriculum-learning

基于资源感知的语音编码器混合体打破多对多语音到文本翻译中的多语言诅咒

arXiv cs.CL ↗ · 2026-08-06 缓存

本文介绍了MSRT,一个采用资源感知的语音编码器混合体(MoSE)的框架,以克服多对多语音到文本翻译中的多语言诅咒。该4B参数模型在45种语言上取得了最先进的结果,特别是在每种语言仅有10小时配对数据的情况下显著改善了低资源语音翻译。

0 人收藏 0 人点赞
#curriculum-learning

超越单纯的环境扩展:为多模态智能体学习设计有效的环境分布

Hugging Face Daily Papers ↗ · 2026-08-06 缓存

本文认为简单地扩展多模态环境并不总能改善智能体训练,并提出了能力感知环境选择(AES)和分层难度课程(HDC),以在多样性和难度维度上更好地构建环境分布。

0 人收藏 0 人点赞
#curriculum-learning

CVPO:通过值方差适应与动态课程学习增强LLM强化学习推理

arXiv cs.CL ↗ · 2026-08-05 缓存

这篇arXiv论文介绍了CVPO,一种针对LLM的强化学习方法,它适应值方差以进行优势估计,并使用动态课程学习来匹配问题难度,在数学任务上取得了比VAPO更好的推理性能。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈