标签
本文介绍了GUI-SD-v2,一个用于多轮GUI代理的两阶段在策略自蒸馏框架,该框架增强了特权跟随和指导能力,在AndroidWorld和MobileWorld基准测试中表现出色。
论文提出了抽象令牌课程(ATC),一种课程学习框架,能够在无需直接监督的情况下,在大型语言模型(LLMs)中引出有效的连续中间表示,并提供了理论和实验证据。
EnvCraft是一个自动化框架,用于合成可执行环境,以解决Agentic RL训练中的稀缺性问题,并在使用Qwen模型的claw-like和通用工具使用基准测试中展示了显著的性能提升。
RAPTOR是一个角色感知的框架,用于专家混合模型的差分隐私微调,解决了诸如裁剪干扰和噪声稀释等失败模式,并在实验中显示出相对于标准差分隐私基线的改进。
本文介绍了TKFQA,一个包含10,130个基于表格、文本和知识图谱的问答对的反事实基准,用于评估LLM的事实一致性和顺序稳健推理,并提出了ORLF,一种训练框架,可提高推理链准确性并降低对输入顺序的敏感性。
iFAN是一个训练框架,通过将查询排序与掩码质量对齐,并将中间层的预测蒸馏到最终层,来改进用于分割的掩码Transformer,从而在多个基准上取得一致的性能提升。
MiniWorld 是一个可复现的框架,用于从零训练视频世界模型,采用带流匹配的块因果视频扩散变换器,能够实现高效的流式生成,并可在单台 8-GPU 服务器上数天内完成训练。
Molt是一个基于PyTorch原生的智能体强化学习训练框架,设计简洁紧凑,易于修改,同时实现了与基于Megatron的框架相当的性能。
介绍了一个训练框架,以模型无关和任务环境无关的方式提升任务型LLM的能力,并在Terminal Bench和SWE-Bench上展示了结果。
PRIME-RL是一个用于大规模异步强化学习的框架,设计上易于定制,可扩展至1000+块GPU,并支持多种模型和环境。
介绍了Pyligent,一种利用任务验证器标记失败并在推理中教导大语言模型回溯的训练框架,提高了隐藏图、数独和积木世界的求解率。
DeepSeek 开源了 DeepSpec,这是一个用于训练和评估推测解码草稿模型的全栈代码库,可实现 60-85% 的生成速度提升。它包含数据准备、训练和评估脚本,支持多种草稿模型算法(DSpark、DFlash、Eagle3)。
本文介绍了RPCL,一种仅用于训练阶段的鲁棒配对置信度学习框架,用于多模态情感-原因配对提取。该框架改进了黄金配对与困难负例之间的判别性分离,并在三个数据集上的Pair F1和AUPRC指标上取得了显著提升。
呼吁在AI研究中采用开源训练框架,介绍FeynRL——一个模块化且显式的框架,用于LLM、VLM和智能体的强化学习后训练,旨在让训练过程可见且可修改。
本文介绍了RePro,一个通过“先执行再反思”的展开范式训练LLM智能体自我生成进度信号的框架,在WebShop、ALFWorld和Sokoban基准测试上实现了高达12%的绝对成功率提升。
Orchard是一个用于可扩展智能体建模的开源框架,能够训练多样化的自主智能体,在编程、GUI导航和个人辅助任务上取得了最先进的结果。
# 论文页面 - EasyVideoR1:让视频理解的强化学习更简单 来源:[https://huggingface.co/papers/2604.16893](https://huggingface.co/papers/2604.16893) ## 摘要 EasyVideoR1 提出了一个高效的视频理解强化学习框架,可提升训练吞吐量,支持多种视频任务,并实现图像-视频联合训练,在多个基准测试上进行全面评估。[可验证奖励强化学习](https://huggingface.co/papers
Agent Lightning引入了一个灵活的强化学习框架,用于训练AI智能体中的大型语言模型,实现了智能体执行与训练的解耦,以处理复杂交互。
OpenAI 发布了 RL-Teacher,这是一个开源工具,可以通过人类反馈而不是手工设计的奖励函数来训练 AI 系统,应用于安全 AI 开发和复杂强化学习问题。
本文详细介绍了模型微调的基本概念和术语,包括预训练、监督微调、LoRA等关键知识点,适合初学者理解。