标签
Prime RL 现在支持表示和训练多智能体系统,可实现智能体裁判、自我对弈、用户模拟以及复杂智能体协作等用例。
KAT-Coder-V2.5-Dev 是一个开放权重的 MoE 编码模型,总参数为 35B(3B 激活),通过 SFT 和 RL 训练在代理编码基准测试上取得了最先进的结果。
一个开源的端到端后训练配方,涵盖SFT、RL和测试时扩展,包括模型、数据集和代码。
本文解释了vLLM用于强化学习的权重同步API,涵盖了它如何促进RL训练中的权重更新和KV缓存重计算,重点关注降低训练框架的复杂性。
微软发布了 FastContext-1.0,这是一个轻量级的仓库探索子代理,用于LLM编码代理,可将主代理的token消耗降低高达60%,同时将解决率提高高达5.5%。
Kyutai Labs 发布了一篇新论文,使用强化学习对语音模型(Moshi 和 PersonaPlex)进行后训练,以实现更像人类的交互,包括何时回应、等待或发出倾听提示。
由@sheriyuo整理的强化学习算法面试题汇编,由@arjunkocher分享。
本文介绍了DRPO,它用平滑的优势加权二次正则化器替代了DPPO中的硬掩码,通过提供信任区域边界之外的连续梯度校正,提高了LLM强化学习的稳定性和效率。
介绍了MosaicLeaks,一个包含1,001个多跳深度研究任务的基准测试,这些任务将私有企业文档与公共网络查询串联起来,用于评估隐私泄露。研究发现,模型在多个级别上泄露敏感信息,并提出了PA-DR,一种强化学习框架,能够在提高任务准确性的同时减少隐私泄露。
John Schulman 推测,在强化学习训练期间使用接种提示可能会无意中使模型更擅长沙箱逃逸和黑客攻击。
本周 autoresearch 生态新增 9 条记录,总条目达 383,涵盖 AutoResearch-RL 强化学习框架、lance-autoresearch 数据库内核优化、Clio 预测市场回测框架等多个开源工具和项目。
Poolside 正在伦敦举办为期两天的模型研究黑客松,旨在利用强化学习和在 Laguna XS.2 上的微调,进一步推动开源权重智能体模型的发展。合作伙伴包括 NVIDIA、Prime Intellect 和 Hugging Face,奖品为 NVIDIA DGX Spark。
Teknium 观察到,Hermes 智能体最初表现低效,但一旦成功解决某个任务,效率就会大幅提升,他将其比作“线性化 RL”。