rl

标签

Cards List
#rl

@samsja19:Prime RL 现在可以表示和训练多智能体系统,支持智能体裁判、自我对弈、用户模拟等用例…

X AI KOLs Following · 2天前 缓存

Prime RL 现在支持表示和训练多智能体系统,可实现智能体裁判、自我对弈、用户模拟以及复杂智能体协作等用例。

0 人收藏 0 人点赞
#rl

Kwaipilot/KAT-Coder-V2.5-Dev

Hugging Face Models Trending · 2026-07-23 缓存

KAT-Coder-V2.5-Dev 是一个开放权重的 MoE 编码模型,总参数为 35B(3B 激活),通过 SFT 和 RL 训练在代理编码基准测试上取得了最先进的结果。

0 人收藏 0 人点赞
#rl

@adithya_s_k: [必读] 我不知道这怎么会逃过我的注意。这可能是最好的开源端到端后训练…

X AI KOLs Timeline · 2026-07-08 缓存

一个开源的端到端后训练配方,涵盖SFT、RL和测试时扩展,包括模型、数据集和代码。

0 人收藏 0 人点赞
#rl

深度强化学习评估与设计范式的原则性分析

Hugging Face Daily Papers · 2026-07-08 缓存

本文分析了深度强化学习中的评估与设计范式,展示了经典范式可能导致错误结论,并提供了关于扩展性、容量和复杂性的见解。

0 人收藏 0 人点赞
#rl

@kazukifujii: 这篇vLLM博客文章以非常清晰和图示化的方式解释了强化学习中的权重更新和KV缓存重计算,还涵盖了…

X AI KOLs Timeline · 2026-06-22 缓存

本文解释了vLLM用于强化学习的权重同步API,涵盖了它如何促进RL训练中的权重更新和KV缓存重计算,重点关注降低训练框架的复杂性。

0 人收藏 0 人点赞
#rl

microsoft/FastContext-1.0-4B-SFT

Hugging Face Models Trending · 2026-06-14 缓存

微软发布了 FastContext-1.0,这是一个轻量级的仓库探索子代理,用于LLM编码代理,可将主代理的token消耗降低高达60%,同时将解决率提高高达5.5%。

0 人收藏 0 人点赞
#rl

@kyutai_labs: 新论文:全双工语音模型中的多面互动对齐 我们使用强化学习对语音模型(Mo…

X AI KOLs Following · 2026-06-10 缓存

Kyutai Labs 发布了一篇新论文,使用强化学习对语音模型(Moshi 和 PersonaPlex)进行后训练,以实现更像人类的交互,包括何时回应、等待或发出倾听提示。

0 人收藏 0 人点赞
#rl

@arjunkocher: RL算法面试题2026(由@sheriyuo整理)http://k-a.in/rl-algo.html

X AI KOLs Timeline · 2026-06-08 缓存

由@sheriyuo整理的强化学习算法面试题汇编,由@arjunkocher分享。

0 人收藏 0 人点赞
#rl

重新思考LLM强化学习中的散度正则化

Hugging Face Daily Papers · 2026-06-08 缓存

本文介绍了DRPO,它用平滑的优势加权二次正则化器替代了DPPO中的硬掩码,通过提供信任区域边界之外的连续梯度校正,提高了LLM强化学习的稳定性和效率。

0 人收藏 0 人点赞
#rl

MosaicLeaks:深度研究代理在公开查询中的隐私风险

arXiv cs.CL · 2026-06-01 缓存

介绍了MosaicLeaks,一个包含1,001个多跳深度研究任务的基准测试,这些任务将私有企业文档与公共网络查询串联起来,用于评估隐私泄露。研究发现,模型在多个级别上泄露敏感信息,并提出了PA-DR,一种强化学习框架,能够在提高任务准确性的同时减少隐私泄露。

0 人收藏 0 人点赞
#rl

@johnschulman2: 如果接种提示导致模型在沙箱逃逸和其他黑客攻击方面变得更强,那将会很有趣……

X AI KOLs Timeline · 2026-05-31

John Schulman 推测,在强化学习训练期间使用接种提示可能会无意中使模型更擅长沙箱逃逸和黑客攻击。

0 人收藏 0 人点赞
#rl

@yibie: 本周 autoresearch 生态证据扫描:新增 9 条记录,总条目数达 383。 AutoResearch-RL:带 http://prepare.py/train.py 隔离的持续 RL 研究框架,支持 LLM/混合策略实验调度 l…

X AI KOLs Timeline · 2026-05-26 缓存

本周 autoresearch 生态新增 9 条记录,总条目达 383,涵盖 AutoResearch-RL 强化学习框架、lance-autoresearch 数据库内核优化、Clio 预测市场回测框架等多个开源工具和项目。

0 人收藏 0 人点赞
#rl

@poolsideai:Poolside 正在伦敦举办为期两天的模型研究黑客松。加入我们,尽可能推动开源权重智能体模型的发展……

X AI KOLs Following · 2026-05-13

Poolside 正在伦敦举办为期两天的模型研究黑客松,旨在利用强化学习和在 Laguna XS.2 上的微调,进一步推动开源权重智能体模型的发展。合作伙伴包括 NVIDIA、Prime Intellect 和 Hugging Face,奖品为 NVIDIA DGX Spark。

0 人收藏 0 人点赞
#rl

@Teknium:有趣的洞见,尤其是这句:Hermes 刚起步时和任何智能体一样低效,常常不知道该如何完成训练时没先验的任务……

X AI KOLs Following · 2026-04-19 缓存

Teknium 观察到,Hermes 智能体最初表现低效,但一旦成功解决某个任务,效率就会大幅提升,他将其比作“线性化 RL”。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈