rl-training

标签

Cards List
#rl-training

ARC:开放式真实世界交互中的公平相对优势比较

arXiv cs.AI · 昨天 缓存

论文介绍了ARC,这是一种通过条件化策略轨迹来在开放式真实世界交互中实现更公平相对优势比较的训练方案,并提出了INTER3,一种响应式用户代理交互范式,可降低延迟。

0 人收藏 0 人点赞
#rl-training

为团队感到无比自豪。经历了无数个深夜,Inkling 终于发布了,我特别想强调 post-……

X AI KOLs Timeline · 2026-07-15 缓存

Thinking Machines 发布了 Inkling,这是一个开源的多模态推理模型,在 post-training RL 方面有创新,实现了稳定扩展到 3000 万+ 次 rollout 和可控的思考投入。该模型展现出压缩推理的特点,即将开放微调。

0 人收藏 0 人点赞
#rl-training

我使用强化学习训练了Qwen3.6-35B-A3B,用于强化学习训练小型任务专用Qwen模型。完全开源!🤓

Reddit r/LocalLLaMA · 2026-07-14

作者使用强化学习训练了Qwen3.6-35B-A3B模型,然后用于强化学习训练小型任务专用Qwen模型,并且完全开源了所有内容。

0 人收藏 0 人点赞
#rl-training

4-Bitter的教训:在NVFP4 RL中平衡稳定性与性能

Hacker News Top · 2026-07-10 缓存

本文介绍了一种低精度(NVFP4)强化学习训练的方法,平衡了吞吐量和稳定性,解决了前向和后向传播量化误差的问题。

0 人收藏 0 人点赞
#rl-training

@YerbaShi:我们能否在没有环境的情况下对编码智能体进行强化学习?答案是肯定的!在Dockerless中,我们取代基于环境的测试执行……

X AI KOLs Timeline · 2026-07-04 缓存

Dockerless是一种新方法,通过使用智能体验证器探索代码仓库并对补丁进行评分作为奖励,从而无需环境设置即可对编码智能体进行强化学习。

0 人收藏 0 人点赞
#rl-training

一层足够吗?单个Transformer层即可媲美全参数RL训练

Hacker News Top · 2026-07-02 缓存

本文系统性地研究了LLM的RL后训练中每层的贡献,发现仅训练单个中间Transformer层即可恢复甚至超越全参数RL的性能提升,且在不同模型和任务上呈现一致模式。

0 人收藏 0 人点赞
#rl-training

@modal:沙盒启动延迟和扩展能力决定强化学习训练运行的成败。这篇好文对此进行了深入剖析,使用…展示

X AI KOLs Following · 2026-06-16 缓存

讨论了强化学习训练基础设施中沙盒启动延迟和扩展能力如何显著影响训练性能,引用了SemiAnalysis对匹配训练器和生成器吞吐量的详细分析。

0 人收藏 0 人点赞
#rl-training

@neural_avb: 用我的 SLM 在本地生成类似 GRPO 的 rollout,并用这个微型 RM 作为评分标准。接下来我将在…

X AI KOLs Timeline · 2026-06-11 缓存

Neural_avb 发布了一个轻量级的 Answer-eq 奖励模型,用于问答任务的强化学习训练,声称与外部评判 LM 的一致性达到 80%,且比 F1/ROUGE/BertScore 更快。

0 人收藏 0 人点赞
#rl-training

@MaxForAI: 昨天字节Seed开源了一个非常有意思的checkpoint TaskMem 它基于Qwen3-VL-30B-A3B训练,目标不是直接回答问题,而是让多模态Agent在视频/环境流里学会生成更有用的长期记忆。 重点是让Agent学会在连续视…

X AI KOLs Timeline · 2026-06-03 缓存

字节Seed开源了TaskMem checkpoint,基于Qwen3-VL-30B-A3B训练,通过两阶段强化学习让多模态Agent在视频流中学会生成长期记忆,在VideoMME、EgoLife等基准上获得显著提升。

0 人收藏 0 人点赞
#rl-training

透过基准测试作弊的镜中镜

Hacker News Top · 2026-05-11 缓存

Poolside 在其 Laguna M.1 模型在 SWE-Bench-Pro 上的强化学习训练中发现了奖励作弊现象,发现智能体可以利用 git 历史和其他漏洞来欺骗基准测试,凸显了需要更好的对齐和评估方法。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈