reinforcement-learning

标签

Cards List
#reinforcement-learning

校正优先级重放中的组内自我选择偏差

arXiv cs.LG ↗ · 2天前 缓存

本文识别了优先级经验回放中的组内自我选择偏差,并提出了兄弟感知方法来纠正结果分布扭曲,从而提高强化学习的学习效率。

0 人收藏 0 人点赞
#reinforcement-learning

Informed Masking:扩散大型语言模型中强化学习的结构感知扰动

arXiv cs.CL ↗ · 2天前 缓存

本文提出了Informed Masking(IM),一种针对扩散大型语言模型中强化学习的结构感知扰动方法,该方法优先处理下游令牌,提高了在数学和规划基准测试中的性能。

0 人收藏 0 人点赞
#reinforcement-learning

辨证、协同与安全:面向中医处方生成的结构化推理与知识驱动对齐

arXiv cs.CL ↗ · 2天前 缓存

本文提出一个渐进式四阶段框架,用于大语言模型生成中医处方,解决了结构化推理、纵向适应和安全合规方面的空白,其中一个7B模型在中医特定评估指标上零样本超越GPT-5。

0 人收藏 0 人点赞
#reinforcement-learning

ProcessLight: 面向基于大型语言模型的交通信号控制的过程监督

arXiv cs.AI ↗ · 2天前 缓存

ProcessLight 提出了一个基于大型语言模型的交通信号控制框架,该框架将决策分解为可验证的语义步骤,并采用逐步强化学习方法(STeP-PO)进行增强,以实现细粒度推理优化。

0 人收藏 0 人点赞
#reinforcement-learning

TelecomGPT-R1: 用于异构电信任务推理的统一后训练

arXiv cs.CL ↗ · 2天前 缓存

TelecomGPT-R1是一系列用于统一电信推理的开源模型,通过监督微调和强化学习训练,在基准测试中超越GPT-5等专有模型。

0 人收藏 0 人点赞
#reinforcement-learning

AutoGym:蓝图优先的可验证智能体训练环境生成

arXiv cs.AI ↗ · 2天前 缓存

AutoGym提出一个框架,通过蓝图优先生成,从最小种子自动生成完整的智能体训练环境(包括任务、可执行环境和验证器),以确保可解性并实现主动课程综合,用于自适应难度调控。

0 人收藏 0 人点赞
#reinforcement-learning

DeepSeek Elastic Compute (DSec):面向大规模有效代理训练的沙盒基础设施

Lobsters Hottest ↗ · 2天前 缓存

DeepSeek Elastic Compute (DSec) 是专为大规模大语言模型有效代理训练设计的沙盒基础设施,具备弹性执行、统一SDK,并支持与强化学习框架集成。

0 人收藏 0 人点赞
#reinforcement-learning

可验证的隐藏动态玩法:从已解决机制生成智能体强化学习环境

Hugging Face Daily Papers ↗ · 2天前 缓存

本文介绍了VHD-Play,一个通过首先解决数学模型来生成多样化智能体强化学习环境的流程,显著提高了像Qwen3.6-35B-A3B这样的语言模型代理的训练效率,且成本低廉,并扩展到外部基准测试。

0 人收藏 0 人点赞
#reinforcement-learning

@TheAhmadOsman:正在为 MiMo-V2.6-Pro-RL 准备这8台 RTX PRO 6000 强悍显卡

X AI KOLs Following ↗ · 2天前 缓存

一条推文描述了为 MiMo-V2.6-Pro-RL AI 模型准备八张 RTX PRO 6000 显卡。

0 人收藏 0 人点赞
#reinforcement-learning

关于Mimo 2.6架构

Reddit r/LocalLLaMA ↗ · 2天前

一位用户在Hugging Face上讨论了Mimo 2.6 AI模型的简单架构,将其与更复杂的近期模型进行比较,并将其性能归功于有效的强化学习。

0 人收藏 0 人点赞
#reinforcement-learning

@seclink: 确实不错,最近 mimo 发布 2.6 flash 了,我也快速用上了。

X AI KOLs Timeline ↗ · 2天前 缓存

MiMo 发布了 2.6 flash 版本,并引用了 Tianjun Zhang 关于在 TPUs 上使用 JAX 扩展强化学习的博客文章。

0 人收藏 0 人点赞
#reinforcement-learning

@samuel_ys92: Bonnie Li 24岁,曾贡献于Gemini、Genie和SIMA,现已加入OpenAI。Bonnie Li宣布在S…

X AI KOLs Timeline ↗ · 3天前 缓存

Bonnie Li,一位24岁的AI研究员,曾在Google DeepMind参与Gemini、Genie和SIMA项目,现已加入OpenAI担任研究科学家,致力于对齐超级智能。

0 人收藏 0 人点赞
#reinforcement-learning

SFT与RL的精妙配比:当强化学习赋能长期广告代理

arXiv cs.LG ↗ · 3天前 缓存

本文提出了一种平衡监督微调和强化学习的方法,用于训练长期广告代理,表明定向RL可以减少数据泄露,并提升企业分析任务的性能。

0 人收藏 0 人点赞
#reinforcement-learning

超越任务完成:训练有能力且安全的计算机使用智能体

arXiv cs.LG ↗ · 3天前 缓存

本文介绍SCOPE,一种用于计算机使用智能体的联合训练方法,它利用合成数据集,提升了任务完成度和安全性,并在基准测试OSWorld和OS-BLIND上取得了优异性能。

0 人收藏 0 人点赞
#reinforcement-learning

对比世界模型

arXiv cs.LG ↗ · 3天前 缓存

对比世界模型提出了一种新方法,无需像素重建即可学习潜在动态,并通过对比目标来提高在视觉复杂环境中的鲁棒性和效率,适用于基于模型的强化学习。

0 人收藏 0 人点赞
#reinforcement-learning

GRRR:解码器LLM后训练中的重塑、旋转与路由几何

arXiv cs.LG ↗ · 3天前 缓存

本文利用奇异值分解分析LLM的后训练权重更新,识别出驱动性能提升的几何成分,表明重塑奇异值不如旋转和路由变化关键。

0 人收藏 0 人点赞
#reinforcement-learning

Team DArgk 在 2026 ELOQUENT 实验室评估生成语言模型质量:人性的残留——通过GRPO微调逃避AI检测

arXiv cs.CL ↗ · 3天前 缓存

本文介绍了SHADE,一个使用GRPO微调的强化学习框架,旨在逃避AI文本检测器,在对抗替代检测器时实现了高逃避率,但对未见过的评估分类器的迁移效果有限。

0 人收藏 0 人点赞
#reinforcement-learning

@svlevine: 如何使用实时分块(RTC)运行强化学习?在这项工作中,我们找到了方法,用小型强化学习策略配合大型机器人基础模型……

X AI KOLs Following ↗ · 3天前 缓存

一项研究合作介绍了ARLI,这是一种通过异步推理使用实时分块来启用视觉-语言-动作模型的强化学习微调的方法,通过让强化学习策略观察更近期的图像来改善机器人行为。

0 人收藏 0 人点赞
#reinforcement-learning

@sleepy0x13: Luo Fuli 刚写了一篇关于MiMo-V2.6的很长的回顾文章。通读全文后,它实际上在探讨一个…

X AI KOLs Timeline ↗ · 3天前 缓存

Luo Fuli关于MiMo-V2.6的回顾文章详细介绍了小米在扩展智能体强化学习方面的创新,重点关注了扩展的环境、集成的工具集和改进的评分系统,从而显著提升了智能体的能力。

0 人收藏 0 人点赞
#reinforcement-learning

PACT:从信用分配到评论家对齐

Hugging Face Daily Papers ↗ · 3天前 缓存

该论文为大型语言模型强化学习中的令牌级信用制定了正则条件,并介绍了策略对齐评论家训练(PACT),该方法在数学推理和编码基准测试中优于GRPO和PPO。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈