reinforcement-learning

标签

Cards List
#reinforcement-learning

基于反事实约束的多约束指令跟随在线策略蒸馏

arXiv cs.LG ↗ · 昨天 缓存

本文提出CC-OPD,一种用于多约束指令跟随的新颖在线策略蒸馏方法,该方法使用反事实消融来增强训练信号,实现更优性能,其中1.5B模型在基准测试中超越其7B教师模型。

0 人收藏 0 人点赞
#reinforcement-learning

WTF?! 基于Wasserstein倾斜流图的无模拟强化学习

arXiv cs.LG ↗ · 昨天 缓存

本文提出Wasserstein-Tilted Flow Maps(WTF),一种无需模拟的强化学习算法,用于微调基于流的生成模型以增强奖励对齐效果。该方法可在减少高达280倍计算量的情况下,实现比基线方法更高的奖励值。

0 人收藏 0 人点赞
#reinforcement-learning

多目标强化学习中后见重标注所致Preference Coverage Collapse研究

arXiv cs.LG ↗ · 昨天 缓存

本文识别出'Preference Coverage Collapse'作为多目标强化学习后见重标注中的一种失败模式,并引入'her_mix'来缓解该问题,从而在各种设置下提升性能。

0 人收藏 0 人点赞
#reinforcement-learning

部分正确的工具缓存可能逆转组归一化策略更新

arXiv cs.LG ↗ · 昨天 缓存

本文表明,在强化学习中,工具结果缓存即使只是略有正确,也可能逆转预期的组归一化策略更新,这一点通过数学分析和两个动作模型的实验得到了证实。

0 人收藏 0 人点赞
#reinforcement-learning

学习激活什么:面向长期多模态智能体的组合能力分配

arXiv cs.AI ↗ · 昨天 缓存

本文介绍CoCA,一种用于长期多模态智能体动态能力分配的on-policy学习框架,通过条件比较和强化学习来解决计算开销和阶段依赖需求。

0 人收藏 0 人点赞
#reinforcement-learning

环境群胚的范畴内化在可推广POMDP求解中的应用

arXiv cs.AI ↗ · 昨天 缓存

本文倡导使用范畴论和环境群胚来结构化部分可观测环境中的强化学习,利用对称性以提高样本效率和泛化能力。

0 人收藏 0 人点赞
#reinforcement-learning

SkillGym:使大语言模型内化人类技能以解决现实问题

arXiv cs.CL ↗ · 昨天 缓存

SkillGym 将人类编写的智能体技能转化为可执行的训练环境,供大语言模型使用,从而实现监督微调和强化学习,以增强解决现实问题的能力和在基准测试中的性能。

0 人收藏 0 人点赞
#reinforcement-learning

Planned Test-Time Scaling 与协调推理路径

arXiv cs.CL ↗ · 昨天 缓存

本文提出 Planned Test-Time Scaling (PTTS),一种通过协调推理分支来提升挑战性任务性能的方法,在数学推理基准测试中相比重复采样取得了显著提升。

0 人收藏 0 人点赞
#reinforcement-learning

恰当地归因:用于高效推理的冗余感知学习

arXiv cs.CL ↗ · 昨天 缓存

本文介绍了 RECAP,一种冗余感知学习方法,通过根据步骤的结构角色和效能分配信用,提升了大型推理模型的效率,在提高准确性的同时减少了令牌使用量。

0 人收藏 0 人点赞
#reinforcement-learning

分解子任务强化学习 (RLDS)

arXiv cs.AI ↗ · 昨天 缓存

本文介绍了基于分解子任务的强化学习(RLDS),该方法将轨迹奖励分解为每个子任务的优势,以改进语言模型智能体强化学习中的信用分配,并在高异质性智能体基准测试上显示出显著提升。

0 人收藏 0 人点赞
#reinforcement-learning

@dair_ai: Salesforce 发表的一篇令人印象深刻的论文。它讨论了良好验证器对强化学习环境的重要性。只有 35.8% 的 …

X AI KOLs Timeline ↗ · 昨天 缓存

来自 Salesforce 的这篇论文审计了用于终端智能体的公共强化学习环境,发现了重大缺陷,并介绍了 RIVER,一种训练方案,它过滤有缺陷的环境并惩罚重复行为以提升模型性能。

0 人收藏 0 人点赞
#reinforcement-learning

Rufus-Air:一个开放的LLM后训练配方

Hugging Face Daily Papers ↗ · 昨天 缓存

Rufus-Air 是一个开放且可复现的LLM后训练配方,详细描述了一个八阶段的流程,从基础到高级增强能力,相比现有模型如GLM-4.5-Air-Base有所改进。

0 人收藏 0 人点赞
#reinforcement-learning

Qwen-Planner-Agent:一个用于真实世界移动规划智能体的AI-for-AI闭环框架

Hugging Face Daily Papers ↗ · 昨天 缓存

本文介绍了Qwen-Planner-Agent,一个用于移动规划智能体可扩展开发的AI-for-AI闭环框架,整合了数据生成、训练和部署,以提升在真实世界任务和基准测试中的性能。

0 人收藏 0 人点赞
#reinforcement-learning

IterSynth: 重新审视基于角色解耦迭代合成的深度搜索代理

Hugging Face Daily Papers ↗ · 昨天 缓存

IterSynth介绍了一种针对深度搜索代理的角色解耦迭代合成范式,利用强化学习提高在长时搜索任务中的性能,并在基准测试中超越先前方法。

0 人收藏 0 人点赞
#reinforcement-learning

迈向机器人技术的通用后训练(18分钟阅读)

TLDR AI ↗ · 昨天 缓存

文章认为,机器人技术需要类似语言模型的后训练以实现高可靠性,并探讨了机器人系统中通用后训练面临的挑战和潜在方法。

0 人收藏 0 人点赞
#reinforcement-learning

Skild AI 通过模拟140年与自身过去版本的对练,训练了Unitree G1机器人踢足球。

Reddit r/singularity ↗ · 昨天

Skild AI 通过模拟140年与自身过去版本的对练,训练了Unitree G1机器人踢足球,展示了人工智能和机器人技术的重大进展。

0 人收藏 0 人点赞
#reinforcement-learning

针对智能电表隐私的多种推理攻击防御策略学习

arXiv cs.LG ↗ · 2天前 缓存

本文提出了一种代理引导分层强化学习框架,通过学习基于电池的负载整形策略来干扰非侵入式负载监测模式,从而防御针对智能电表数据的多种推理攻击。

0 人收藏 0 人点赞
#reinforcement-learning

校正优先级重放中的组内自我选择偏差

arXiv cs.LG ↗ · 2天前 缓存

本文识别了优先级经验回放中的组内自我选择偏差,并提出了兄弟感知方法来纠正结果分布扭曲,从而提高强化学习的学习效率。

0 人收藏 0 人点赞
#reinforcement-learning

Informed Masking:扩散大型语言模型中强化学习的结构感知扰动

arXiv cs.CL ↗ · 2天前 缓存

本文提出了Informed Masking(IM),一种针对扩散大型语言模型中强化学习的结构感知扰动方法,该方法优先处理下游令牌,提高了在数学和规划基准测试中的性能。

0 人收藏 0 人点赞
#reinforcement-learning

辨证、协同与安全:面向中医处方生成的结构化推理与知识驱动对齐

arXiv cs.CL ↗ · 2天前 缓存

本文提出一个渐进式四阶段框架,用于大语言模型生成中医处方,解决了结构化推理、纵向适应和安全合规方面的空白,其中一个7B模型在中医特定评估指标上零样本超越GPT-5。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈